GPT Realtime 2.1 Mini est le membre économique de la famille temps réel d'OpenAI : un modèle de raisonnement distillé pour des interactions vocales temps réel plus rapides et moins coûteuses, qui apporte le raisonnement et l'utilisation d'outils au palier mini.
- Entrée
- audio texte $0.6/M
- Sortie
- audio texte $2.4/M
- Entrée audio
- $10/M
- Sortie audio
- $20/M
- Lecture de cache
- $0.06/M
- Coupure des connaissances
- 2024-09
Le prix en contexte
Position du prix parmi 6 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 128 000 |
|---|---|
| Sortie max (spéc. fournisseur) | 32 000 |
| Coupure des connaissances | 2024-09 |
Mise en cache
| Mode | automatique |
|---|---|
| Préfixe min. | 1 024 |
| Durée de vie | 5-10 min, jusqu'à 1 heure |
Temps réel
| Session |
|
|---|
Modèle
| Modalités | audio + texte → audio + texte |
|---|
- Modèle de raisonnement temps réel distillé, plus rapide et moins cher, qui apporte le raisonnement et l'utilisation d'outils au palier mini
- mise en cache des prompts prise en charge
- contexte de 128k
Utilisez GPT Realtime 2.1 Mini en 30 secondes
Compatible OpenAI Realtime : connectez-vous en WebSocket, audio entrant et sortant. WS /v1/realtime
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini", {
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol - use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini' <<'EOF'
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini", h)
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"), new WebSocket.Listener() {
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);À propos de GPT Realtime 2.1 Mini
- Il conserve la fenêtre de contexte de 128K tokens et les 32K tokens de sortie maximale de la génération 2.1, prend en charge l'appel de fonctions et la mise en cache des prompts, et facture l'entrée audio à moins d'un tiers du tarif du modèle phare.
- La recommandation d'OpenAI pour choisir entre les deux est directe : prenez la version 2.1 complète quand vous voulez le raisonnement temps réel, l'utilisation d'outils et le suivi d'instructions les plus solides, et celui-ci quand vous voulez une option plus rapide et plus économique.
- Il accepte l'audio et le texte en entrée via WebRTC, WebSocket ou SIP, si bien que les mêmes choix de transport et les mêmes schémas d'agent vocal s'appliquent : détection de tour fondée sur le silence ou sémantique, troncature côté serveur à l'interruption, déclaration d'outils au niveau de la session ou de la réponse.
- OpenAI a signalé une réduction d'au moins 25 % de la latence p95 sur l'ensemble des modèles vocaux temps réel de cette version, grâce à une mise en cache améliorée.
- C'est aussi la cible de migration désignée pour les précédents modèles temps réel mini, dont l'arrêt est programmé en janvier 2027.
- Cela en fait le choix naturel pour les assistants vocaux permanents et les agents vocaux à fort volume en contact avec les clients.
- Synthorai l'expose via le même endpoint WebSocket /v1/realtime compatible OpenAI que le reste de la gamme temps réel.
FAQ
Peut-on essayer l'API GPT Realtime 2.1 Mini gratuitement ?
GPT Realtime 2.1 Mini est actuellement en bêta sur invitation : l'accès se fait sur candidature plutôt que par inscription ouverte. Faites la demande depuis la console Synthorai ; une fois approuvée, la tarification standard au paiement à l'usage s'applique, sans abonnement.
Quels sont les points forts de GPT Realtime 2.1 Mini ?
Raisonnement distillé pour la voix temps réel ; entrée audio à moins d'un tiers du tarif du modèle phare ; conserve 128K de contexte, outils et cache de prompts. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte GPT Realtime 2.1 Mini ?
Sur Synthorai, GPT Realtime 2.1 Mini coûte $0.6 par million de tokens en entrée et $2.4 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.06/M.
Comment appeler l'API GPT Realtime 2.1 Mini ?
GPT Realtime 2.1 Mini est un modèle speech-to-speech : connectez-vous en WebSocket à wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini avec le SDK OpenAI Realtime (ou un WebSocket brut) pour envoyer et recevoir de l'audio. Ce n'est pas un envoi de fichier POST /v1/audio/transcriptions. Authentifiez-vous avec votre clé sk-syn et n'envoyez que l'en-tête Authorization (le protocole beta est retiré).
Comment obtenir l'accès à GPT Realtime 2.1 Mini ?
GPT Realtime 2.1 Mini est en bêta sur invitation : demandez l'accès depuis la console Synthorai. Une fois la demande approuvée, il fonctionne comme tous les autres modèles : pointez votre SDK OpenAI vers base_url="https://synthorai.io/v1" et définissez model="gpt-realtime-2.1-mini".
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.