GPT Realtime 2.1 Mini ist das kosteneffiziente Mitglied von OpenAIs Realtime-Familie: ein destilliertes Reasoning-Modell für schnellere, günstigere Realtime-Sprachinteraktionen, das Reasoning und Tool-Nutzung in die Mini-Stufe bringt.
- Eingabe
- Audio Text $0.6/M
- Ausgabe
- Audio Text $2.4/M
- Audio-Input
- $10/M
- Audio-Output
- $20/M
- Cache-Read
- $0.06/M
- Knowledge Cutoff
- 2024-09
Preis im Vergleich
Preisposition unter 6 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 128.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 32.000 |
| Knowledge Cutoff | 2024-09 |
Prompt Caching
| Modus | automatisch |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | 5-10 Min., bis zu 1 Std. |
Realtime
| Sitzung | Speech-to-Speech mit Reasoning und Tool-Nutzung · Prompt-Caching · 128K Kontext |
|---|
Modell
| Modalitäten | Audio + Text → Audio + Text |
|---|
- Schnelleres, günstigeres destilliertes Realtime-Reasoning-Modell, das Reasoning und Tool-Nutzung in die Mini-Stufe bringt
- Prompt-Caching unterstützt
- 128k Kontext
GPT Realtime 2.1 Mini in 30 Sekunden nutzen
OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini", {
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol - use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini' <<'EOF'
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini", h)
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"), new WebSocket.Listener() {
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);Über GPT Realtime 2.1 Mini
- Es behält das Kontextfenster von 128K Token und die maximal 32K Output-Token der 2.1-Generation, unterstützt Function Calling und Prompt-Caching und bepreist Audio-Eingaben mit unter einem Drittel des Flaggschiff-Satzes.
- OpenAIs Empfehlung zur Wahl zwischen beiden ist direkt: das volle 2.1 nehmen, wenn man das stärkste Realtime-Reasoning, die stärkste Tool-Nutzung und Instruktionsbefolgung will, und dieses hier, wenn man eine schnellere, kosteneffizientere Option will.
- Es nimmt Audio- und Texteingaben über WebRTC, WebSocket oder SIP entgegen, sodass dieselben Transportoptionen und Sprachagenten-Muster gelten: stillebasierte oder semantische Turn-Erkennung, serverseitiges Abschneiden bei Unterbrechung, Tool-Deklarationen auf Sitzungs- oder Antwortebene.
- OpenAI berichtete für diese Version über die Realtime-Sprachmodelle hinweg von einer Reduktion der p95-Latenz um mindestens 25% durch verbessertes Caching.
- Es ist außerdem das benannte Migrationsziel für die früheren Mini-Realtime-Modelle, deren Abschaltung für Januar 2027 angesetzt ist.
- Das macht es zur natürlichen Wahl für dauerhaft laufende Sprachassistenten und kundenzugewandte Sprachagenten mit hohem Volumen.
- Synthorai stellt es über denselben OpenAI-kompatiblen /v1/realtime-WebSocket-Endpoint bereit wie den Rest der Realtime-Reihe.
FAQ
Lässt sich die GPT Realtime 2.1 Mini API kostenlos testen?
GPT Realtime 2.1 Mini befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.
Worin ist GPT Realtime 2.1 Mini am besten?
Destilliertes Reasoning für Realtime-Sprache; Audio-Eingabe unter einem Drittel des Flaggschiff-Satzes; behält 128K Kontext, Tools und Prompt-Caching. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GPT Realtime 2.1 Mini?
GPT Realtime 2.1 Mini kostet auf Synthorai $0.6 pro Million Input-Tokens und $2.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.06/M abgerechnet.
Wie rufe ich die GPT Realtime 2.1 Mini-API auf?
GPT Realtime 2.1 Mini ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).
Wie erhalte ich Zugang zu GPT Realtime 2.1 Mini?
GPT Realtime 2.1 Mini ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gpt-realtime-2.1-mini".
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.