GPT Realtime vs GPT Realtime 2.1
GPT Realtime gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.
GPT Realtime 2.1 gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.
Welches Modell wofür
Texteingabe kostet auf beiden $4 pro Million, Audio $32 ein und $64 aus, Cache-Lesevorgänge $0.4; gpt-realtime-2.1 berechnet nur bei der Textausgabe mehr, $24 gegenüber $16, und vervierfacht den Sitzungskontext auf 128K von 32K. Es ergänzt außerdem konfigurierbaren Reasoning-Aufwand und Unterbrechungsbehandlung zum Function Calling des älteren Modells. Nehmen Sie gpt-realtime nur, um eine bestehende Integration zu halten - außer bei der Textausgabe kostet das neuere dasselbe.
Benchmarks
GPT Realtime 2.1: Der Anbieter hat keine Benchmark-Werte veröffentlicht.
GPT Realtime: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.
Preise
| GPT Realtime | GPT Realtime 2.1 | Δ | |
|---|---|---|---|
| Audio-Eingabe / 1M Tokens | $32 | $32 | = |
| Audio-Ausgabe / 1M Tokens | $64 | $64 | = |
| Audio-Cache-Lesen / 1M Tokens | $0.4 | $0.4 | = |
| Text-Eingabe / 1M Tokens | $4 | $4 | = |
| Text-Ausgabe / 1M Tokens | $16 | $24 | 0.67× |
| Cache-Schreiben | keine gesonderte Gebühr | keine gesonderte Gebühr | - |
Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.
Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)
Fähigkeiten
| GPT Realtime | GPT Realtime 2.1 | |
|---|---|---|
| Prompt-Caching | implizit (automatisch) | implizit (automatisch) |
| Cache-Lebensdauer | 5-10m, up to 1h | 5-10m, up to 1h |
| Mindestlänge des gecachten Präfixes | 1024 Tokens | 1024 Tokens |
Spezifikationen
| GPT Realtime | GPT Realtime 2.1 | |
|---|---|---|
| Eingabemodalitäten | Text Audio | Text Audio |
| Ausgabemodalitäten | Text Audio | Text Audio |
| Veröffentlicht | 2025-08-28 | 2026-07-06 |
| Knowledge-Cutoff | 2023-10 | 2024-09 |
| Sitzungsfunktionen |
|
|
| Kontextfenster | 32K | 128K |
Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT Realtime · GPT Realtime 2.1
Eine Zeile genügt für den Wechsel
Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1" # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gpt-realtime", {
// const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1", { // diese Zeile einkommentieren, die darüberliegende auskommentieren
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol - use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=gpt-realtime' <<'EOF'
# 'wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1' <<'EOF' # diese Zeile einkommentieren, die darüberliegende auskommentieren
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gpt-realtime", h)
// c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1", h) // diese Zeile einkommentieren, die darüberliegende auskommentieren
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gpt-realtime"), new WebSocket.Listener() {
// .buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"), new WebSocket.Listener() { // diese Zeile einkommentieren, die darüberliegende auskommentieren
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);FAQ
Welches Modell ist günstiger: GPT Realtime oder GPT Realtime 2.1?
Bei Audio-Eingabe / 1M Tokens kosten beide gleich viel ($32). Der Preis entscheidet hier also nichts; ausschlaggebend sind die Spezifikationen und Fähigkeiten weiter unten.
Kann ich GPT Realtime gegen GPT Realtime 2.1 A/B-testen, ohne zweimal zu integrieren?
Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.
Unterstützen GPT Realtime und GPT Realtime 2.1 Prompt-Caching?
Ja. Beide berechnen Cache-Lesezugriffe günstiger als die normale Eingabe. Workloads mit einem wiederkehrenden, bereits gecachten Präfix kosten deshalb weniger, als die Listenpreise vermuten lassen. Die genauen Preise stehen in den Cache-Zeilen der Preistabelle oben.