🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT Realtime vs GPT Realtime 2.1

vs

Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle

Texteingabe kostet auf beiden $4 pro Million, Audio $32 ein und $64 aus, Cache-Lesevorgänge $0.4; gpt-realtime-2.1 berechnet nur bei der Textausgabe mehr, $24 gegenüber $16, und vervierfacht den Sitzungskontext auf 128K von 32K. Es ergänzt außerdem konfigurierbaren Reasoning-Aufwand und Unterbrechungsbehandlung zum Function Calling des älteren Modells. Nehmen Sie gpt-realtime nur, um eine bestehende Integration zu halten — außer bei der Textausgabe kostet das neuere dasselbe.

Preise

GPT Realtime GPT Realtime 2.1 Δ
Audio-Input / 1M Token $32 $32 =
Audio-Output / 1M Token $64 $64 =
Audio-Cache-Read / 1M Token $0.4 $0.4 =
Text-Input / 1M Token $4 $4 =
Text-Output / 1M Token $16 $24 0.67×
Cache-Schreiben keine separate Gebühr keine separate Gebühr

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen — Preis pro 1M Audio-Tokens über alle 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

GPT Realtime GPT Realtime 2.1
Prompt-Caching implizit (automatisch) implizit (automatisch)
Cache-Lebensdauer 5–10m, up to 1h 5–10m, up to 1h
Minimales gecachtes Präfix 1024 Tokens 1024 Tokens

Spezifikationen

GPT Realtime GPT Realtime 2.1
Input-Modalitäten Text Audio Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2025-08-28 2026-07-06
Wissensgrenze 2023-10 2024-09
Session-Fähigkeiten
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Kontextfenster 32K 128K

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: GPT Realtime · GPT Realtime 2.1

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel holen →

FAQ

Welches ist günstiger, GPT Realtime oder GPT Realtime 2.1?

Sie listen dieselbe audio-input / 1m token ($32), daher ist der Preis hier nicht ausschlaggebend — siehe die Spezifikationen und Fähigkeiten unten.

Kann ich GPT Realtime gegen GPT Realtime 2.1 ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Unterstützen GPT Realtime und GPT Realtime 2.1 Prompt-Caching?

Ja — beide berechnen Cache-Reads günstiger als ihre Eingaberate, sodass Warm-Prefix-Workloads weniger kosten, als die Listenpreise vermuten lassen. Die genauen Zeilen für Cache-Reads befinden sich in der obigen Preistabelle.

Verwandte Vergleiche

Aus unseren gemessenen Studien