Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

GPT Realtime vs GPT Realtime 2.1

GPT Realtime gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

GPT Realtime 2.1 gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

vs

Welches Modell wofür

Texteingabe kostet auf beiden $4 pro Million, Audio $32 ein und $64 aus, Cache-Lesevorgänge $0.4; gpt-realtime-2.1 berechnet nur bei der Textausgabe mehr, $24 gegenüber $16, und vervierfacht den Sitzungskontext auf 128K von 32K. Es ergänzt außerdem konfigurierbaren Reasoning-Aufwand und Unterbrechungsbehandlung zum Function Calling des älteren Modells. Nehmen Sie gpt-realtime nur, um eine bestehende Integration zu halten - außer bei der Textausgabe kostet das neuere dasselbe.

Benchmarks

GPT Realtime 2.1: Der Anbieter hat keine Benchmark-Werte veröffentlicht.

GPT Realtime: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.

GPT Realtime GPT Realtime 2.1 weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
AMI near+far field (WER)
35.9%
N/A
Big Bench Audio
82.8%
N/A
BFCL v3 (single-turn, python only)
80.4%
N/A

Anbieterangaben: Amazon OpenAI

Preise

GPT Realtime GPT Realtime 2.1 Δ
Audio-Eingabe / 1M Tokens $32 $32 =
Audio-Ausgabe / 1M Tokens $64 $64 =
Audio-Cache-Lesen / 1M Tokens $0.4 $0.4 =
Text-Eingabe / 1M Tokens $4 $4 =
Text-Ausgabe / 1M Tokens $16 $24 0.67×
Cache-Schreiben keine gesonderte Gebühr keine gesonderte Gebühr -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

GPT Realtime GPT Realtime 2.1
Prompt-Caching implizit (automatisch) implizit (automatisch)
Cache-Lebensdauer 5-10m, up to 1h 5-10m, up to 1h
Mindestlänge des gecachten Präfixes 1024 Tokens 1024 Tokens

Spezifikationen

GPT Realtime GPT Realtime 2.1
Eingabemodalitäten Text Audio Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2025-08-28 2026-07-06
Knowledge-Cutoff 2023-10 2024-09
Sitzungsfunktionen
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Kontextfenster 32K 128K

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT Realtime · GPT Realtime 2.1

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: GPT Realtime oder GPT Realtime 2.1?

Bei Audio-Eingabe / 1M Tokens kosten beide gleich viel ($32). Der Preis entscheidet hier also nichts; ausschlaggebend sind die Spezifikationen und Fähigkeiten weiter unten.

Kann ich GPT Realtime gegen GPT Realtime 2.1 A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen GPT Realtime und GPT Realtime 2.1 Prompt-Caching?

Ja. Beide berechnen Cache-Lesezugriffe günstiger als die normale Eingabe. Workloads mit einem wiederkehrenden, bereits gecachten Präfix kosten deshalb weniger, als die Listenpreise vermuten lassen. Die genauen Preise stehen in den Cache-Zeilen der Preistabelle oben.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen