Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

GPT Realtime 2.1 gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

GPT Realtime 2.1 Mini gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

vs

Welches Modell wofür

Die mini-Stufe ist auf jeder Zeile günstiger - $0.6 und $2.4 pro Million Texttokens gegenüber $4 und $24, und $10 und $20 pro Million Audio ein und aus gegenüber $32 und $64 - also rund 3x weniger bei Audio und etwa 7x bei der Texteingabe. Beide tragen einen 128K-Sitzungskontext mit Sprache-zu-Sprache, Werkzeugnutzung und Prompt-Caching; das volle Modell dokumentiert zusätzlich konfigurierbaren Reasoning-Aufwand und Unterbrechungsbehandlung. Nehmen Sie das mini für Menge, das volle Modell, wenn Sie den Reasoning-Aufwand je Sitzung einstellen wollen.

Preise

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Audio-Eingabe / 1M Tokens $32 $10 3.2×
Audio-Ausgabe / 1M Tokens $64 $20 3.2×
Audio-Cache-Lesen / 1M Tokens $0.4 $0.3 1.3×
Text-Eingabe / 1M Tokens $4 $0.6 6.7×
Text-Ausgabe / 1M Tokens $24 $2.4 10×
Cache-Schreiben keine gesonderte Gebühr keine gesonderte Gebühr -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Prompt-Caching implizit (automatisch) implizit (automatisch)
Cache-Lebensdauer 5-10m, up to 1h 5-10m, up to 1h
Mindestlänge des gecachten Präfixes 1024 Tokens 1024 Tokens

Spezifikationen

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Eingabemodalitäten Text Audio Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2026-07-06 2026-07-06
Knowledge-Cutoff 2024-09 2024-09
Sitzungsfunktionen
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Kontextfenster 128K 128K

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: GPT Realtime 2.1 oder GPT Realtime 2.1 Mini?

GPT Realtime 2.1 Mini ist bei Audio-Eingabe / 1M Tokens günstiger ($10 vs. $32, Faktor 3.2). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich GPT Realtime 2.1 gegen GPT Realtime 2.1 Mini A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen GPT Realtime 2.1 und GPT Realtime 2.1 Mini Prompt-Caching?

Ja. Beide berechnen Cache-Lesezugriffe günstiger als die normale Eingabe. Workloads mit einem wiederkehrenden, bereits gecachten Präfix kosten deshalb weniger, als die Listenpreise vermuten lassen. Die genauen Preise stehen in den Cache-Zeilen der Preistabelle oben.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen