🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

vs

Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle

Die mini-Stufe ist auf jeder Zeile günstiger — $0.6 und $2.4 pro Million Texttokens gegenüber $4 und $24, und $10 und $20 pro Million Audio ein und aus gegenüber $32 und $64 — also rund 3x weniger bei Audio und etwa 7x bei der Texteingabe. Beide tragen einen 128K-Sitzungskontext mit Sprache-zu-Sprache, Werkzeugnutzung und Prompt-Caching; das volle Modell dokumentiert zusätzlich konfigurierbaren Reasoning-Aufwand und Unterbrechungsbehandlung. Nehmen Sie das mini für Menge, das volle Modell, wenn Sie den Reasoning-Aufwand je Sitzung einstellen wollen.

Preise

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Audio-Input / 1M Token $32 $10 3.2×
Audio-Output / 1M Token $64 $20 3.2×
Audio-Cache-Read / 1M Token $0.4 $0.3 1.3×
Text-Input / 1M Token $4 $0.6 6.7×
Text-Output / 1M Token $24 $2.4 10×
Cache-Schreiben keine separate Gebühr keine separate Gebühr

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen — Preis pro 1M Audio-Tokens über alle 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Prompt-Caching implizit (automatisch) implizit (automatisch)
Cache-Lebensdauer 5–10m, up to 1h 5–10m, up to 1h
Minimales gecachtes Präfix 1024 Tokens 1024 Tokens

Spezifikationen

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Input-Modalitäten Text Audio Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2026-07-06 2026-07-06
Wissensgrenze 2024-09 2024-09
Session-Fähigkeiten
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Kontextfenster 128K 128K

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel holen →

FAQ

Welches ist günstiger, GPT Realtime 2.1 oder GPT Realtime 2.1 Mini?

GPT Realtime 2.1 Mini ist günstiger bei audio-input / 1m token ($10 vs. $32, 3.2× Unterschied). Andere Zeilen können in die andere Richtung deuten — die obige Tabelle enthält alle Daten, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich GPT Realtime 2.1 gegen GPT Realtime 2.1 Mini ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Unterstützen GPT Realtime 2.1 und GPT Realtime 2.1 Mini Prompt-Caching?

Ja — beide berechnen Cache-Reads günstiger als ihre Eingaberate, sodass Warm-Prefix-Workloads weniger kosten, als die Listenpreise vermuten lassen. Die genauen Zeilen für Cache-Reads befinden sich in der obigen Preistabelle.

Verwandte Vergleiche