Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT Realtime 2.1

Veröffentlicht 2026-07-06

geschlossene Beta

GPT Realtime 2.1 ist das Flaggschiff von OpenAIs Realtime-Speech-to-Speech-Familie, angekündigt als aktualisiertes Realtime-Reasoning-Modell mit verbesserter Alphanumerik-Erkennung, verbesserter Stille- und Rauschbehandlung und verbessertem Unterbrechungsverhalten.

Eingabe
Audio Text $4/M
Ausgabe
Audio Text $24/M
Audio-Input
$32/M
Audio-Output
$64/M
Cache-Read
$0.4/M
Knowledge Cutoff
2024-09

Preis im Vergleich

Preisposition unter 6 vergleichbaren Modellen

Eingabe$4/M
$0.06 · nova-2-sonic GPT Realtime · $4
Ausgabe$24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24
Cache-Lesen$0.4/M
$0.06 · GPT Realtime 2.1 Mini GPT Realtime · $0.4

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 128.000
Max. Output (Anbieter-Spezifikation) 32.000
Knowledge Cutoff 2024-09

Prompt Caching

Modus automatisch
Min. Präfix 1.024
Lebensdauer 5-10 Min., bis zu 1 Std.

Realtime

Sitzung
  • Speech-to-Speech über WebSocket
  • konfigurierbarer Reasoning-Aufwand
  • Tool-Nutzung
  • Unterbrechungsbehandlung
  • 128K Kontext

Modell

Modalitäten Audio + Text → Audio + Text
  • Aktualisiertes Realtime-Reasoning-Modell mit verbesserter alphanumerischer Erkennung, besserem Umgang mit Stille und Störgeräuschen sowie besserem Unterbrechungsverhalten
  • konfigurierbarer Reasoning-Aufwand und Tool-Nutzung für Voice-Agent-Workflows
  • 128k Kontext

laut Offizielle OpenAI-Dokumentation ↗

GPT Realtime 2.1 in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über GPT Realtime 2.1

  • Es erweitert die Familie auf ein Kontextfenster von 128K Token mit maximal 32K Output-Token und unterstützt konfigurierbaren Reasoning-Aufwand, Instruktionsbefolgung und Tool-Nutzung für komplexe Sprachagenten-Workflows.
  • Audio- und Text-Token werden zu getrennten Sätzen pro Token abgerechnet, mit vergünstigten gecachten Eingaben.
  • OpenAIs Realtime-Leitfaden nennt es das Modell der Wahl beim Bau eines latenzarmen Sprachagenten und empfiehlt, für die meisten Produktionsagenten bei niedrigem Reasoning-Aufwand zu beginnen und ihn erst dort anzuheben, wo die Aufgabe die zusätzliche Latenz rechtfertigt.
  • Sitzungen laufen über WebRTC, WebSocket oder SIP, und der Sprecherwechsel kann stillebasierte Voice Activity Detection nutzen oder einen semantischen Detektor, dessen Eagerness-Einstellung darüber entscheidet, wie geduldig er auf das Ende einer Äußerung wartet.
  • Die Behandlung von Unterbrechungen ist Teil des Protokolls: Bei aktivierter Erkennung schneidet der Server nicht abgespieltes Audio ab, und von WebSocket-Clients wird erwartet, dass sie die Wiedergabe stoppen und melden, wie viel Audio den Zuhörer tatsächlich erreicht hat.
  • Tools können pro Sitzung oder pro Antwort deklariert werden, und Antworten können außerhalb des Hauptgesprächs erzeugt werden, wenn eine Nebenaufgabe das Transkript nicht verunreinigen soll.
  • Auf Synthorai wird es über den OpenAI-kompatiblen /v1/realtime-WebSocket-Endpoint bereitgestellt, sodass auf den offiziellen Realtime-SDKs aufgebaute Anwendungen unverändert funktionieren.

FAQ

Lässt sich die GPT Realtime 2.1 API kostenlos testen?

GPT Realtime 2.1 befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.

Worin ist GPT Realtime 2.1 am besten?

Flaggschiff-Realtime-Stufe für Produktions-Sprachagenten; verbesserte Unterbrechungs-, Rausch- und Alphanumerik-Behandlung; konfigurierbarer Reasoning-Aufwand mit Tool-Nutzung. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet GPT Realtime 2.1?

GPT Realtime 2.1 kostet auf Synthorai $4 pro Million Input-Tokens und $24 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.4/M abgerechnet.

Wie rufe ich die GPT Realtime 2.1-API auf?

GPT Realtime 2.1 ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1 über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).

Wie erhalte ich Zugang zu GPT Realtime 2.1?

GPT Realtime 2.1 ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gpt-realtime-2.1".

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →