🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT Realtime 2.1 Veröffentlicht 2026-07-06

OpenAI geschlossene Beta realtime audio
Input$4/M
Output$24/M
Audio-Input$32/M
Audio-Output$64/M
Cache-Read$0.4/M
Knowledge Cutoff2024-09

Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten. Effektiver Input-Preis bei 70 % Cache-Trefferquote:$1.48/M. Automatisches Präfix-Caching, sobald ein Prompt die Mindestlänge überschreitet, ohne Codeänderungen; gecachte Lesezugriffe sind vergünstigt (bis zu 90% bei aktuellen Modellen), und es fällt keine Schreibgebühr an.

GPT Realtime 2.1 in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über GPT Realtime 2.1

Flaggschiff-Realtime-Stufe für Produktions-Sprachagenten
Verbesserte Unterbrechungs-, Rausch- und Alphanumerik-Behandlung
Konfigurierbarer Reasoning-Aufwand mit Tool-Nutzung

GPT Realtime 2.1 ist das Flaggschiff von OpenAIs Realtime-Speech-to-Speech-Familie, angekündigt als aktualisiertes Realtime-Reasoning-Modell mit verbesserter Alphanumerik-Erkennung, Stille- und Rauschbehandlung sowie verbessertem Unterbrechungsverhalten.

  • Es erweitert die Familie auf ein Kontextfenster von 128K Token mit maximal 32K Output-Token und unterstützt konfigurierbaren Reasoning-Aufwand, Instruktionsbefolgung und Tool-Nutzung für komplexe Sprachagenten-Workflows.
  • Audio- und Text-Token werden zu getrennten Sätzen abgerechnet, gecachte Eingaben vergünstigt.
  • Auf Synthorai wird es über den OpenAI-kompatiblen /v1/realtime-WebSocket-Endpoint bereitgestellt, sodass auf den offiziellen Realtime-SDKs aufgebaute Anwendungen unverändert funktionieren.

Spezifikationen & Limits

Max. Output (Anbieter-Spezifikation)32,000
Modalitätenaudio + text → audio + text
Funktionenrealtime · speech-to-speech
BemerkenswertUpdated realtime reasoning model with improved alphanumeric recognition, silence and noise handling, and interruption behavior; configurable reasoning effort and tool use for voice-agent workflows; 128k context.
Prompt-Cachingautomatisch · min. 1,024-Token-Präfix · TTL 5–10m, up to 1h

laut Offizielle OpenAI-Dokumentation ↗

FAQ

Lässt sich die GPT Realtime 2.1 API kostenlos testen?

GPT Realtime 2.1 befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.

Worin ist GPT Realtime 2.1 am besten?

Flaggschiff-Realtime-Stufe für Produktions-Sprachagenten, außerdem verbesserte Unterbrechungs-, Rausch- und Alphanumerik-Behandlung und konfigurierbarer Reasoning-Aufwand mit Tool-Nutzung. Das vollständige Bild finden Sie im About-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet GPT Realtime 2.1?

GPT Realtime 2.1 kostet auf Synthorai $4 pro Million Input-Tokens und $24 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.4/M abgerechnet.

Wie rufe ich die GPT Realtime 2.1-API auf?

GPT Realtime 2.1 ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1 über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und spiegeln Sie den OpenAI-Beta-Header.

Wie erhalte ich Zugang zu GPT Realtime 2.1?

GPT Realtime 2.1 ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gpt-realtime-2.1".

Verwandte Modelle

Kostenlosen API-Key holen Ihre Kosten vergleichen →