Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

GPT Realtime 2.1 vs nova-2-sonic

GPT Realtime 2.1 gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

nova-2-sonic gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

vs

Welches Modell wofür

Beide sind Echtzeit-Audio- und -Text-Modelle, die pro Million Token abgerechnet werden, sodass die Raten direkt vergleichbar sind: nova-2-sonic berechnet $3 Audio In und $12 Audio Out im Vergleich zu $32 und $64 bei gpt-realtime-2.1, und $0.06/$0.24 für Text gegenüber $4/$24, mit 1000000 Kontext und 64000 max Output anstelle von 128000 und 32000. Wählen Sie nova-2-sonic für lange, kostensensible Sprach-Sitzungen, wenn sein 8-minütiges Verbindungslimit und die ausschließliche In-Region-Inferenz für Sie passen; wählen Sie das neuere gpt-realtime-2.1 (veröffentlicht am 2026-07-06), wenn Sie Cached-Input-Reads für $0.4 und keine solche Sitzung oder Region wünschen

Benchmarks

GPT Realtime 2.1: Der Anbieter hat keine Benchmark-Werte veröffentlicht.

nova-2-sonic: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.

GPT Realtime 2.1 nova-2-sonic weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
AMI near+far field (WER)
N/A
29.7%
Big Bench Audio
N/A
87%
BFCL v3 (single-turn, python only)
N/A
74.5%

Anbieterangaben: Amazon OpenAI

Preise

GPT Realtime 2.1 nova-2-sonic Δ
Audio-Eingabe / 1M Tokens $32 $3 11×
Audio-Ausgabe / 1M Tokens $64 $12 5.3×
Audio-Cache-Lesen / 1M Tokens $0.4 - -
Text-Eingabe / 1M Tokens $4 $0.06 67×
Text-Ausgabe / 1M Tokens $24 $0.24 100×
Cache-Schreiben keine gesonderte Gebühr keine gesonderte Gebühr -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

GPT Realtime 2.1 nova-2-sonic
Prompt-Caching implizit (automatisch) nicht unterstützt
Cache-Lebensdauer 5-10m, up to 1h nicht zutreffend
Mindestlänge des gecachten Präfixes 1024 Tokens nicht zutreffend

Spezifikationen

GPT Realtime 2.1 nova-2-sonic
Eingabemodalitäten Text Audio Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2026-07-06 2025-12-02
Knowledge-Cutoff 2024-09 -
Stimmen -

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Sitzungsfunktionen
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Kontextfenster 128K 1M

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT Realtime 2.1 · nova-2-sonic

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: GPT Realtime 2.1 oder nova-2-sonic?

nova-2-sonic ist bei Audio-Eingabe / 1M Tokens günstiger ($3 vs. $32, Faktor 11). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich GPT Realtime 2.1 gegen nova-2-sonic A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen GPT Realtime 2.1 und nova-2-sonic Prompt-Caching?

In unserem Feed ist nur für eines der beiden Modelle ein Preis für Cache-Lesezugriffe hinterlegt. Fehlt ein Preis, berechnet der Anbieter Cache-Lesezugriffe nicht gesondert.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen