🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT Realtime 2.1 vs nova-2-sonic

vs

Lequel, quand — verdict de synthèse, pas un tableau de benchmarks

Les deux sont des modèles audio et texte en temps réel facturés par million de jetons, les tarifs se comparent donc directement : nova-2-sonic facture $3 pour l'audio en entrée et $12 pour l'audio en sortie contre $32 et $64 pour gpt-realtime-2.1, et $0.06/$0.24 sur le texte contre $4/$24, avec un contexte de 1000000 et 64000 en sortie maximum plutôt que 128000 et 32000. Choisissez nova-2-sonic pour les longues sessions vocales sensibles aux coûts si sa limite de connexion de 8 minutes et son inférence uniquement en Région vous conviennent ; choisissez le plus récent gpt-realtime-2.1 (sorti le 2026-07-06) lorsque vous voulez des lectures d'entrée en cache à $0.4 et aucune session ou région de ce type

Tarification

GPT Realtime 2.1 nova-2-sonic Δ
Entrée audio / 1M tokens $32 $3 11×
Sortie audio / 1M tokens $64 $12 5.3×
Lecture en cache audio / 1M tokens $0.4
Entrée texte / 1M tokens $4 $0.06 67×
Sortie texte / 1M tokens $24 $0.24 100×
Écriture cache aucun frais supplémentaire aucun frais supplémentaire

Tarifs issus du catalogue en direct au moment de la compilation ; chaque page de modèle présente la fiche actuelle.

Où ils se situent — prix pour 1M de tokens audio sur l'ensemble des 6 modèles speech-to-speech en temps réel pour cette unité de facturation (échelle logarithmique)

Capacités

GPT Realtime 2.1 nova-2-sonic
Mise en cache du prompt implicite (automatique) non pris en charge
Durée de vie du cache 5–10m, up to 1h non applicable
Préfixe minimum mis en cache 1024 jetons non applicable

Spécifications

GPT Realtime 2.1 nova-2-sonic
Modalités d'entrée texte audio texte audio
Modalités de sortie texte audio texte audio
Sortie 2026-07-06 2025-12-02
Limite de connaissances 2024-09
Voix

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Capacités de session
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Fenêtre de contexte 128K 1M

Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : GPT Realtime 2.1 · nova-2-sonic

Basculez de l'un à l'autre avec une seule ligne

Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # décommentez cette ligne, commentez celle du dessus
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenir une clé API →

FAQ

Lequel est le moins cher, GPT Realtime 2.1 ou nova-2-sonic ?

nova-2-sonic est moins cher sur entrée audio / 1m tokens ($3 contre $32, avec un écart de 11×). D'autres lignes peuvent indiquer l'inverse — le tableau ci-dessus contient la fiche complète, et le coût réel dépend de votre combinaison.

Puis-je faire un test A/B de GPT Realtime 2.1 par rapport à nova-2-sonic sans deux intégrations ?

Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.

Est-ce que GPT Realtime 2.1 et nova-2-sonic prennent en charge le prompt caching ?

La tarification de la lecture en cache n'est indiquée que pour l'un des deux dans notre flux ; lorsqu'un tarif est manquant, le fournisseur ne tarifie pas les lectures en cache séparément.

Comparaisons associées