Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT Realtime 2.1 vs nova-2-sonic

GPT Realtime 2.1 est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

nova-2-sonic est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

vs

Lequel choisir, et quand

Les deux sont des modèles audio et texte en temps réel facturés par million de jetons, les tarifs se comparent donc directement : nova-2-sonic facture $3 pour l'audio en entrée et $12 pour l'audio en sortie contre $32 et $64 pour gpt-realtime-2.1, et $0.06/$0.24 sur le texte contre $4/$24, avec un contexte de 1000000 et 64000 en sortie maximum plutôt que 128000 et 32000. Choisissez nova-2-sonic pour les longues sessions vocales sensibles aux coûts si sa limite de connexion de 8 minutes et son inférence uniquement en Région vous conviennent ; choisissez le plus récent gpt-realtime-2.1 (sorti le 2026-07-06) lorsque vous voulez des lectures d'entrée en cache à $0.4 et aucune session ou région de ce type

Benchmarks

GPT Realtime 2.1 : le fournisseur n'a publié aucun résultat de benchmark.

nova-2-sonic : 8 résultats publiés, mais aucun benchmark en commun avec assez d'autres modèles pour comparer.

GPT Realtime 2.1 nova-2-sonic autres modèles mesurés moyenne des modèles comparés ★ aucun autre modèle n'a fait mieux
AMI near+far field (WER)
N/A
29.7%
Big Bench Audio
N/A
87%
BFCL v3 (single-turn, python only)
N/A
74.5%

Chiffres publiés par les fournisseurs : Amazon OpenAI

Tarifs

GPT Realtime 2.1 nova-2-sonic Δ
Entrée audio / 1M de tokens $32 $3 11×
Sortie audio / 1M de tokens $64 $12 5.3×
Lecture de cache audio / 1M de tokens $0.4 - -
Entrée texte / 1M de tokens $4 $0.06 67×
Sortie texte / 1M de tokens $24 $0.24 100×
Écriture de cache pas de frais distincts pas de frais distincts -

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix pour 1M de tokens audio, parmi les 6 modèles de speech-to-speech en temps réel facturés dans cette unité (échelle logarithmique)

Capacités

GPT Realtime 2.1 nova-2-sonic
Mise en cache des prompts implicite (automatique) non pris en charge
Durée de vie du cache 5-10m, up to 1h non applicable
Préfixe minimal mis en cache 1024 tokens non applicable

Spécifications

GPT Realtime 2.1 nova-2-sonic
Modalités d'entrée texte audio texte audio
Modalités de sortie texte audio texte audio
Date de sortie 2026-07-06 2025-12-02
Coupure des connaissances 2024-09 -
Voix -

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Capacités de session
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Fenêtre de contexte 128K 1M

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : GPT Realtime 2.1 · nova-2-sonic

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # décommentez cette ligne, commentez celle du dessus
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenez votre clé API →

FAQ

Lequel est le moins cher, GPT Realtime 2.1 ou nova-2-sonic ?

nova-2-sonic est moins cher sur la ligne « Entrée audio / 1M de tokens » ($3 contre $32, soit un écart de 11×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre GPT Realtime 2.1 et nova-2-sonic sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

GPT Realtime 2.1 et nova-2-sonic prennent-ils en charge la mise en cache des prompts ?

Notre flux de prix n'indique un tarif de lecture de cache que pour l'un des deux. Quand ce tarif est absent, c'est que le fournisseur ne facture pas les lectures de cache à part.

Comparatifs associés

Nos études, mesures à l'appui