Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT Realtime vs GPT Realtime 2.1

GPT Realtime est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

GPT Realtime 2.1 est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

vs

Lequel choisir, et quand

L'entrée texte est à $4 par million sur les deux, l'audio à $32 en entrée et $64 en sortie sur les deux, et les lectures de cache à $0.4 sur les deux ; gpt-realtime-2.1 ne facture plus que sur la sortie texte, $24 contre $16, et quadruple le contexte de session, 128K contre 32K. Il ajoute aussi un effort de raisonnement configurable et la gestion des interruptions à l'appel de fonctions du modèle précédent. Prenez gpt-realtime uniquement pour maintenir une intégration existante - sur tout sauf la sortie texte, le plus récent coûte pareil.

Benchmarks

GPT Realtime 2.1 : le fournisseur n'a publié aucun résultat de benchmark.

GPT Realtime : 8 résultats publiés, mais aucun benchmark en commun avec assez d'autres modèles pour comparer.

GPT Realtime GPT Realtime 2.1 autres modèles mesurés moyenne des modèles comparés ★ aucun autre modèle n'a fait mieux
AMI near+far field (WER)
35.9%
N/A
Big Bench Audio
82.8%
N/A
BFCL v3 (single-turn, python only)
80.4%
N/A

Chiffres publiés par les fournisseurs : Amazon OpenAI

Tarifs

GPT Realtime GPT Realtime 2.1 Δ
Entrée audio / 1M de tokens $32 $32 =
Sortie audio / 1M de tokens $64 $64 =
Lecture de cache audio / 1M de tokens $0.4 $0.4 =
Entrée texte / 1M de tokens $4 $4 =
Sortie texte / 1M de tokens $16 $24 0.67×
Écriture de cache pas de frais distincts pas de frais distincts -

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix pour 1M de tokens audio, parmi les 6 modèles de speech-to-speech en temps réel facturés dans cette unité (échelle logarithmique)

Capacités

GPT Realtime GPT Realtime 2.1
Mise en cache des prompts implicite (automatique) implicite (automatique)
Durée de vie du cache 5-10m, up to 1h 5-10m, up to 1h
Préfixe minimal mis en cache 1024 tokens 1024 tokens

Spécifications

GPT Realtime GPT Realtime 2.1
Modalités d'entrée texte audio texte audio
Modalités de sortie texte audio texte audio
Date de sortie 2025-08-28 2026-07-06
Coupure des connaissances 2023-10 2024-09
Capacités de session
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Fenêtre de contexte 32K 128K

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : GPT Realtime · GPT Realtime 2.1

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # décommentez cette ligne, commentez celle du dessus
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenez votre clé API →

FAQ

Lequel est le moins cher, GPT Realtime ou GPT Realtime 2.1 ?

Les deux affichent le même prix sur la ligne « Entrée audio / 1M de tokens » ($32) : ce n'est donc pas le prix qui les départage ici. Voyez les spécifications et les capacités ci-dessous.

Puis-je faire un test A/B entre GPT Realtime et GPT Realtime 2.1 sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

GPT Realtime et GPT Realtime 2.1 prennent-ils en charge la mise en cache des prompts ?

Oui. Les deux facturent les lectures de cache moins cher que leur tarif d'entrée : une charge de travail dont le préfixe est déjà en cache coûte donc moins que ne le laissent penser les tarifs publics. Les lignes de lecture de cache figurent dans le tableau des tarifs ci-dessus.

Comparatifs associés

Nos études, mesures à l'appui