🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

vs

Lequel, quand — verdict de synthèse, pas un tableau de benchmarks

Le palier mini est moins cher sur chaque ligne — $0.6 et $2.4 par million de tokens texte contre $4 et $24, et $10 et $20 par million d'audio en entrée et sortie contre $32 et $64 — soit environ 3x moins sur l'audio et près de 7x sur l'entrée texte. Les deux portent un contexte de session de 128K avec parole-à-parole, usage d'outils et mise en cache des prompts ; le modèle complet documente en plus un effort de raisonnement configurable et la gestion des interruptions. Prenez le mini pour le volume, le modèle complet quand vous voulez régler l'effort de raisonnement par session.

Tarification

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Entrée audio / 1M tokens $32 $10 3.2×
Sortie audio / 1M tokens $64 $20 3.2×
Lecture en cache audio / 1M tokens $0.4 $0.3 1.3×
Entrée texte / 1M tokens $4 $0.6 6.7×
Sortie texte / 1M tokens $24 $2.4 10×
Écriture cache aucun frais supplémentaire aucun frais supplémentaire

Tarifs issus du catalogue en direct au moment de la compilation ; chaque page de modèle présente la fiche actuelle.

Où ils se situent — prix pour 1M de tokens audio sur l'ensemble des 6 modèles speech-to-speech en temps réel pour cette unité de facturation (échelle logarithmique)

Capacités

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Mise en cache du prompt implicite (automatique) implicite (automatique)
Durée de vie du cache 5–10m, up to 1h 5–10m, up to 1h
Préfixe minimum mis en cache 1024 jetons 1024 jetons

Spécifications

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Modalités d'entrée texte audio texte audio
Modalités de sortie texte audio texte audio
Sortie 2026-07-06 2026-07-06
Limite de connaissances 2024-09 2024-09
Capacités de session
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Fenêtre de contexte 128K 128K

Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Basculez de l'un à l'autre avec une seule ligne

Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # décommentez cette ligne, commentez celle du dessus
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenir une clé API →

FAQ

Lequel est le moins cher, GPT Realtime 2.1 ou GPT Realtime 2.1 Mini ?

GPT Realtime 2.1 Mini est moins cher sur entrée audio / 1m tokens ($10 contre $32, avec un écart de 3.2×). D'autres lignes peuvent indiquer l'inverse — le tableau ci-dessus contient la fiche complète, et le coût réel dépend de votre combinaison.

Puis-je faire un test A/B de GPT Realtime 2.1 par rapport à GPT Realtime 2.1 Mini sans deux intégrations ?

Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.

Est-ce que GPT Realtime 2.1 et GPT Realtime 2.1 Mini prennent en charge le prompt caching ?

Oui — les deux facturent les lectures en cache en dessous de leur tarif d'entrée, donc les charges de travail à préfixe chaud coûtent moins cher que ce que les tarifs de base suggèrent. Les lignes exactes des lectures en cache se trouvent dans le tableau de tarification ci-dessus.

Comparaisons associées