Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

gemini-3.1-flash-live vs GPT Realtime 2.1

gemini-3.1-flash-live est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

GPT Realtime 2.1 est accessible sur invitation. Les chiffres ci-dessous sont bien ses tarifs en vigueur, mais votre espace de travail doit d'abord y être autorisé : demandez-nous l'accès avant de bâtir quoi que ce soit sur ce comparatif.

vs

Lequel choisir, et quand

Les deux sont des modèles audio en temps réel facturés par million de jetons, mais gemini-3.1-flash-live est l'option la moins chère : $3 pour l'audio en entrée contre $32 (environ 10.7x moins) et $12 pour l'audio en sortie contre $64, avec le texte à $0.75/$4.5 contre $4/$24 (environ 5.3x moins). Il accepte également les entrées image et vidéo en plus de l'audio et du texte, dispose d'un contexte de 131072 jetons avec jusqu'à 65536 jetons en sortie, et ses sessions Live API sont plafonnées à 15 minutes pour l'audio seul (2 minutes avec vidéo) à moins d'être prolongées. Choisissez gpt-realtime-2.1 si vous voulez la pile audio/texte d'OpenAI avec les lectures en cache à $0.4, son contexte de 128000 jetons et 32000 en sortie maximum.

Tarifs

gemini-3.1-flash-live GPT Realtime 2.1 Δ
Entrée audio / 1M de tokens $3 $32 0.094×
Sortie audio / 1M de tokens $12 $64 0.19×
Lecture de cache audio / 1M de tokens - $0.4 -
Entrée texte / 1M de tokens $0.75 $4 0.19×
Sortie texte / 1M de tokens $4.5 $24 0.19×
Écriture de cache - pas de frais distincts -

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix pour 1M de tokens audio, parmi les 6 modèles de speech-to-speech en temps réel facturés dans cette unité (échelle logarithmique)

Capacités

gemini-3.1-flash-live GPT Realtime 2.1
Contrôle de la réflexion toujours activé -
Mise en cache des prompts implicite + explicite implicite (automatique)
Durée de vie du cache non publié 5-10m, up to 1h
Préfixe minimal mis en cache 4096 tokens 1024 tokens

Spécifications

gemini-3.1-flash-live GPT Realtime 2.1
Modalités d'entrée texte image audio vidéo texte audio
Modalités de sortie texte audio texte audio
Date de sortie 2026-03-26 2026-07-06
Coupure des connaissances - 2024-09
Voix

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

-
Capacités de session
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Fenêtre de contexte 131K 128K

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : gemini-3.1-flash-live · GPT Realtime 2.1

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # décommentez cette ligne, commentez celle du dessus
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenez votre clé API →

FAQ

Lequel est le moins cher, gemini-3.1-flash-live ou GPT Realtime 2.1 ?

gemini-3.1-flash-live est moins cher sur la ligne « Entrée audio / 1M de tokens » ($3 contre $32, soit un écart de 11×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre gemini-3.1-flash-live et GPT Realtime 2.1 sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

gemini-3.1-flash-live et GPT Realtime 2.1 prennent-ils en charge la mise en cache des prompts ?

Notre flux de prix n'indique un tarif de lecture de cache que pour l'un des deux. Quand ce tarif est absent, c'est que le fournisseur ne facture pas les lectures de cache à part.

Comparatifs associés

Nos études, mesures à l'appui