Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

gemini-3.1-flash-live vs GPT Realtime 2.1

O gemini-3.1-flash-live é oferecido por convite. Os valores abaixo são as tarifas em tempo real, mas as chamadas só funcionam depois que o seu espaço de trabalho recebe a permissão; peça acesso antes de desenvolver com base nesta comparação.

O GPT Realtime 2.1 é oferecido por convite. Os valores abaixo são as tarifas em tempo real, mas as chamadas só funcionam depois que o seu espaço de trabalho recebe a permissão; peça acesso antes de desenvolver com base nesta comparação.

vs

Qual usar e quando

Ambos são modelos de áudio em tempo real cobrados por milhão de tokens, mas o gemini-3.1-flash-live é a opção mais barata: $3 para entrada de áudio contra $32 (cerca de 10.7x menos) e $12 para saída de áudio contra $64, com texto a $0.75/$4.5 contra $4/$24 (aproximadamente 5.3x menos). Ele também aceita entrada de imagem e vídeo junto com áudio e texto, possui um contexto de 131072 tokens com até 65536 tokens de saída, e suas sessões na Live API têm um limite de 15 minutos apenas com áudio (2 minutos com vídeo), a menos que sejam estendidas. Escolha o gpt-realtime-2.1 se quiser a stack de áudio/texto da OpenAI com leituras de cache a $0.4, seu contexto de 128000 tokens e máximo de 32000 de saída.

Preços

gemini-3.1-flash-live GPT Realtime 2.1 Δ
Entrada de áudio / 1M tokens $3 $32 0.094×
Saída de áudio / 1M tokens $12 $64 0.19×
Leitura de cache de áudio / 1M tokens - $0.4 -
Entrada de texto / 1M tokens $0.75 $4 0.19×
Saída de texto / 1M tokens $4.5 $24 0.19×
Escrita de cache - sem cobrança separada -

Tarifas do catálogo em tempo real, lidas no momento do build; a página de cada modelo traz a tabela de preços atual.

Onde cada um fica: preço por 1M tokens de áudio entre os 6 modelos de voz para voz em tempo real com esta unidade de cobrança (escala logarítmica)

Capacidades

gemini-3.1-flash-live GPT Realtime 2.1
Controle de raciocínio sempre ativo -
Cache de prompts implícito + explícito implícito (automático)
Tempo de vida do cache não publicado 5-10m, up to 1h
Prefixo mínimo em cache 4096 tokens 1024 tokens

Especificações

gemini-3.1-flash-live GPT Realtime 2.1
Modalidades de entrada texto imagem áudio vídeo texto áudio
Modalidades de saída texto áudio texto áudio
Lançamento 2026-03-26 2026-07-06
Corte de conhecimento - 2024-09
Vozes

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

-
Capacidades da sessão
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Janela de contexto 131K 128K

As especificações são transcritas da documentação de cada provedor; quando um provedor não publica um dado, a linha é omitida, e não inferida. Fontes completas: gemini-3.1-flash-live · GPT Realtime 2.1

Troque de um para o outro mudando uma linha

Os dois ids estão em todas as abas abaixo; o par de linhas destacado é a única alteração. O endpoint, a chave e o formato da requisição são os mesmos.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # descomente esta linha, comente a linha acima
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtenha sua chave de API →

Perguntas frequentes

Qual é mais barato, gemini-3.1-flash-live ou GPT Realtime 2.1?

gemini-3.1-flash-live sai mais barato na linha “Entrada de áudio / 1M tokens” ($3 contra $32, 11× de diferença). Outras linhas podem pender para o outro lado: a tabela acima mostra todos os preços, e o custo real depende do seu mix de uso.

Posso fazer um teste A/B de gemini-3.1-flash-live contra GPT Realtime 2.1 sem duas integrações?

Sim. Os dois são servidos pelo mesmo endpoint compatível com OpenAI, com uma única chave de API. Para trocar, basta mudar uma linha, a string do modelo; assim você pode direcionar uma parte do tráfego para cada um e comparar as contas diretamente.

gemini-3.1-flash-live e GPT Realtime 2.1 suportam cache de prompts?

No nosso feed, só um dos dois tem preço de leitura de cache; quando a tarifa não aparece, é porque o provedor não tem preço separado para as leituras de cache.

Comparações relacionadas

Dos nossos estudos com medições