🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime vs GPT Realtime 2.1

vs

Qual usar, quando — veredito curado, não uma tabela de benchmark

A entrada de texto é $4 por milhão nos dois, o áudio $32 na entrada e $64 na saída nos dois, e as leituras de cache $0.4 nos dois; o gpt-realtime-2.1 cobra mais apenas na saída de texto, $24 contra $16, e quadruplica o contexto de sessão, 128K contra 32K. Ele também acrescenta esforço de raciocínio configurável e tratamento de interrupções à chamada de funções do modelo anterior. Escolha o gpt-realtime só para manter uma integração existente — em tudo menos a saída de texto, o mais novo custa o mesmo.

Preços

GPT Realtime GPT Realtime 2.1 Δ
Entrada de áudio / 1M tokens $32 $32 =
Saída de áudio / 1M tokens $64 $64 =
Leitura de cache de áudio / 1M tokens $0.4 $0.4 =
Entrada de texto / 1M tokens $4 $4 =
Saída de texto / 1M tokens $16 $24 0.67×
Escrita de cache sem cobrança separada sem cobrança separada

Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.

Onde eles se posicionam — preço por 1M tokens de áudio entre todos os 6 modelos de fala para fala em tempo real nesta unidade de cobrança (escala logarítmica)

Capacidades

GPT Realtime GPT Realtime 2.1
Cache de prompt implícito (automático) implícito (automático)
Tempo de vida do cache 5–10m, up to 1h 5–10m, up to 1h
Prefixo mínimo em cache 1024 tokens 1024 tokens

Especificações

GPT Realtime GPT Realtime 2.1
Modalidades de entrada texto áudio texto áudio
Modalidades de saída texto áudio texto áudio
Lançamento 2025-08-28 2026-07-06
Corte de conhecimento 2023-10 2024-09
Capacidades da sessão
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Janela de contexto 32K 128K

As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: GPT Realtime · GPT Realtime 2.1

Alterne entre eles com uma linha

Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # descomente esta linha, comente a linha acima
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obter uma chave de API →

FAQ

Qual é mais barato, GPT Realtime ou GPT Realtime 2.1?

Eles listam a mesma entrada de áudio / 1m tokens ($32), então o preço não decide este caso — veja as especificações e capacidades abaixo.

Posso fazer um teste A/B de GPT Realtime contra GPT Realtime 2.1 sem duas integrações?

Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.

GPT Realtime e GPT Realtime 2.1 suportam prompt caching?

Sim — ambos cobram leituras em cache abaixo da sua taxa de entrada, então cargas de trabalho com warm-prefix custam menos do que as taxas listadas sugerem. As linhas exatas de leitura em cache estão na tabela de preços acima.

Comparações relacionadas

De nossos estudos medidos