🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

vs

Qual usar, quando — veredito curado, não uma tabela de benchmark

O nível mini é mais barato em todas as linhas — $0.6 e $2.4 por milhão de tokens de texto contra $4 e $24, e $10 e $20 por milhão de áudio na entrada e saída contra $32 e $64 — ou seja, cerca de 3x menos no áudio e quase 7x na entrada de texto. Os dois trazem contexto de sessão de 128K com fala-para-fala, uso de ferramentas e cache de prompts; o modelo completo documenta ainda esforço de raciocínio configurável e tratamento de interrupções. Escolha o mini para volume, o modelo completo quando quiser ajustar o esforço de raciocínio por sessão.

Preços

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Entrada de áudio / 1M tokens $32 $10 3.2×
Saída de áudio / 1M tokens $64 $20 3.2×
Leitura de cache de áudio / 1M tokens $0.4 $0.3 1.3×
Entrada de texto / 1M tokens $4 $0.6 6.7×
Saída de texto / 1M tokens $24 $2.4 10×
Escrita de cache sem cobrança separada sem cobrança separada

Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.

Onde eles se posicionam — preço por 1M tokens de áudio entre todos os 6 modelos de fala para fala em tempo real nesta unidade de cobrança (escala logarítmica)

Capacidades

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Cache de prompt implícito (automático) implícito (automático)
Tempo de vida do cache 5–10m, up to 1h 5–10m, up to 1h
Prefixo mínimo em cache 1024 tokens 1024 tokens

Especificações

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Modalidades de entrada texto áudio texto áudio
Modalidades de saída texto áudio texto áudio
Lançamento 2026-07-06 2026-07-06
Corte de conhecimento 2024-09 2024-09
Capacidades da sessão
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Janela de contexto 128K 128K

As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Alterne entre eles com uma linha

Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # descomente esta linha, comente a linha acima
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obter uma chave de API →

FAQ

Qual é mais barato, GPT Realtime 2.1 ou GPT Realtime 2.1 Mini?

GPT Realtime 2.1 Mini é mais barato em entrada de áudio / 1m tokens ($10 vs $32, com 3.2× de diferença). Outras linhas podem apontar para o outro lado — a tabela acima traz o quadro completo, e o custo real depende do seu mix.

Posso fazer um teste A/B de GPT Realtime 2.1 contra GPT Realtime 2.1 Mini sem duas integrações?

Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.

GPT Realtime 2.1 e GPT Realtime 2.1 Mini suportam prompt caching?

Sim — ambos cobram leituras em cache abaixo da sua taxa de entrada, então cargas de trabalho com warm-prefix custam menos do que as taxas listadas sugerem. As linhas exatas de leitura em cache estão na tabela de preços acima.

Comparações relacionadas