🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime 2.1 vs nova-2-sonic

vs

Qual usar, quando — veredito curado, não uma tabela de benchmark

Ambos são modelos de áudio e texto em tempo real cobrados por milhão de tokens, então as taxas se comparam diretamente: o nova-2-sonic cobra $3 de entrada de áudio e $12 de saída de áudio contra $32 e $64 do gpt-realtime-2.1, e $0.06/$0.24 em texto contra $4/$24, com 1000000 de contexto e máximo de 64000 de saída em vez de 128000 e 32000. Escolha o nova-2-sonic para sessões de voz longas e sensíveis a custos, se o seu limite de conexão de 8 minutos e a inferência restrita à Região (in-Region-only) atenderem você; escolha o gpt-realtime-2.1 mais recente (lançado em 2026-07-06) quando quiser leituras de entrada em cache a $0.4 e nenhuma restrição de sessão ou região

Preços

GPT Realtime 2.1 nova-2-sonic Δ
Entrada de áudio / 1M tokens $32 $3 11×
Saída de áudio / 1M tokens $64 $12 5.3×
Leitura de cache de áudio / 1M tokens $0.4
Entrada de texto / 1M tokens $4 $0.06 67×
Saída de texto / 1M tokens $24 $0.24 100×
Escrita de cache sem cobrança separada sem cobrança separada

Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.

Onde eles se posicionam — preço por 1M tokens de áudio entre todos os 6 modelos de fala para fala em tempo real nesta unidade de cobrança (escala logarítmica)

Capacidades

GPT Realtime 2.1 nova-2-sonic
Cache de prompt implícito (automático) não suportado
Tempo de vida do cache 5–10m, up to 1h não aplicável
Prefixo mínimo em cache 1024 tokens não aplicável

Especificações

GPT Realtime 2.1 nova-2-sonic
Modalidades de entrada texto áudio texto áudio
Modalidades de saída texto áudio texto áudio
Lançamento 2026-07-06 2025-12-02
Corte de conhecimento 2024-09
Vozes

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Capacidades da sessão
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Janela de contexto 128K 1M

As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: GPT Realtime 2.1 · nova-2-sonic

Alterne entre eles com uma linha

Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # descomente esta linha, comente a linha acima
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obter uma chave de API →

FAQ

Qual é mais barato, GPT Realtime 2.1 ou nova-2-sonic?

nova-2-sonic é mais barato em entrada de áudio / 1m tokens ($3 vs $32, com 11× de diferença). Outras linhas podem apontar para o outro lado — a tabela acima traz o quadro completo, e o custo real depende do seu mix.

Posso fazer um teste A/B de GPT Realtime 2.1 contra nova-2-sonic sem duas integrações?

Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.

GPT Realtime 2.1 e nova-2-sonic suportam prompt caching?

O preço de leitura em cache está listado para apenas um dos dois em nosso feed; onde falta uma taxa, o provedor não precifica as leituras em cache separadamente.

Comparações relacionadas