Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime 2.1

Lançado em 2026-07-06

beta por convite

O GPT Realtime 2.1 é o carro-chefe da família realtime de voz para voz da OpenAI, anunciado como um modelo de raciocínio realtime atualizado com reconhecimento alfanumérico, tratamento de silêncio e ruído e comportamento de interrupção aprimorados.

Entrada
áudio texto $4/M
Saída
áudio texto $24/M
Entrada de áudio
$32/M
Saída de áudio
$64/M
Leitura de cache
$0.4/M
Corte de conhecimento
2024-09

O preço em contexto

Posição do preço entre 6 modelos comparáveis

Entrada$4/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24
Leitura em cache$0.4/M
$0.06 · GPT Realtime 2.1 Mini GPT Realtime · $0.4

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 128.000
Saída máxima (especificação do fornecedor) 32.000
Corte de conhecimento 2024-09

Cache de prompts

Modo automático
Prefixo mín. 1.024
Duração 5-10 min, até 1 hora

Tempo real

Sessão
  • Fala-para-fala sobre WebSocket
  • esforço de raciocínio configurável
  • uso de ferramentas
  • tratamento de interrupções
  • contexto de 128K

Modelo

Modalidades áudio + texto → áudio + texto
  • Modelo realtime de raciocínio atualizado, com melhor reconhecimento alfanumérico, melhor tratamento de silêncio e ruído e melhor comportamento de interrupção
  • esforço de raciocínio configurável e uso de ferramentas para fluxos de agentes de voz
  • contexto de 128k

conforme documentação oficial da OpenAI ↗

Use o GPT Realtime 2.1 em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o GPT Realtime 2.1

  • Ele expande a família para uma janela de contexto de 128K tokens com 32K tokens de saída máxima, e suporta esforço de raciocínio configurável, seguimento de instruções e uso de ferramentas para fluxos complexos de agentes de voz.
  • Tokens de áudio e texto são cobrados a tarifas por token separadas, com entrada em cache com desconto.
  • O guia de realtime da OpenAI o nomeia como o modelo a escolher ao construir um agente de voz de baixa latência, e recomenda começar com esforço de raciocínio low para a maioria dos agentes de produção, elevando-o apenas onde a tarefa justificar a latência adicional.
  • As sessões rodam por WebRTC, WebSocket ou SIP, e a alternância de turnos pode usar detecção de atividade de voz baseada em silêncio ou um detector semântico cuja configuração de avidez decide com quanta paciência ele espera o falante terminar.
  • O tratamento de interrupções faz parte do protocolo: com a detecção ativada, o servidor trunca o áudio não reproduzido, e espera-se que os clientes WebSocket parem a reprodução e reportem quanto áudio de fato chegou ao ouvinte.
  • As ferramentas podem ser declaradas por sessão ou por resposta, e respostas podem ser geradas fora da conversa principal quando uma tarefa paralela não deve poluir a transcrição.
  • Na Synthorai, é servido pelo endpoint WebSocket /v1/realtime compatível com OpenAI, de modo que aplicações construídas sobre os SDKs oficiais de Realtime funcionam sem mudanças.

Perguntas frequentes

A API do GPT Realtime 2.1 é gratuita para testar?

O GPT Realtime 2.1 está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o GPT Realtime 2.1 é melhor?

Nível realtime carro-chefe para agentes de voz em produção; tratamento aprimorado de interrupção, ruído e alfanuméricos; esforço de raciocínio configurável com ferramentas. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT Realtime 2.1?

Na Synthorai, o GPT Realtime 2.1 custa $4 por milhão de tokens de entrada e $24 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.4/M.

Como chamar a API do GPT Realtime 2.1?

GPT Realtime 2.1 é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1 com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao GPT Realtime 2.1?

O GPT Realtime 2.1 está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gpt-realtime-2.1".

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →