Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime

Lançado em 2025-08-28

beta por convite

O GPT Realtime é o primeiro modelo realtime da OpenAI em disponibilidade geral: um único modelo de voz para voz (speech-to-speech) que escuta e responde diretamente com áudio natural e expressivo, em vez de encadear modelos separados de transcrição e síntese.

Entrada
áudio texto $4/M
Saída
áudio texto $16/M
Entrada de áudio
$32/M
Saída de áudio
$64/M
Leitura de cache
$0.4/M
Corte de conhecimento
2023-10

Benchmarks

GPT Realtime: 8 publicados, mas nenhum benchmark partilhado com modelos suficientes para comparar.

GPT Realtime outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
AMI near+far field (WER)
35.9%
Big Bench Audio
82.8%
BFCL v3 (single-turn, python only)
80.4%

Publicado pelos fornecedores: Amazon OpenAI

O preço em contexto

Posição do preço entre 6 modelos comparáveis

Entrada$4/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$16/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24
Leitura em cache$0.4/M
$0.06 · GPT Realtime 2.1 Mini GPT Realtime · $0.4

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 32.000
Saída máxima (especificação do fornecedor) 4.096
Corte de conhecimento 2023-10

Cache de prompts

Modo automático
Prefixo mín. 1.024
Duração 5-10 min, até 1 hora

Tempo real

Sessão Fala-para-fala nativa sobre WebSocket · function calling · contexto de 32K

Modelo

Modalidades áudio + texto → áudio + texto
  • Primeiro modelo realtime em disponibilidade geral da OpenAI (snapshot gpt-realtime-2025-08-28): fala-para-fala nativa com function calling
  • contexto de 32k

conforme documentação oficial da OpenAI ↗

Use o GPT Realtime em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o GPT Realtime

  • Ele carrega uma janela de contexto de 32K tokens com 4.096 tokens de saída máxima, suporta function calling para fluxos de agentes de voz e aceita áudio ou texto de entrada com áudio e texto de saída; áudio e texto são cobrados a tarifas por token separadas, com entrada em cache com desconto.
  • As sessões podem ser conduzidas por WebRTC para clientes de navegador e móveis, por WebSocket quando um servidor já detém o fluxo de áudio, ou por SIP para agentes de telefonia, com detecção de atividade de voz no servidor fatiando a fala e truncando o áudio não reproduzido quando quem liga interrompe.
  • A página do modelo também lista entrada de imagem ao lado de texto e áudio, e as vozes são escolhidas por sessão a partir do conjunto publicado da OpenAI, com a ressalva de que uma voz não pode ser trocada depois que a sessão emitiu áudio.
  • Ele não tem controle de esforço de raciocínio (isso chega com a geração 2.1), e seu corte de conhecimento é outubro de 2023.
  • A OpenAI já anunciou sua descontinuação, com desligamento previsto para janeiro de 2027 e o GPT Realtime 2.1 nomeado como alvo de migração, então novo trabalho de voz pertence ao 2.1 enquanto as integrações existentes ainda têm prazo.
  • Ele permanece disponível como o snapshot GA original da família realtime.
  • A Synthorai serve o GPT Realtime pelo endpoint WebSocket /v1/realtime compatível com OpenAI, então clientes do SDK oficial de Realtime conectam sem alterações.

Perguntas frequentes

A API do GPT Realtime é gratuita para testar?

O GPT Realtime está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o GPT Realtime é melhor?

Voz para voz em um único modelo, sem cadeia de transcrição; áudio natural expressivo com chamadas de função; snapshot GA original da família realtime. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT Realtime?

Na Synthorai, o GPT Realtime custa $4 por milhão de tokens de entrada e $16 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.4/M.

Como chamar a API do GPT Realtime?

GPT Realtime é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gpt-realtime com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao GPT Realtime?

O GPT Realtime está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gpt-realtime".

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →