🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT Realtime Lançado em 2025-08-28

OpenAI beta por convite realtime audio
Entrada$4/M
Saída$16/M
Entrada de áudio$32/M
Saída de áudio$64/M
Leitura de cache$0.4/M
Corte de conhecimento2023-10

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing. Entrada efetiva com taxa de acerto de cache de 70%:$1.48/M. Cache de prefixo automático assim que um prompt passa do comprimento mínimo, sem mudanças de código; as leituras em cache têm desconto (até 90% nos modelos atuais) e não há taxa de gravação.

Use o GPT Realtime em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o GPT Realtime

Voz para voz em um único modelo, sem cadeia de transcrição
áudio natural expressivo com chamadas de função
Snapshot GA original da família realtime

O GPT Realtime é o primeiro modelo realtime da OpenAI em disponibilidade geral (GA): um único modelo de voz para voz (speech-to-speech) que escuta e responde diretamente com áudio natural e expressivo, em vez de encadear modelos separados de transcrição e síntese.

  • Carrega uma janela de contexto de 32K tokens com até 4.096 tokens de saída, suporta chamadas de função para fluxos de agentes de voz e aceita áudio ou texto de entrada com áudio e texto de saída; áudio e texto são cobrados a tarifas por token separadas, com entrada em cache com desconto.
  • Continua disponível como o snapshot GA original da família realtime.
  • A Synthorai serve o GPT Realtime pelo endpoint WebSocket /v1/realtime compatível com OpenAI, então clientes do SDK oficial de Realtime conectam sem alterações.

Especificações e limites

Saída máxima (especificação do fornecedor)4,096
Modalidadesaudio + text → audio + text
Recursosrealtime · speech-to-speech
DestaquesOpenAI's first general-availability realtime model (snapshot gpt-realtime-2025-08-28): native speech-to-speech with function calling; 32k context.
Cache de promptsautomático · prefixo mínimo de 1,024 tokens · TTL 5–10m, up to 1h

conforme documentação oficial da OpenAI ↗

Perguntas frequentes

A API do GPT Realtime é gratuita para testar?

O GPT Realtime está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o GPT Realtime é melhor?

Voz para voz em um único modelo, sem cadeia de transcrição, além de áudio natural expressivo com chamadas de função e snapshot GA original da família realtime. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT Realtime?

Na Synthorai, o GPT Realtime custa $4 por milhão de tokens de entrada e $16 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.4/M.

Como chamar a API do GPT Realtime?

GPT Realtime é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gpt-realtime com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e espelhe o cabeçalho OpenAI-Beta.

Como obtenho acesso ao GPT Realtime?

O GPT Realtime está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gpt-realtime".

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →