🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT Realtime Lanzamiento: 2025-08-28

OpenAI beta por invitación realtime audio
Entrada$4/M
Salida$16/M
Entrada de audio$32/M
Salida de audio$64/M
Lectura de caché$0.4/M
Corte de conocimiento2023-10

Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing. Precio de entrada efectivo con una tasa de aciertos de caché del 70%:$1.48/M. Caché de prefijos automática una vez que un prompt supera la longitud mínima, sin cambios de código; las lecturas en caché tienen descuento (hasta un 90% en los modelos actuales) y no hay tarifa de escritura.

Use GPT Realtime en 30 segundos

Compatible con OpenAI Realtime: conéctate por WebSocket, audio de entrada y de salida. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Acerca de GPT Realtime

Voz a voz en un solo modelo, sin cadena de transcripción
Audio natural expresivo con llamadas a funciones
instantánea GA original de la familia realtime

GPT Realtime es el primer modelo realtime de OpenAI en disponibilidad general (GA): un único modelo de voz a voz (speech-to-speech) que escucha y responde directamente con audio natural y expresivo, en lugar de encadenar modelos separados de transcripción y síntesis.

  • Lleva una ventana de contexto de 32K tokens con hasta 4,096 tokens de salida, admite llamadas a funciones para flujos de agentes de voz, y acepta audio o texto de entrada con audio y texto de salida; el audio y el texto se facturan a tarifas por token separadas, con entrada en caché con descuento.
  • Sigue disponible como la instantánea GA original de la familia realtime.
  • Synthorai sirve GPT Realtime a través del endpoint WebSocket /v1/realtime compatible con OpenAI, de modo que los clientes del SDK oficial de Realtime se conectan sin cambios.

Especificaciones y límites

Salida máxima (especificación del proveedor)4,096
Modalidadesaudio + text → audio + text
Funcionesrealtime · speech-to-speech
DestacadoOpenAI's first general-availability realtime model (snapshot gpt-realtime-2025-08-28): native speech-to-speech with function calling; 32k context.
Caché de promptsautomático · prefijo mínimo de 1,024 tokens · TTL 5–10m, up to 1h

según documentación oficial de OpenAI ↗

Preguntas frecuentes

¿Se puede probar gratis la API de GPT Realtime?

GPT Realtime está actualmente en beta por invitación: el acceso se otorga por solicitud, no por registro abierto. Solicítelo desde la consola de Synthorai; una vez aprobado, se aplica la tarifa estándar de pago por uso, sin suscripción.

¿En qué destaca GPT Realtime?

Voz a voz en un solo modelo, sin cadena de transcripción, además de audio natural expresivo con llamadas a funciones y instantánea GA original de la familia realtime. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GPT Realtime?

GPT Realtime cuesta $4 por millón de tokens de entrada y $16 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.4/M.

¿Cómo se llama a la API de GPT Realtime?

GPT Realtime es un modelo speech-to-speech: conéctate por WebSocket a wss://synthorai.io/v1/realtime?model=gpt-realtime con el SDK de OpenAI Realtime (o un WebSocket sin procesar) y transmite audio de entrada y de salida. No es una subida de archivo POST /v1/audio/transcriptions. Autentícate con tu clave sk-syn y replica la cabecera OpenAI-Beta.

¿Cómo obtengo acceso a GPT Realtime?

GPT Realtime está en beta por invitación: solicite acceso desde la consola de Synthorai. Una vez aprobado, funciona como cualquier otro modelo: apunte su SDK de OpenAI a base_url="https://synthorai.io/v1" y configure model="gpt-realtime".

Modelos relacionados

Obtenga su clave API gratuita Compare su costo →