Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT Realtime vs GPT Realtime 2.1

GPT Realtime solo está disponible por invitación. Las cifras de abajo son las tarifas en vivo, pero para llamarlo tu espacio de trabajo necesita antes un permiso: pídenos acceso antes de construir nada a partir de esta comparativa.

GPT Realtime 2.1 solo está disponible por invitación. Las cifras de abajo son las tarifas en vivo, pero para llamarlo tu espacio de trabajo necesita antes un permiso: pídenos acceso antes de construir nada a partir de esta comparativa.

vs

Cuál usar y cuándo

La entrada de texto son $4 por millón en ambos, el audio $32 de entrada y $64 de salida en ambos, y las lecturas de caché $0.4 en ambos; gpt-realtime-2.1 cobra más solo en la salida de texto, $24 frente a $16, y cuadruplica el contexto de sesión, 128K frente a 32K. También añade esfuerzo de razonamiento configurable y manejo de interrupciones a la llamada de funciones del modelo anterior. Elige gpt-realtime solo para mantener una integración existente - en todo salvo la salida de texto, el más nuevo cuesta lo mismo.

Benchmarks

GPT Realtime 2.1: el proveedor no ha publicado resultados de benchmarks.

GPT Realtime: 8 publicados, pero ningún benchmark compartido con suficientes modelos para comparar.

GPT Realtime GPT Realtime 2.1 otros modelos medidos media de los modelos comparados ★ ningún otro modelo puntuó más alto
AMI near+far field (WER)
35.9%
N/A
Big Bench Audio
82.8%
N/A
BFCL v3 (single-turn, python only)
80.4%
N/A

Publicado por los proveedores: Amazon OpenAI

Precios

GPT Realtime GPT Realtime 2.1 Δ
Entrada de audio / 1M tokens $32 $32 =
Salida de audio / 1M tokens $64 $64 =
Lectura de caché de audio / 1M tokens $0.4 $0.4 =
Entrada de texto / 1M tokens $4 $4 =
Salida de texto / 1M tokens $16 $24 0.67×
Escritura en caché sin cargo aparte sin cargo aparte -

Tarifas tomadas del catálogo en vivo al generar el sitio; la página de cada modelo tiene la ficha de precios actualizada.

Dónde queda cada uno: precio por 1M de tokens de audio entre los 6 modelos de voz a voz en tiempo real que se facturan en esta unidad (escala logarítmica)

Capacidades

GPT Realtime GPT Realtime 2.1
Caché de prompts implícito (automático) implícito (automático)
Duración de la caché 5-10m, up to 1h 5-10m, up to 1h
Prefijo mínimo en caché 1024 tokens 1024 tokens

Especificaciones

GPT Realtime GPT Realtime 2.1
Modalidades de entrada texto audio texto audio
Modalidades de salida texto audio texto audio
Lanzamiento 2025-08-28 2026-07-06
Corte de conocimiento 2023-10 2024-09
Capacidades de sesión
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Ventana de contexto 32K 128K

Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica un dato, la fila se omite en vez de deducirlo. Fuentes completas: GPT Realtime · GPT Realtime 2.1

Cambia de uno a otro con una sola línea

Los dos ids aparecen en todas las pestañas de abajo; lo único que cambia es el par de líneas resaltadas. El endpoint, la clave y la estructura de la solicitud son los mismos.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # descomenta esta línea, comenta la de arriba
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtén tu clave API →

Preguntas frecuentes

¿Cuál es más barato, GPT Realtime o GPT Realtime 2.1?

Los dos tienen el mismo precio en Entrada de audio / 1M tokens ($32), así que aquí el precio no decide: mira las especificaciones y las capacidades más abajo.

¿Puedo hacer pruebas A/B de GPT Realtime frente a GPT Realtime 2.1 sin dos integraciones?

Sí. Los dos se sirven desde el mismo endpoint compatible con OpenAI y con una sola clave API. Para cambiar de uno a otro basta con tocar una línea, el nombre del modelo, así que puedes mandar una parte del tráfico a cada uno y comparar directamente las facturas.

¿Admiten GPT Realtime y GPT Realtime 2.1 caché de prompts?

Sí. Los dos cobran las lecturas de caché por debajo de su tarifa de entrada, así que las cargas de trabajo que reutilizan un prefijo ya cacheado cuestan menos de lo que sugieren los precios de lista. Las tarifas exactas de lectura de caché están en la tabla de precios de arriba.

Comparativas relacionadas

De nuestros estudios con mediciones