🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT Realtime 2.1 vs nova-2-sonic

vs

Cuál usar y cuándo — veredicto seleccionado, no una tabla de benchmarks

Ambos son modelos de audio y texto en tiempo real facturados por millón de tokens, por lo que las tarifas se comparan directamente: nova-2-sonic cobra $3 de entrada de audio y $12 de salida de audio frente a los $32 y $64 de gpt-realtime-2.1, y $0.06/$0.24 en texto frente a $4/$24, con 1000000 de contexto y 64000 de salida máxima en lugar de 128000 y 32000. Elige nova-2-sonic para sesiones de voz largas y sensibles al costo si su límite de conexión de 8 minutos y la inferencia in-Region-only se adaptan a ti; elige el más reciente gpt-realtime-2.1 (lanzado el 2026-07-06) cuando desees lecturas de entrada en caché a $0.4 y ninguna de dichas restricciones de sesión o región

Precios

GPT Realtime 2.1 nova-2-sonic Δ
Entrada de audio / 1M tokens $32 $3 11×
Salida de audio / 1M tokens $64 $12 5.3×
Lectura de caché de audio / 1M tokens $0.4
Entrada de texto / 1M tokens $4 $0.06 67×
Salida de texto / 1M tokens $24 $0.24 100×
Escritura en caché sin cargo por separado sin cargo por separado

Tarifas del catálogo en vivo en el momento de la compilación; la página de cada modelo incluye la ficha actualizada.

Dónde se sitúan — precio por 1M de tokens de audio en todos los 6 modelos de voz a voz en tiempo real en esta unidad de facturación (escala logarítmica)

Capacidades

GPT Realtime 2.1 nova-2-sonic
Caché de prompt implícito (automático) no soportado
Tiempo de vida de la caché 5–10m, up to 1h no aplicable
Prefijo mínimo en caché 1024 tokens no aplicable

Especificaciones

GPT Realtime 2.1 nova-2-sonic
Modalidades de entrada texto audio texto audio
Modalidades de salida texto audio texto audio
Lanzamiento 2026-07-06 2025-12-02
Límite de conocimiento 2024-09
Voces

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Capacidades de sesión
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Ventana de contexto 128K 1M

Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica una fila, se omite en lugar de inferirse. Fuentes completas: GPT Realtime 2.1 · nova-2-sonic

Cambia entre ellos con una línea

Ambos IDs están en cada pestaña a continuación — el par de líneas resaltadas es la única edición. Mismo endpoint, misma clave, misma estructura de solicitud.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # descomenta esta línea, comenta la de arriba
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Obtén una clave de API →

Preguntas frecuentes

¿Cuál es más barato, GPT Realtime 2.1 o nova-2-sonic?

nova-2-sonic es más barato en entrada de audio / 1m tokens ($3 vs $32, con una diferencia de 11×). Otras filas pueden indicar lo contrario — la tabla anterior muestra la ficha completa, y el costo real depende de su combinación.

¿Puedo hacer pruebas A/B de GPT Realtime 2.1 frente a nova-2-sonic sin dos integraciones?

Sí. Ambos se sirven a través del mismo endpoint compatible con OpenAI con una clave API — el cambio es una modificación de una línea en la cadena del modelo, por lo que puede enrutar una fracción del tráfico a cada uno y comparar las facturas directamente.

¿Admiten GPT Realtime 2.1 y nova-2-sonic caché de prompts?

Los precios de lectura en caché figuran para solo uno de los dos en nuestro feed; donde falta una tarifa, el proveedor no cobra las lecturas en caché por separado.

Comparaciones relacionadas