Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

gemini-2.5-flash-native-audio

beta por invitación Llamada a herramientasRazonamiento

Gemini 2.5 Flash Native Audio es el modelo de audio nativo de Google para la Live API, que su página de modelo describe como habilitador de interacciones de voz y vídeo en tiempo real y de baja latencia con Gemini 2.5 Flash: procesa flujos continuos de audio, vídeo o texto y responde con voz inmediata y de sonido humano, en lugar de encadenar un transcriptor y un sintetizador.

Entrada
texto audio vídeo $0.5/M
Salida
texto audio $2/M
Entrada de audio
$3/M
Salida de audio
$12/M
Corte de conocimiento
2025-01

Benchmarks

gemini-2.5-flash-native-audio: 8 publicados, pero ningún benchmark compartido con suficientes modelos para comparar.

gemini-2.5-flash-native-audio otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

Publicado por los proveedores: Amazon OpenAI

El precio en contexto

Posición del precio entre 6 modelos comparables

Entrada$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
Salida$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 131.072
Salida máxima (especificación del proveedor) 8192
Corte de conocimiento 2025-01

Razonamiento

Parámetro del proveedor thinkingBudget
Valor por defecto pensamiento dinámico se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La guía de la Live API documenta que este modelo 2.5 Live usa un presupuesto de tokens en lugar de un nivel: pensamiento dinámico activado por defecto, thinkingBudget 0 para desactivarlo.
Parámetro reasoning_effort
Valores minimal · low · medium · high el conjunto aceptado es del proveedor

Audio

Límites de audio
  • Sesión de la Live API: PCM de 16 bits en bruto little-endian, 16 kHz de entrada y 24 kHz de salida
  • las sesiones solo de audio se limitan a 15 minutos (2 minutos con vídeo) salvo que se amplíen mediante la gestión de sesiones
  • contexto de sesión de 128k tokens
Transcripción en streaming

Tiempo real

Voces Cualquier voz del conjunto de voces de texto a voz de Gemini; los modelos con salida de audio nativa cambian de idioma con naturalidad durante una conversación.
Sesión
  • Llamada a funciones admitida, con declaraciones de función NON_BLOCKING que permiten al modelo seguir hablando mientras se ejecuta una herramienta
  • la interrupción por VAD cancela y descarta la generación en curso
  • grounding de búsqueda y pensamiento admitidos
  • sin caché, salidas estructuradas, ejecución de código ni Batch API

Modelo

Modalidades texto + audio + vídeo → texto + audio

Modelo de audio nativo de la Live API que procesa audio en bruto de extremo a extremo en lugar de encadenar STT y TTS. La página de modelo de Google indica un corte de conocimiento de enero de 2025 y un límite de salida inusualmente pequeño de 8192 tokens junto a una ventana de entrada de 131.072 tokens.

según documentación oficial de Google ↗

Use gemini-2.5-flash-native-audio en 30 segundos

Compatible con OpenAI Realtime: conéctate por WebSocket, audio de entrada y de salida. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Acerca de gemini-2.5-flash-native-audio

  • Las sesiones se ejecutan sobre un WebSocket con estado, que acepta PCM de 16 bits sin procesar a 16 kHz en la entrada y lo devuelve a 24 kHz, y el modelo acepta audio, vídeo y texto y devuelve audio y texto.
  • Los límites de tokens son 131.072 de entrada y unos inusualmente reducidos 8192 de salida, la ventana de contexto de la sesión es de 128k tokens para los modelos de audio nativo, y las sesiones solo de audio duran 15 minutos, o 2 minutos con vídeo, salvo que se amplíen mediante la gestión de sesiones.
  • Se admiten la llamada a funciones, el grounding de búsqueda y el pensamiento; no se admiten la caché, las salidas estructuradas, la ejecución de código ni la Batch API.
  • Dos capacidades distinguen a esta generación del modelo Live más reciente y son la razón para permanecer en ella: el audio proactivo, que permite al modelo decidir no responder cuando la entrada no es relevante, y el diálogo afectivo, que adapta el estilo de la respuesta a la expresión y el tono de quien habla.
  • Aquí también se admite la llamada a funciones asíncrona, de modo que una declaración marcada como no bloqueante permite al modelo seguir hablando mientras se ejecuta una herramienta.
  • Las voces proceden del conjunto de texto a voz de Google, la salida de audio nativo cambia de idioma con naturalidad durante una conversación y no acepta un código de idioma explícito, y la fecha de corte de conocimiento es enero de 2025.
  • Synthorai lo expone a través del endpoint WebSocket /v1/realtime compatible con OpenAI que usa para el resto de su catálogo de voz.

Preguntas frecuentes

¿Se puede probar gratis la API de gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio está actualmente en beta por invitación: el acceso se otorga por solicitud, no por registro abierto. Solicítelo desde la consola de Synthorai; una vez aprobado, se aplica la tarifa estándar de pago por uso, sin suscripción.

¿En qué destaca gemini-2.5-flash-native-audio?

Voz y vídeo en tiempo real de baja latencia sobre la Live API; audio proactivo y diálogo afectivo, ausentes en el modelo Live más reciente; las sesiones solo de audio duran 15 minutos, dos con vídeo. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio cuesta $0.5 por millón de tokens de entrada y $2 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿Cómo se llama a la API de gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio es un modelo speech-to-speech: conéctate por WebSocket a wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio con el SDK de OpenAI Realtime (o un WebSocket sin procesar) y transmite audio de entrada y de salida. No es una subida de archivo POST /v1/audio/transcriptions. Autentícate con tu clave sk-syn y envía solo la cabecera Authorization (el protocolo beta está retirado).

¿Cómo obtengo acceso a gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio está en beta por invitación: solicite acceso desde la consola de Synthorai. Una vez aprobado, funciona como cualquier otro modelo: apunte su SDK de OpenAI a base_url="https://synthorai.io/v1" y configure model="gemini-2.5-flash-native-audio".

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →