Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

gemini-2.5-flash-native-audio

beta su invito Chiamata di strumentiRagionamento

Gemini 2.5 Flash Native Audio è il modello native-audio di Google per la Live API, che la pagina del modello descrive come abilitante interazioni vocali e video in tempo reale e a bassa latenza con Gemini 2.5 Flash: elabora flussi continui di audio, video o testo e risponde con parlato immediato e simile a quello umano invece di concatenare un trascrittore e un sintetizzatore.

Input
testo audio video $0.5/M
Output
testo audio $2/M
Input audio
$3/M
Output audio
$12/M
Cutoff di conoscenza
2025-01

Benchmark

gemini-2.5-flash-native-audio: 8 pubblicati, ma nessun benchmark condiviso con abbastanza modelli per confrontare.

gemini-2.5-flash-native-audio altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

Dati pubblicati dai fornitori: Amazon OpenAI

Il prezzo nel contesto

Posizione del prezzo tra 6 modelli comparabili

Input$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
Output$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 131.072
Output massimo (specifica del vendor) 8.192
Cutoff di conoscenza 2025-01

Ragionamento

Parametro del fornitore thinkingBudget
Valore predefinito thinking dinamico applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La guida alla Live API documenta questo modello 2.5 Live come basato su un budget di token anziché su un livello: thinking dinamico attivo di default, thinkingBudget 0 per disattivarlo.
Parametro reasoning_effort
Valori minimal · low · medium · high l'insieme accettato è del provider

Audio

Limiti audio
  • Sessione Live API: PCM grezzo a 16 bit little-endian, 16 kHz in input e 24 kHz in output
  • sessioni solo audio limitate a 15 minuti (2 minuti con video) salvo estensione tramite la gestione della sessione
  • contesto di sessione da 128k token
Trascrizione in streaming

Tempo reale

Voci Qualsiasi voce del set di voci text-to-speech di Gemini; i modelli con output ad audio nativo cambiano lingua in modo naturale nel corso di una conversazione.
Sessione
  • Function calling supportato, con le dichiarazioni di funzione NON_BLOCKING che permettono al modello di continuare a parlare mentre uno strumento è in esecuzione
  • l'interruzione VAD annulla e scarta la generazione in corso
  • grounding di ricerca e thinking supportati
  • nessun caching, output strutturati, esecuzione di codice o Batch API

Modello

Modalità testo + audio + video → testo + audio

Modello Live API ad audio nativo che elabora l'audio grezzo end to end invece di concatenare STT e TTS. La pagina del modello di Google indica un cutoff di conoscenza a gennaio 2025 e un limite di output insolitamente ridotto di 8.192 token accanto alla finestra di input da 131.072 token.

fonte: documentazione ufficiale Google ↗

Usa gemini-2.5-flash-native-audio in 30 secondi

Compatibile con OpenAI Realtime: collegati via WebSocket, audio in ingresso e in uscita. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Informazioni su gemini-2.5-flash-native-audio

  • Le sessioni girano su un WebSocket con stato, prendendo in ingresso PCM grezzo a 16 bit a 16 kHz e restituendolo a 24 kHz, e il modello accetta audio, video e testo restituendo audio e testo.
  • I limiti di token sono 131.072 in input e un valore insolitamente piccolo di 8.192 in output, la finestra di contesto della sessione è di 128k token per i modelli native-audio, e le sessioni solo audio durano 15 minuti, o 2 minuti con il video, se non estese tramite la gestione della sessione.
  • Function calling, search grounding e thinking sono supportati; caching, output strutturati, esecuzione di codice e la Batch API no.
  • Due capacità distinguono questa generazione dal Live model più recente e sono la ragione per restare su di essa: l'audio proattivo, che consente al modello di decidere di non rispondere quando l'input non è pertinente, e il dialogo affettivo, che adatta lo stile della risposta all'espressione e al tono di chi parla.
  • Anche il function calling asincrono è supportato qui, quindi una dichiarazione contrassegnata come non bloccante permette al modello di continuare a parlare mentre uno strumento gira.
  • Le voci provengono dal set text-to-speech di Google, l'output native-audio cambia lingua in modo naturale durante una conversazione e non accetta un codice lingua esplicito, e il cutoff di conoscenza è gennaio 2025.
  • Synthorai lo espone tramite l'endpoint WebSocket /v1/realtime compatibile OpenAI usato per il resto del suo catalogo vocale.

FAQ

L'API di gemini-2.5-flash-native-audio si può provare gratis?

gemini-2.5-flash-native-audio è attualmente in beta su invito: l'accesso avviene su candidatura, non con registrazione aperta. Invia la richiesta dalla console Synthorai; una volta approvata si applicano le normali tariffe con pagamento a consumo, senza abbonamento.

In cosa eccelle gemini-2.5-flash-native-audio?

Voce e video in tempo reale a bassa latenza sulla Live API; audio proattivo e dialogo affettivo, assenti dal Live model più recente; sessioni solo audio di 15 minuti, due con il video. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa gemini-2.5-flash-native-audio?

Su Synthorai, gemini-2.5-flash-native-audio costa $0.5 per milione di token in input e $2 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Come si chiama l'API di gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio è un modello speech-to-speech: collegati via WebSocket a wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio con l'SDK OpenAI Realtime (o un WebSocket grezzo) e trasmetti audio in ingresso e in uscita. Non è un caricamento di file POST /v1/audio/transcriptions. Autenticati con la tua chiave sk-syn e invia solo l'header Authorization (il protocollo beta è dismesso).

Come ottengo l'accesso a gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio è in beta su invito: richiedi l'accesso dalla console Synthorai. Una volta approvato funziona come ogni altro modello: punta il tuo SDK OpenAI a base_url="https://synthorai.io/v1" e imposta model="gemini-2.5-flash-native-audio".

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →