Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

gemini-2.5-flash-native-audio vs gemini-3.1-flash-live

gemini-2.5-flash-native-audio è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

gemini-3.1-flash-live è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

vs

Quale scegliere e quando

Le tariffe audio sono identiche ($3 in ingresso, $12 in uscita per milione) e anche la meccanica di sessione - PCM a 16 kHz in ingresso e 24 kHz in uscita, contesto da 128k, tetto di 15 minuti in solo audio - con il più vecchio gemini-2.5-flash-native-audio leggermente più economico sul testo, $0.5 e $2 per milione contro $0.75 e $4.5. La differenza funzionale è il comportamento degli strumenti: gemini-2.5-flash-native-audio supporta le dichiarazioni di funzione NON_BLOCKING, così il modello continua a parlare mentre uno strumento gira, mentre gemini-3.1-flash-live è sequenziale e non risponde finché non arriva il risultato - ma aggiunge l'input immagine accanto a testo, audio e video. Scegli il 2.5 per conversazioni ricche di strumenti, il 3.1 per l'input immagine.

Benchmark

gemini-3.1-flash-live: il provider non ha pubblicato risultati di benchmark.

gemini-2.5-flash-native-audio: 8 pubblicati, ma nessun benchmark in comune con abbastanza altri modelli per fare un confronto.

gemini-2.5-flash-native-audio gemini-3.1-flash-live altri modelli misurati media dei modelli confrontati ★ nessun altro modello ha fatto meglio
AMI near+far field (WER)
63.8%
N/A
Big Bench Audio
71%
N/A
BFCL v3 (single-turn, python only)
69.4%
N/A

Dati pubblicati dai provider: Amazon OpenAI

Prezzi

gemini-2.5-flash-native-audio gemini-3.1-flash-live Δ
Input audio / 1M token $3 $3 =
Output audio / 1M token $12 $12 =
Input di testo / 1M token $0.5 $0.75 0.67×
Output di testo / 1M token $2 $4.5 0.44×

Tariffe lette dal catalogo live al momento della build; il listino aggiornato è sulla pagina di ciascun modello.

Dove si collocano: prezzo per 1M di token audio tra tutti i modelli di speech-to-speech in tempo reale con questa unità di fatturazione (6, scala logaritmica)

Funzionalità

gemini-2.5-flash-native-audio gemini-3.1-flash-live
Controllo del ragionamento configurabile sempre attivo
Prompt caching implicito + esplicito implicito + esplicito
Durata della cache non pubblicato non pubblicato
Prefisso minimo in cache 4096 token 4096 token

Specifiche

gemini-2.5-flash-native-audio gemini-3.1-flash-live
Modalità di input testo audio video testo immagine audio video
Modalità di output testo audio testo audio
Rilascio - 2026-03-26
Knowledge cutoff 2025-01 -
Voci

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

Funzionalità di sessione
  • Function calling supported, with NON_BLOCKING function declarations letting the model keep talking while a tool runs
  • VAD interruption cancels and discards the in-flight generation
  • search grounding and thinking supported
  • no caching, structured outputs, code execution or Batch API
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
Finestra di contesto 131K 131K

Le specifiche sono riprese dalla documentazione di ciascun provider; se un provider non pubblica un dato, la riga viene omessa e non dedotta. Fonti complete: gemini-2.5-flash-native-audio · gemini-3.1-flash-live

Passa dall'uno all'altro cambiando una sola riga

In ogni scheda qui sotto ci sono entrambi gli id: le due righe evidenziate sono l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni la tua chiave API →

FAQ

Qual è il più economico, gemini-2.5-flash-native-audio o gemini-3.1-flash-live?

Alla voce Input audio / 1M token hanno lo stesso prezzo ($3), quindi qui non è il prezzo a decidere: guarda le specifiche e le funzionalità qui sotto.

Posso fare un A/B test di gemini-2.5-flash-native-audio contro gemini-3.1-flash-live senza due integrazioni?

Sì. Si chiamano entrambi dallo stesso endpoint compatibile con OpenAI, con una sola chiave API. Per passare dall'uno all'altro basta cambiare la stringa del modello in una riga, quindi puoi mandare una parte del traffico a ciascuno e confrontare direttamente i costi.

gemini-2.5-flash-native-audio e gemini-3.1-flash-live supportano il prompt caching?

Nel nostro feed il prezzo di lettura dalla cache è indicato solo per uno dei due; dove la tariffa manca, il provider non applica un prezzo separato alle letture dalla cache.

Confronti correlati