Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

gemini-3.1-flash-live

Rilasciato 2026-03-26

beta su invito Chiamata di strumentiRagionamentoVisione

Gemini 3.1 Flash Live è il modello audio-to-audio a bassa latenza di Google per il dialogo in tempo reale e le applicazioni voice-first, e la sua pagina del modello gli attribuisce rilevamento delle sfumature acustiche, precisione numerica e consapevolezza multimodale.

Input
testo immagine audio video $0.75/M
Output
testo audio $4.5/M
Input audio
$3/M
Output audio
$12/M

Il prezzo nel contesto

Posizione del prezzo tra 6 modelli comparabili

Input$0.75/M
$0.06 · nova-2-sonic GPT Realtime · $4
Output$4.5/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 131.072
Output massimo (specifica del vendor) 65.536

Ragionamento

Parametro del fornitore thinkingLevel
Valori accettati minimal · low · medium · high
Valore predefinito minimal applicato se la richiesta non specifica nulla
Disattivabile No
Comportamento del ragionamento Il valore predefinito è minimal per ottimizzare la latenza più bassa; i modelli Gemini 3 Live hanno sostituito il thinkingBudget dei 2.5 Live con un livello.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Audio

Lingue Più di 90 lingue per la conversazione multimodale in tempo reale
Limiti audio
  • Sessione Live API: PCM grezzo a 16 bit little-endian, 16 kHz in input e 24 kHz in output
  • sessioni solo audio limitate a 15 minuti (2 minuti con video) salvo estensione tramite la gestione della sessione
  • contesto di sessione da 128k token
Trascrizione in streaming

Tempo reale

Voci Qualsiasi voce del set di voci text-to-speech di Gemini; i modelli con output ad audio nativo cambiano lingua in modo naturale nel corso di una conversazione.
Sessione
  • Il function calling è solo sequenziale: il modello non inizia a rispondere finché non viene inviata la risposta dello strumento
  • grounding di ricerca e thinking supportati
  • l'interruzione VAD annulla la generazione in corso
  • nessun caching, output strutturati, esecuzione di codice o Batch API

Modello

Modalità testo + immagine + audio + video → testo + audio

Modello audio-to-audio a bassa latenza per agent voice-first, documentato per il rilevamento delle sfumature acustiche, la precisione numerica e la consapevolezza multimodale. Usa thinkingLevel (minimal / low / medium / high) al posto di thinkingBudget, con valore predefinito minimal per la latenza più bassa.

fonte: documentazione ufficiale Google ↗

Usa gemini-3.1-flash-live in 30 secondi

Compatibile con OpenAI Realtime: collegati via WebSocket, audio in ingresso e in uscita. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Informazioni su gemini-3.1-flash-live

  • Accetta testo, immagini, audio e video e restituisce testo e audio sul WebSocket con stato della Live API, con un limite di 131.072 token in input e di 65.536 token in output, otto volte il tetto di output del modello native-audio 2.5 che sostituisce.
  • Function calling, search grounding e thinking sono supportati, mentre caching, output strutturati, esecuzione di codice e la Batch API no, e la profondità del thinking si imposta con thinkingLevel a minimal, low, medium o high, con predefinito minimal per la latenza più bassa invece del thinkingBudget numerico usato dalla generazione 2.5.
  • Le note di migrazione sono la parte utile, perché questo upgrade toglie oltre ad aggiungere.
  • Il function calling asincrono non è ancora supportato, quindi le chiamate sono sequenziali e il modello non inizia a rispondere finché non arriva la risposta dello strumento; l'audio proattivo e il dialogo affettivo non ci sono più e la loro configurazione va rimossa.
  • Un singolo evento del server può ora trasportare più parti di contenuto insieme, per esempio un chunk audio e una trascrizione, quindi i client che leggono solo la prima parte perderanno silenziosamente contenuto.
  • La copertura del turno ora include di default l'attività audio rilevata e tutti i fotogrammi video, il che può alzare i costi per le applicazioni che trasmettono video in continuo, e il contenuto del client può soltanto inizializzare la cronologia iniziale.
  • Synthorai lo serve tramite l'endpoint WebSocket /v1/realtime compatibile OpenAI.

FAQ

L'API di gemini-3.1-flash-live si può provare gratis?

gemini-3.1-flash-live è attualmente in beta su invito: l'accesso avviene su candidatura, non con registrazione aperta. Invia la richiesta dalla console Synthorai; una volta approvata si applicano le normali tariffe con pagamento a consumo, senza abbonamento.

In cosa eccelle gemini-3.1-flash-live?

Modello audio-to-audio per dialogo in tempo reale e applicazioni voice-first; otto volte il tetto di output del modello native-audio 2.5; niente function calling asincrono, quindi le chiamate agli strumenti sono sequenziali. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa gemini-3.1-flash-live?

Su Synthorai, gemini-3.1-flash-live costa $0.75 per milione di token in input e $4.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Come si chiama l'API di gemini-3.1-flash-live?

gemini-3.1-flash-live è un modello speech-to-speech: collegati via WebSocket a wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live con l'SDK OpenAI Realtime (o un WebSocket grezzo) e trasmetti audio in ingresso e in uscita. Non è un caricamento di file POST /v1/audio/transcriptions. Autenticati con la tua chiave sk-syn e invia solo l'header Authorization (il protocollo beta è dismesso).

Come ottengo l'accesso a gemini-3.1-flash-live?

gemini-3.1-flash-live è in beta su invito: richiedi l'accesso dalla console Synthorai. Una volta approvato funziona come ogni altro modello: punta il tuo SDK OpenAI a base_url="https://synthorai.io/v1" e imposta model="gemini-3.1-flash-live".

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →