Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

gemini-3.1-flash-live vs GPT Realtime 2.1

gemini-3.1-flash-live è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

GPT Realtime 2.1 è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

vs

Quale scegliere e quando

Entrambi sono modelli audio in tempo reale fatturati per milione di token, ma gemini-3.1-flash-live è l'opzione più economica: $3 per l'input audio contro $32 (circa 10.7x in meno) e $12 per l'output audio contro $64, con il testo a $0.75/$4.5 contro $4/$24 (circa 5.3x in meno). Accetta anche input di immagini e video oltre ad audio e testo, offre un contesto di 131072 token con fino a 65536 token di output, e le sue sessioni Live API hanno un limite di 15 minuti solo audio (2 minuti con video) a meno che non vengano estese. Scegli gpt-realtime-2.1 se desideri lo stack audio/testo di OpenAI con letture dalla cache a $0.4, il suo contesto di 128000 token e 32000 di output massimo.

Prezzi

gemini-3.1-flash-live GPT Realtime 2.1 Δ
Input audio / 1M token $3 $32 0.094×
Output audio / 1M token $12 $64 0.19×
Lettura cache audio / 1M token - $0.4 -
Input di testo / 1M token $0.75 $4 0.19×
Output di testo / 1M token $4.5 $24 0.19×
Scrittura in cache - nessun addebito separato -

Tariffe lette dal catalogo live al momento della build; il listino aggiornato è sulla pagina di ciascun modello.

Dove si collocano: prezzo per 1M di token audio tra tutti i modelli di speech-to-speech in tempo reale con questa unità di fatturazione (6, scala logaritmica)

Funzionalità

gemini-3.1-flash-live GPT Realtime 2.1
Controllo del ragionamento sempre attivo -
Prompt caching implicito + esplicito implicito (automatico)
Durata della cache non pubblicato 5-10m, up to 1h
Prefisso minimo in cache 4096 token 1024 token

Specifiche

gemini-3.1-flash-live GPT Realtime 2.1
Modalità di input testo immagine audio video testo audio
Modalità di output testo audio testo audio
Rilascio 2026-03-26 2026-07-06
Knowledge cutoff - 2024-09
Voci

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

-
Funzionalità di sessione
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Finestra di contesto 131K 128K

Le specifiche sono riprese dalla documentazione di ciascun provider; se un provider non pubblica un dato, la riga viene omessa e non dedotta. Fonti complete: gemini-3.1-flash-live · GPT Realtime 2.1

Passa dall'uno all'altro cambiando una sola riga

In ogni scheda qui sotto ci sono entrambi gli id: le due righe evidenziate sono l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni la tua chiave API →

FAQ

Qual è il più economico, gemini-3.1-flash-live o GPT Realtime 2.1?

gemini-3.1-flash-live costa meno alla voce Input audio / 1M token ($3 contro $32, 11× di differenza). Altre voci potrebbero dire il contrario: la tabella qui sopra riporta il listino completo, e il costo reale dipende dal tuo mix di utilizzo.

Posso fare un A/B test di gemini-3.1-flash-live contro GPT Realtime 2.1 senza due integrazioni?

Sì. Si chiamano entrambi dallo stesso endpoint compatibile con OpenAI, con una sola chiave API. Per passare dall'uno all'altro basta cambiare la stringa del modello in una riga, quindi puoi mandare una parte del traffico a ciascuno e confrontare direttamente i costi.

gemini-3.1-flash-live e GPT Realtime 2.1 supportano il prompt caching?

Nel nostro feed il prezzo di lettura dalla cache è indicato solo per uno dei due; dove la tariffa manca, il provider non applica un prezzo separato alle letture dalla cache.

Confronti correlati

Dai nostri studi con dati misurati