Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

GPT Realtime 2.1 è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

GPT Realtime 2.1 Mini è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

vs

Quale scegliere e quando

Il livello mini è più economico su ogni riga - $0.6 e $2.4 per milione di token testuali contro $4 e $24, e $10 e $20 per milione di audio in ingresso e uscita contro $32 e $64 - cioè circa 3x in meno sull'audio e quasi 7x sull'input testuale. Entrambi portano un contesto di sessione da 128K con voce-a-voce, uso di strumenti e caching dei prompt; il modello completo documenta in più uno sforzo di ragionamento configurabile e la gestione delle interruzioni. Scegli il mini per il volume, il modello completo quando vuoi regolare lo sforzo di ragionamento per sessione.

Prezzi

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Input audio / 1M token $32 $10 3.2×
Output audio / 1M token $64 $20 3.2×
Lettura cache audio / 1M token $0.4 $0.3 1.3×
Input di testo / 1M token $4 $0.6 6.7×
Output di testo / 1M token $24 $2.4 10×
Scrittura in cache nessun addebito separato nessun addebito separato -

Tariffe lette dal catalogo live al momento della build; il listino aggiornato è sulla pagina di ciascun modello.

Dove si collocano: prezzo per 1M di token audio tra tutti i modelli di speech-to-speech in tempo reale con questa unità di fatturazione (6, scala logaritmica)

Funzionalità

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Prompt caching implicito (automatico) implicito (automatico)
Durata della cache 5-10m, up to 1h 5-10m, up to 1h
Prefisso minimo in cache 1024 token 1024 token

Specifiche

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Modalità di input testo audio testo audio
Modalità di output testo audio testo audio
Rilascio 2026-07-06 2026-07-06
Knowledge cutoff 2024-09 2024-09
Funzionalità di sessione
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Finestra di contesto 128K 128K

Le specifiche sono riprese dalla documentazione di ciascun provider; se un provider non pubblica un dato, la riga viene omessa e non dedotta. Fonti complete: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Passa dall'uno all'altro cambiando una sola riga

In ogni scheda qui sotto ci sono entrambi gli id: le due righe evidenziate sono l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni la tua chiave API →

FAQ

Qual è il più economico, GPT Realtime 2.1 o GPT Realtime 2.1 Mini?

GPT Realtime 2.1 Mini costa meno alla voce Input audio / 1M token ($10 contro $32, 3.2× di differenza). Altre voci potrebbero dire il contrario: la tabella qui sopra riporta il listino completo, e il costo reale dipende dal tuo mix di utilizzo.

Posso fare un A/B test di GPT Realtime 2.1 contro GPT Realtime 2.1 Mini senza due integrazioni?

Sì. Si chiamano entrambi dallo stesso endpoint compatibile con OpenAI, con una sola chiave API. Per passare dall'uno all'altro basta cambiare la stringa del modello in una riga, quindi puoi mandare una parte del traffico a ciascuno e confrontare direttamente i costi.

GPT Realtime 2.1 e GPT Realtime 2.1 Mini supportano il prompt caching?

Sì: entrambi fanno pagare le letture dalla cache meno della tariffa di input, quindi i carichi di lavoro con un prefisso già in cache costano meno di quanto facciano pensare le tariffe di listino. Le voci esatte per la lettura dalla cache sono nella tabella dei prezzi qui sopra.

Confronti correlati

Dai nostri studi con dati misurati