🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

vs

Quale scegliere e quando — verdetto curato, non una tabella di benchmark

Il livello mini è più economico su ogni riga — $0.6 e $2.4 per milione di token testuali contro $4 e $24, e $10 e $20 per milione di audio in ingresso e uscita contro $32 e $64 — cioè circa 3x in meno sull'audio e quasi 7x sull'input testuale. Entrambi portano un contesto di sessione da 128K con voce-a-voce, uso di strumenti e caching dei prompt; il modello completo documenta in più uno sforzo di ragionamento configurabile e la gestione delle interruzioni. Scegli il mini per il volume, il modello completo quando vuoi regolare lo sforzo di ragionamento per sessione.

Prezzi

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
Input audio / 1M token $32 $10 3.2×
Output audio / 1M token $64 $20 3.2×
Lettura cache audio / 1M token $0.4 $0.3 1.3×
Input di testo / 1M token $4 $0.6 6.7×
Output di testo / 1M token $24 $2.4 10×
Scrittura in cache nessun addebito separato nessun addebito separato

Le tariffe provengono dal catalogo live al momento della build; la pagina di ciascun modello riporta la scheda attuale.

Dove si posizionano — prezzo per 1M di token audio rispetto a tutti gli 6 modelli speech-to-speech in tempo reale con questa unità di fatturazione (scala logaritmica)

Capacità

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Prompt caching implicito (automatico) implicito (automatico)
Durata della cache 5–10m, up to 1h 5–10m, up to 1h
Prefisso minimo in cache 1024 token 1024 token

Specifiche

GPT Realtime 2.1 GPT Realtime 2.1 Mini
Modalità di input testo audio testo audio
Modalità di output testo audio testo audio
Rilascio 2026-07-06 2026-07-06
Cutoff di conoscenza 2024-09 2024-09
Funzionalità di sessione
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
Finestra di contesto 128K 128K

Le specifiche sono trascritte dalla documentazione di ciascun fornitore; una riga che un fornitore non pubblica viene omessa anziché essere dedotta. Fonti complete: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

Passa dall'uno all'altro con una sola riga

Entrambi gli id sono presenti in ogni scheda qui sotto — la coppia di righe evidenziata è l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni una chiave API →

FAQ

Qual è più economico, GPT Realtime 2.1 o GPT Realtime 2.1 Mini?

GPT Realtime 2.1 Mini è più economico per input audio / 1m token ($10 contro $32, 3.2× di differenza). Altre righe potrebbero indicare il contrario — la tabella sopra riporta la scheda completa, e il costo reale dipende dal tuo mix.

Posso fare un A/B test di GPT Realtime 2.1 contro GPT Realtime 2.1 Mini senza due integrazioni?

Sì. Entrambi sono serviti tramite lo stesso endpoint compatibile con OpenAI con una singola chiave API — il passaggio richiede la modifica della stringa del modello in una sola riga, quindi puoi instradare una frazione del traffico verso ciascuno e confrontare direttamente le fatture.

GPT Realtime 2.1 e GPT Realtime 2.1 Mini supportano il prompt caching?

Sì — entrambi fatturano le letture in cache a un prezzo inferiore rispetto alla loro tariffa di input, quindi i carichi di lavoro con warm-prefix costano meno di quanto suggeriscano le tariffe di listino. Le righe esatte per la lettura in cache si trovano nella tabella dei prezzi qui sopra.

Confronti correlati