Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT Realtime vs GPT Realtime 2.1

GPT Realtime è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

GPT Realtime 2.1 è disponibile su invito. Le cifre qui sotto sono le tariffe live, ma per chiamarlo il tuo workspace deve prima essere autorizzato: chiedici l'accesso prima di basare il tuo lavoro su questo confronto.

vs

Quale scegliere e quando

L'input testuale è $4 per milione su entrambi, l'audio $32 in ingresso e $64 in uscita su entrambi, e le letture di cache $0.4 su entrambi; gpt-realtime-2.1 costa di più solo sull'output testuale, $24 contro $16, e quadruplica il contesto di sessione a 128K da 32K. Aggiunge inoltre uno sforzo di ragionamento configurabile e la gestione delle interruzioni al function calling del modello precedente. Scegli gpt-realtime solo per mantenere un'integrazione esistente - su tutto tranne l'output testuale il più recente costa uguale.

Benchmark

GPT Realtime 2.1: il provider non ha pubblicato risultati di benchmark.

GPT Realtime: 8 pubblicati, ma nessun benchmark in comune con abbastanza altri modelli per fare un confronto.

GPT Realtime GPT Realtime 2.1 altri modelli misurati media dei modelli confrontati ★ nessun altro modello ha fatto meglio
AMI near+far field (WER)
35.9%
N/A
Big Bench Audio
82.8%
N/A
BFCL v3 (single-turn, python only)
80.4%
N/A

Dati pubblicati dai provider: Amazon OpenAI

Prezzi

GPT Realtime GPT Realtime 2.1 Δ
Input audio / 1M token $32 $32 =
Output audio / 1M token $64 $64 =
Lettura cache audio / 1M token $0.4 $0.4 =
Input di testo / 1M token $4 $4 =
Output di testo / 1M token $16 $24 0.67×
Scrittura in cache nessun addebito separato nessun addebito separato -

Tariffe lette dal catalogo live al momento della build; il listino aggiornato è sulla pagina di ciascun modello.

Dove si collocano: prezzo per 1M di token audio tra tutti i modelli di speech-to-speech in tempo reale con questa unità di fatturazione (6, scala logaritmica)

Funzionalità

GPT Realtime GPT Realtime 2.1
Prompt caching implicito (automatico) implicito (automatico)
Durata della cache 5-10m, up to 1h 5-10m, up to 1h
Prefisso minimo in cache 1024 token 1024 token

Specifiche

GPT Realtime GPT Realtime 2.1
Modalità di input testo audio testo audio
Modalità di output testo audio testo audio
Rilascio 2025-08-28 2026-07-06
Knowledge cutoff 2023-10 2024-09
Funzionalità di sessione
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Finestra di contesto 32K 128K

Le specifiche sono riprese dalla documentazione di ciascun provider; se un provider non pubblica un dato, la riga viene omessa e non dedotta. Fonti complete: GPT Realtime · GPT Realtime 2.1

Passa dall'uno all'altro cambiando una sola riga

In ogni scheda qui sotto ci sono entrambi gli id: le due righe evidenziate sono l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni la tua chiave API →

FAQ

Qual è il più economico, GPT Realtime o GPT Realtime 2.1?

Alla voce Input audio / 1M token hanno lo stesso prezzo ($32), quindi qui non è il prezzo a decidere: guarda le specifiche e le funzionalità qui sotto.

Posso fare un A/B test di GPT Realtime contro GPT Realtime 2.1 senza due integrazioni?

Sì. Si chiamano entrambi dallo stesso endpoint compatibile con OpenAI, con una sola chiave API. Per passare dall'uno all'altro basta cambiare la stringa del modello in una riga, quindi puoi mandare una parte del traffico a ciascuno e confrontare direttamente i costi.

GPT Realtime e GPT Realtime 2.1 supportano il prompt caching?

Sì: entrambi fanno pagare le letture dalla cache meno della tariffa di input, quindi i carichi di lavoro con un prefisso già in cache costano meno di quanto facciano pensare le tariffe di listino. Le voci esatte per la lettura dalla cache sono nella tabella dei prezzi qui sopra.

Confronti correlati

Dai nostri studi con dati misurati