🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT Realtime vs GPT Realtime 2.1

vs

Quale scegliere e quando — verdetto curato, non una tabella di benchmark

L'input testuale è $4 per milione su entrambi, l'audio $32 in ingresso e $64 in uscita su entrambi, e le letture di cache $0.4 su entrambi; gpt-realtime-2.1 costa di più solo sull'output testuale, $24 contro $16, e quadruplica il contesto di sessione a 128K da 32K. Aggiunge inoltre uno sforzo di ragionamento configurabile e la gestione delle interruzioni al function calling del modello precedente. Scegli gpt-realtime solo per mantenere un'integrazione esistente — su tutto tranne l'output testuale il più recente costa uguale.

Prezzi

GPT Realtime GPT Realtime 2.1 Δ
Input audio / 1M token $32 $32 =
Output audio / 1M token $64 $64 =
Lettura cache audio / 1M token $0.4 $0.4 =
Input di testo / 1M token $4 $4 =
Output di testo / 1M token $16 $24 0.67×
Scrittura in cache nessun addebito separato nessun addebito separato

Le tariffe provengono dal catalogo live al momento della build; la pagina di ciascun modello riporta la scheda attuale.

Dove si posizionano — prezzo per 1M di token audio rispetto a tutti gli 6 modelli speech-to-speech in tempo reale con questa unità di fatturazione (scala logaritmica)

Capacità

GPT Realtime GPT Realtime 2.1
Prompt caching implicito (automatico) implicito (automatico)
Durata della cache 5–10m, up to 1h 5–10m, up to 1h
Prefisso minimo in cache 1024 token 1024 token

Specifiche

GPT Realtime GPT Realtime 2.1
Modalità di input testo audio testo audio
Modalità di output testo audio testo audio
Rilascio 2025-08-28 2026-07-06
Cutoff di conoscenza 2023-10 2024-09
Funzionalità di sessione
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Finestra di contesto 32K 128K

Le specifiche sono trascritte dalla documentazione di ciascun fornitore; una riga che un fornitore non pubblica viene omessa anziché essere dedotta. Fonti complete: GPT Realtime · GPT Realtime 2.1

Passa dall'uno all'altro con una sola riga

Entrambi gli id sono presenti in ogni scheda qui sotto — la coppia di righe evidenziata è l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # decommenta questa riga, commenta quella sopra
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Ottieni una chiave API →

FAQ

Qual è più economico, GPT Realtime o GPT Realtime 2.1?

Riportano lo stesso valore per input audio / 1m token ($32), quindi il prezzo non è decisivo in questo caso — vedi le specifiche e le funzionalità di seguito.

Posso fare un A/B test di GPT Realtime contro GPT Realtime 2.1 senza due integrazioni?

Sì. Entrambi sono serviti tramite lo stesso endpoint compatibile con OpenAI con una singola chiave API — il passaggio richiede la modifica della stringa del modello in una sola riga, quindi puoi instradare una frazione del traffico verso ciascuno e confrontare direttamente le fatture.

GPT Realtime e GPT Realtime 2.1 supportano il prompt caching?

Sì — entrambi fatturano le letture in cache a un prezzo inferiore rispetto alla loro tariffa di input, quindi i carichi di lavoro con warm-prefix costano meno di quanto suggeriscano le tariffe di listino. Le righe esatte per la lettura in cache si trovano nella tabella dei prezzi qui sopra.

Confronti correlati

Dai nostri studi misurati