GPT-5.4 è il modello di frontiera di OpenAI per il coding e il lavoro professionale, posizionato sulla sua pagina del modello come "un modello più accessibile per il coding e il lavoro professionale".
- Input
- testo immagine $2.5/M
- Output
- testo $15/M
- Lettura cache
- $1.25/M
- Contesto
- 922K
- vs GPT-4o
- ~50% più economico
- Cutoff di conoscenza
- 2025-08
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.050.000 |
|---|---|
| Output massimo (specifica del vendor) | 128.000 |
| Cutoff di conoscenza | 2025-08 |
Caching prompt
| Modalità | automatico |
|---|---|
| Prefisso min. | 1.024 |
| Durata | 5-10 min, fino a 1 ora |
Ragionamento
| Parametro del fornitore | reasoning.effort |
|---|---|
| Valori accettati | none · low · medium · high · xhigh |
| Valore predefinito | none applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | Supporta l'interleaved thinking: output visibile prima e tra le fasi di thinking, e thinking tra le chiamate a strumenti. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine → testo |
|---|
- Contesto da 1,05M di token / 128k di output massimo
- i prompt oltre i 272k token in input sono fatturati a 2x in input / 1,5x in output
- reasoning effort da none a xhigh
Un solo prompt, misurato attraverso il gateway
GPT-5.4 superato · 3 sentences
Enabling reasoning makes the model generate and evaluate additional internal steps before producing an answer, which increases the total tokens processed and therefore the cost per request. It also tends to increase latency and can trigger more tool calls, retries, or longer context retention, all of which compound usage-based charges. So even if user traffic stayed flat, the average cost per interaction rose materially once reasoning was turned on.
out 82 tok latenza 1.9 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
GPT-5.4 superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: best = max(best, cur) cur = 1 best = max(best, cur) return best ``` The bug is that the original code was counting *matching transitions* between adjacent elements instead of the *length of the run itself*, so a single element started at `0` instead of `1`, making all run lengths off by one. It also only updated `best` inside the equality case, which means the final run could be lost if the loop ended before a change triggered any correction logic. […]
out 243 tok latenza 3.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
GPT-5.4 superato · 5/5 fields, guidance "withheld pending the Q4 close"
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11,"guidance":"withheld pending the Q4 close"}
out 39 tok latenza 1.3 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
GPT-5.4 superato · 126 words, 0 banned, 1 question
Today we’re introducing Prompt Cache, a new API gateway feature that stores prompt results and reuses them across supported model providers. Teams can reduce latency, lower repeated compute costs, and keep application behavior more consistent when identical or near-identical prompts appear in production. Prompt Cache works at the gateway layer, so developers can adopt it without rewriting provider integrations or changing routing logic. Built-in controls let you set cache keys, expiration policies, and privacy rules for sensitive workloads. Need faster responses without duplicating optimization work for each vendor? With shared observability, you can track hit rates, savings, and cache performance in one place. […]
out 154 tok latenza 2.9 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa GPT-5.4 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-5.4",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-5.4",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.4",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-5.4",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-5.4")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su GPT-5.4
- Espande la famiglia a una finestra di contesto da 1.050.000 token (specifica del vendor) con 128K token di output massimo, supporta input di immagini, reasoning effort configurabile da none a xhigh, input in cache scontato e l'intero set di strumenti hosted inclusi ricerca web e code interpreter, con un cutoff di conoscenza ad agosto 2025.
- Il reasoning effort ha none come predefinito, il che tiene bassa la latenza ma significa che il lavoro deliberato va richiesto.
- Al lancio OpenAI ha segnalato quattro capacità come nuove per questo modello: la finestra di contesto di classe 1M, la tool search, il computer use integrato e la compaction per le sessioni prolungate.
- Oltre a queste, l'elenco degli strumenti arriva a ricerca file, generazione di immagini, code interpreter, shell hosted, apply patch, skill e MCP, e Chat Completions, Responses e Batch sono tutti supportati.
- Una meccanica di prezzo merita pianificazione: i prompt sopra i 272K token di input sono fatturati a 2x l'input e 1,5x l'output per l'intera richiesta, quindi il sovrapprezzo è innescato dalla dimensione dell'input ma alza anche la tariffa di output.
- È la scelta predefinita quando la capacità flagship deve incontrare l'economia di produzione.
- I clienti Synthorai raggiungono GPT-5.4 tramite l'endpoint chat completions compatibile OpenAI del gateway.
FAQ
L'API di GPT-5.4 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $2.5/M token in input, quel credito da solo copre circa 49 richieste da ~8K token verso GPT-5.4.
In cosa eccelle GPT-5.4?
Finestra di contesto da 1.050.000 token; opzione di classe flagship più accessibile; set completo di strumenti hosted inclusa la ricerca web. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GPT-5.4?
Su Synthorai, GPT-5.4 costa $2.5 per milione di token in input e $15 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $1.25/M.
GPT-5.4 supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da OpenAI vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $1.25/M contro $2.5/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5-10 min, fino a 1 ora). Guida al caching dei prompt →
Come ottengo l'accesso a GPT-5.4?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-5.4" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di GPT-5.4?
Il cutoff di conoscenza di GPT-5.4 è 2025-08, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.