Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Claude Opus 4.8

Rilasciato 2026-05-28

chatCodiceRagionamentoChiamata di strumentiVisioneCaching dei prompt

Claude Opus 4.8 è il rilascio Opus di Anthropic per il coding agentico complesso e il lavoro enterprise, costruito direttamente su Opus 4.7.

Input
testo immagine $5/M
Output
testo $25/M
Lettura cache
$0.5/M
Contesto
1M
Cutoff di conoscenza
2026-01

Benchmark

Sopra la mediaNessuno migliore82 / 12918 / 129
Claude Opus 4.8 altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
69.2%
BioMysteryBench hard
42.4%
OSWorld-Verified
83.4%
Cybergym
78.3%
HealthBench
52.4%
GDPval-AA v2 Elo · 642-1861
1593
Harvey Lab-AA
91.1%
GPQA Diamond
92%
Blueprint-Bench 2
14.5%
BrowseComp
84.3%
Video-MME (w. sub)
86%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$25/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.5/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 128.000
Cutoff di conoscenza 2026-01

Caching prompt

Modalità esplicito (opt-in)
Prefisso min. 1.024
Durata 5 min predefinito, 1 ora opzionale
Costo di scrittura 1.25x (5m) / 2x (1h)

Ragionamento

Parametro del fornitore thinking.type "adaptive" + output_config.effort
Valori accettati thinking.type adaptive · disabled; effort low · medium · high · xhigh · max; "enabled" returns 400
Valore predefinito thinking disattivato; effort high applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento Il ragionamento tra le chiamate a strumenti compare sempre nei blocchi di thinking senza header beta; display vale "omitted" di default, quindi i blocchi di thinking tornano con il campo thinking vuoto a meno che non si imposti display "summarized"; i blocchi di thinking dei turni precedenti restano nel contesto e vengono fatturati come input.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine → testo
  • Contesto da 1M di default
  • l'effort vale high di default
  • fast mode disponibile come research preview
  • messaggi di sistema a metà conversazione
  • prompt minimo memorizzabile in cache abbassato a 1.024 token
  • input di immagini ad alta risoluzione

fonte: documentazione ufficiale Anthropic ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Claude Opus 4.8 superato · 3 sentences

Reasoning models generate a hidden "thinking" phase before producing their final answer, and we're billed for every one of those internal tokens even though they never appear in the user-facing output. Because this deliberation often runs several times longer than the answer itself, our token consumption per request grew substantially even though our request volume stayed flat. The upside is that this trade buys us materially higher accuracy on complex tasks, so the right question isn't just cost but whether the improved output quality justifies the per-query premium for each use case.

out 162 tok latenza 4.2 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Claude Opus 4.8 superato · 8/8 cases

## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ## Explanation of the Bug The original code counted **transitions between equal adjacent elements** rather than the **length of the run** itself. It initialized `best` and `cur` to `0` and incremented `cur` only when a match was found, so a run of length *N* recorded a count of *N-1* (e.g., a single element `[5]` never enters the loop and returns `0` instead of `1`, and `[5, 5]` returns `1` instead of `2`)—this is the off-by-one. […]

out 495 tok latenza 9.2 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Claude Opus 4.8 superato · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

out 72 tok latenza 1.8 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Claude Opus 4.8 superato · 121 words, 0 banned, 1 question

**Introducing Cross-Provider Prompt Caching** Today we're launching prompt caching directly within our API gateway, designed to cut latency and reduce your inference costs. When identical or overlapping prompts hit the gateway, cached responses are served instantly instead of being routed to the underlying model provider again. What makes this different from provider-specific caching? Our system works across OpenAI, Anthropic, Google, and any custom endpoint you configure, so you maintain one consistent cache regardless of which model handles a request. You control cache duration, invalidation rules, and scope through simple configuration settings. Teams running high-volume workloads can expect meaningful savings on repeated queries and faster response times for end users. Cross-provider prompt caching is available now for all customers on paid plans.

out 258 tok latenza 5.3 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Claude Opus 4.8 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-opus-4-8",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Claude Opus 4.8

  • La pagina ufficiale delle novità evidenzia un coding agentico a lungo orizzonte migliore con un recupero della compaction migliorato, una calibrazione del reasoning effort più affidabile e meno chiamate a strumenti saltate; Anthropic lo descrive anche come un collaboratore più efficace, che corregge i problemi di verbosità nei commenti e di tool calling visti su 4.7.
  • Novità al lancio: messaggi di sistema a metà conversazione che preservano gli hit della cache dei prompt, un minimo di cache più basso a 1.024 token (in calo da 2.048) e una research preview in fast mode con velocità di output fino a 2,5x superiore a una tariffa premium.
  • Dispone di una finestra di contesto da 1M di token, 128K di output, thinking adattivo e vision, oltre al computer use e all'input di immagini ad alta risoluzione introdotto su 4.7.
  • Il thinking adattivo è disattivato se non richiesto, ma attiva il ragionamento solo dove un turno ne ha bisogno, il che secondo Anthropic spreca meno token di thinking rispetto a 4.7 a parità di livello di effort; l'effort ha high come predefinito su ogni superficie e arriva fino a xhigh e max, con xhigh raccomandato per il coding e il lavoro ad alta autonomia.
  • L'oggetto di rifiuto che documenta restituisce una categoria e una spiegazione leggibile, così le applicazioni possono instradare in modo diverso le diverse classi di rifiuto.
  • Anthropic ora lo elenca tra i modelli legacy dietro la generazione Opus 5.
  • Synthorai lo offre tramite l'endpoint compatibile OpenAI che gli sviluppatori già usano.

FAQ

L'API di Claude Opus 4.8 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $5/M token in input, quel credito da solo copre circa 24 richieste da ~8K token verso Claude Opus 4.8.

In cosa eccelle Claude Opus 4.8?

Miglior coding a lungo orizzonte con recupero della compaction; messaggi di sistema a metà conversazione preservano gli hit della cache; preview in fast mode con velocità di output 2,5x. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Claude Opus 4.8?

Su Synthorai, Claude Opus 4.8 costa $5 per milione di token in input e $25 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.5/M.

Claude Opus 4.8 supporta il caching dei prompt?

Sì, su opt-in: marca i prefissi stabili con breakpoint cache_control. I token di input in cache si fatturano a $0.5/M contro $5/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5 min predefinito, 1 ora opzionale). Guida al caching di Claude Opus 4.8 →

Come ottengo l'accesso a Claude Opus 4.8?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="claude-opus-4-8" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di Claude Opus 4.8?

Il cutoff di conoscenza di Claude Opus 4.8 è 2026-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →