Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Claude Haiku 4.5

Rilasciato 2025-10-15

chatCodiceChiamata di strumentiVisioneCaching dei promptRagionamento

Claude Haiku 4.5 è il livello per la velocità dell'attuale lineup di Claude; Anthropic lo descrive come "il modello più veloce con intelligenza quasi di frontiera".

Input
testo immagine $1/M
Output
testo $5/M
Lettura cache
$0.1/M
Contesto
200K
vs GPT-4o
~80% più economico
Cutoff di conoscenza
2025-02

Benchmark

Sopra la media0 / 6
Claude Haiku 4.5 altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
39.5%
OSWorld-Verified
50.7%
GDPval-AA v2 Elo · 642-1861
907
GDM-MRCR v2 (8-needle) 128k (average)
35.3%
CharXiv (RQ) no tools
61.7%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 200.000
Output massimo (specifica del vendor) 64.000
Cutoff di conoscenza 2025-02
Dati di addestramento fino a 2025-07 conoscenza fino a 2025-02

Caching prompt

Modalità esplicito (opt-in)
Prefisso min. 4.096 predefinito del provider: 1.024
Durata 5 min predefinito, 1 ora opzionale
Costo di scrittura 1.25x (5m) / 2x (1h)

Ragionamento

Parametro del fornitore thinking.type "enabled" + budget_tokens
Valori accettati budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400
Valore predefinito disattivato, senza thinking a meno che non sia la richiesta a impostarlo applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento Solo extended thinking, senza parametro di effort; i blocchi di thinking dei turni precedenti vengono rimossi mantenendo solo l'ultimo; l'interleaved thinking non è supportato e l'header beta viene accettato ma ignorato.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine → testo
  • Il Claude più veloce con intelligenza quasi di frontiera
  • extended thinking supportato (non adattivo)
  • 200k di contesto / 64k di output massimo

fonte: documentazione ufficiale Anthropic ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Claude Haiku 4.5 superato · 3 sentences

# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.

out 106 tok latenza 2.8 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Claude Haiku 4.5 superato · 8/8 cases

# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]

out 310 tok latenza 4.0 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Claude Haiku 4.5 superato · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

out 63 tok latenza 1.6 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Claude Haiku 4.5 superato · 123 words, 0 banned, 1 question

# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]

out 165 tok latenza 3.0 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Claude Haiku 4.5 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-haiku-4-5",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su Claude Haiku 4.5

  • Offre la latenza più bassa e il prezzo più basso di qualsiasi modello Claude attuale, con una finestra di contesto da 200K token, fino a 64K token di output, supporto per l'extended thinking, input visivo, uso di strumenti e caching dei prompt.
  • La guida alla scelta di Anthropic indica come suoi carichi di lavoro le applicazioni in tempo reale, l'elaborazione intelligente ad alto volume, i deployment sensibili ai costi che richiedono comunque un ragionamento solido e i compiti da sub-agent, e il modello ancora un percorso di adozione esplicitamente orientato all'efficienza: si parte da qui e si sale di livello solo dove una specifica lacuna di capacità lo impone.
  • Il suo modello di thinking è quello più vecchio e questo conta quando si portano avanti i prompt.
  • Supporta solo l'extended thinking, con un budget di token esplicito che deve stare sopra 1.024 e sotto il limite della risposta; il tipo di thinking adattivo restituisce un errore e non esiste un parametro di effort.
  • Nemmeno il thinking interleaved è supportato.
  • L'header beta viene accettato e ignorato.
  • Il caching dei prompt richiede un prefisso minimo di 4.096 token, il più restrittivo della famiglia, e i blocchi di thinking dei turni precedenti vengono rimossi anziché conservati.
  • Gli output strutturati sono in disponibilità generale e la finestra di contesto è fissata a 200K senza varianti a contesto lungo.
  • Questo profilo si adatta a chat ad alto volume, classificazione e assistenti di coding dove la reattività conta di più.
  • Synthorai serve Claude Haiku 4.5 tramite il suo endpoint chat compatibile OpenAI, quindi cambiare è solo una modifica al nome del modello.

FAQ

L'API di Claude Haiku 4.5 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1/M token in input, quel credito da solo copre circa 125 richieste da ~8K token verso Claude Haiku 4.5.

In cosa eccelle Claude Haiku 4.5?

Il più veloce con intelligenza quasi di frontiera; latenza e prezzo più bassi dell'attuale lineup; extended thinking, input visivo e caching dei prompt. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Claude Haiku 4.5?

Su Synthorai, Claude Haiku 4.5 costa $1 per milione di token in input e $5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.1/M.

Claude Haiku 4.5 supporta il caching dei prompt?

Sì, su opt-in: marca i prefissi stabili con breakpoint cache_control. I token di input in cache si fatturano a $0.1/M contro $1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token (TTL 5 min predefinito, 1 ora opzionale). Guida al caching dei prompt →

Come ottengo l'accesso a Claude Haiku 4.5?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="claude-haiku-4-5" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di Claude Haiku 4.5?

Il cutoff di conoscenza di Claude Haiku 4.5 è 2025-02, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →