Claude Haiku 4.5 è il livello per la velocità dell'attuale lineup di Claude; Anthropic lo descrive come "il modello più veloce con intelligenza quasi di frontiera".
- Input
- testo immagine $1/M
- Output
- testo $5/M
- Lettura cache
- $0.1/M
- Contesto
- 200K
- vs GPT-4o
- ~80% più economico
- Cutoff di conoscenza
- 2025-02
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 200.000 |
|---|---|
| Output massimo (specifica del vendor) | 64.000 |
| Cutoff di conoscenza | 2025-02 |
| Dati di addestramento fino a | 2025-07 conoscenza fino a 2025-02 |
Caching prompt
| Modalità | esplicito (opt-in) |
|---|---|
| Prefisso min. | 4.096 predefinito del provider: 1.024 |
| Durata | 5 min predefinito, 1 ora opzionale |
| Costo di scrittura | 1.25x (5m) / 2x (1h) |
Ragionamento
| Parametro del fornitore | thinking.type "enabled" + budget_tokens |
|---|---|
| Valori accettati | budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400 |
| Valore predefinito | disattivato, senza thinking a meno che non sia la richiesta a impostarlo applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | Solo extended thinking, senza parametro di effort; i blocchi di thinking dei turni precedenti vengono rimossi mantenendo solo l'ultimo; l'interleaved thinking non è supportato e l'header beta viene accettato ma ignorato. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine → testo |
|---|
- Il Claude più veloce con intelligenza quasi di frontiera
- extended thinking supportato (non adattivo)
- 200k di contesto / 64k di output massimo
Un solo prompt, misurato attraverso il gateway
Claude Haiku 4.5 superato · 3 sentences
# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.
out 106 tok latenza 2.8 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Claude Haiku 4.5 superato · 8/8 cases
# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]
out 310 tok latenza 4.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Claude Haiku 4.5 superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
out 63 tok latenza 1.6 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Claude Haiku 4.5 superato · 123 words, 0 banned, 1 question
# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]
out 165 tok latenza 3.0 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Claude Haiku 4.5 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-haiku-4-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-haiku-4-5",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-haiku-4-5",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-haiku-4-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-haiku-4-5")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Claude Haiku 4.5
- Offre la latenza più bassa e il prezzo più basso di qualsiasi modello Claude attuale, con una finestra di contesto da 200K token, fino a 64K token di output, supporto per l'extended thinking, input visivo, uso di strumenti e caching dei prompt.
- La guida alla scelta di Anthropic indica come suoi carichi di lavoro le applicazioni in tempo reale, l'elaborazione intelligente ad alto volume, i deployment sensibili ai costi che richiedono comunque un ragionamento solido e i compiti da sub-agent, e il modello ancora un percorso di adozione esplicitamente orientato all'efficienza: si parte da qui e si sale di livello solo dove una specifica lacuna di capacità lo impone.
- Il suo modello di thinking è quello più vecchio e questo conta quando si portano avanti i prompt.
- Supporta solo l'extended thinking, con un budget di token esplicito che deve stare sopra 1.024 e sotto il limite della risposta; il tipo di thinking adattivo restituisce un errore e non esiste un parametro di effort.
- Nemmeno il thinking interleaved è supportato.
- L'header beta viene accettato e ignorato.
- Il caching dei prompt richiede un prefisso minimo di 4.096 token, il più restrittivo della famiglia, e i blocchi di thinking dei turni precedenti vengono rimossi anziché conservati.
- Gli output strutturati sono in disponibilità generale e la finestra di contesto è fissata a 200K senza varianti a contesto lungo.
- Questo profilo si adatta a chat ad alto volume, classificazione e assistenti di coding dove la reattività conta di più.
- Synthorai serve Claude Haiku 4.5 tramite il suo endpoint chat compatibile OpenAI, quindi cambiare è solo una modifica al nome del modello.
FAQ
L'API di Claude Haiku 4.5 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1/M token in input, quel credito da solo copre circa 125 richieste da ~8K token verso Claude Haiku 4.5.
In cosa eccelle Claude Haiku 4.5?
Il più veloce con intelligenza quasi di frontiera; latenza e prezzo più bassi dell'attuale lineup; extended thinking, input visivo e caching dei prompt. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Claude Haiku 4.5?
Su Synthorai, Claude Haiku 4.5 costa $1 per milione di token in input e $5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.1/M.
Claude Haiku 4.5 supporta il caching dei prompt?
Sì, su opt-in: marca i prefissi stabili con breakpoint cache_control. I token di input in cache si fatturano a $0.1/M contro $1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token (TTL 5 min predefinito, 1 ora opzionale). Guida al caching dei prompt →
Come ottengo l'accesso a Claude Haiku 4.5?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="claude-haiku-4-5" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Claude Haiku 4.5?
Il cutoff di conoscenza di Claude Haiku 4.5 è 2025-02, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.