Claude Haiku 4.5 ist die Geschwindigkeitsstufe der aktuellen Claude-Reihe; Anthropic beschreibt es als „das schnellste Modell mit nahezu Frontier-Intelligenz“.
- Eingabe
- Text Bild $1/M
- Ausgabe
- Text $5/M
- Cache-Read
- $0.1/M
- Kontext
- 200K
- vs. GPT-4o
- ~80% günstiger
- Knowledge Cutoff
- 2025-02
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 200.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 64.000 |
| Knowledge Cutoff | 2025-02 |
| Trainingsdaten bis | 2025-07 Wissensstand 2025-02 |
Prompt Caching
| Modus | explizit (Opt-in) |
|---|---|
| Min. Präfix | 4.096 Anbieter-Standard: 1.024 |
| Lebensdauer | Standard 5 Min., optional 1 Std. |
| Schreibkosten | 1.25x (5m) / 2x (1h) |
Thinking
| Anbieter-Parameter | thinking.type "enabled" + budget_tokens |
|---|---|
| Zulässige Werte | budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400 |
| Standardwert | aus, ohne Thinking, sofern die Anfrage es nicht setzt gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Nur Extended Thinking, ohne effort-Parameter; die Thinking-Blöcke früherer Turns werden entfernt, nur der letzte bleibt erhalten; Interleaved Thinking wird nicht unterstützt, und der Beta-Header wird zwar akzeptiert, aber ignoriert. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild → Text |
|---|
- Schnellstes Claude-Modell mit nahezu Frontier-Intelligenz
- Extended Thinking unterstützt (nicht adaptiv)
- 200k Kontext / 64k max. Output
Ein Prompt, gemessen über das Gateway
Claude Haiku 4.5 bestanden · 3 sentences
# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.
Ausgabe 106 tok Latenz 2.8 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Claude Haiku 4.5 bestanden · 8/8 cases
# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]
Ausgabe 310 tok Latenz 4.0 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Claude Haiku 4.5 bestanden · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
Ausgabe 63 tok Latenz 1.6 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Claude Haiku 4.5 bestanden · 123 words, 0 banned, 1 question
# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]
Ausgabe 165 tok Latenz 3.0 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Claude Haiku 4.5 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-haiku-4-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-haiku-4-5",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-haiku-4-5",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-haiku-4-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-haiku-4-5")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Claude Haiku 4.5
- Es bietet die niedrigste Latenz und den niedrigsten Preis aller aktuellen Claude-Modelle, mit einem Kontextfenster von 200K Token, bis zu 64K Output-Token, Unterstützung für Extended Thinking, Bildeingabe, Tool-Nutzung und Prompt-Caching.
- Anthropics eigener Auswahlleitfaden benennt als seine Workloads Echtzeitanwendungen, intelligente Verarbeitung mit hohem Volumen, kostensensible Deployments, die dennoch starkes Reasoning brauchen, sowie Subagenten-Aufgaben, und es verankert einen ausdrücklich effizienzorientierten Einführungspfad: hier beginnen und erst dort hochstufen, wo eine konkrete Fähigkeitslücke dazu zwingt.
- Sein Thinking-Modell ist das ältere, und das ist beim Portieren von Prompts relevant.
- Es unterstützt ausschließlich Extended Thinking, mit einem expliziten Token-Budget, das über 1.024 und unter dem Antwortlimit liegen muss; der Thinking-Typ adaptive gibt einen Fehler zurück, und es gibt keinen effort-Parameter.
- Interleaved Thinking wird ebenfalls nicht unterstützt.
- Der Beta-Header wird akzeptiert und ignoriert.
- Prompt-Caching erfordert ein Mindestpräfix von 4.096 Token, das restriktivste der Familie, und Thinking-Blöcke aus früheren Turns werden entfernt statt erhalten.
- Strukturierte Ausgaben sind allgemein verfügbar, und das Kontextfenster ist fest auf 200K gesetzt, ohne Long-Context-Variante.
- Dieses Profil eignet sich für Chat mit hohem Volumen, Klassifikation und Coding-Assistenten, bei denen Reaktionsschnelligkeit am wichtigsten ist.
- Synthorai stellt Claude Haiku 4.5 über seinen OpenAI-kompatiblen Chat-Endpoint bereit, sodass der Wechsel nur eine Änderung des Modellnamens ist.
FAQ
Lässt sich die Claude Haiku 4.5 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1/M Input-Tokens deckt allein dieses Guthaben rund 125 Requests mit je ~8K Tokens gegen Claude Haiku 4.5 ab.
Worin ist Claude Haiku 4.5 am besten?
Am schnellsten, mit nahezu Frontier-Intelligenz; niedrigste Latenz und niedrigster Preis der aktuellen Reihe; Extended Thinking, Bildeingabe und Prompt-Caching. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Claude Haiku 4.5?
Claude Haiku 4.5 kostet auf Synthorai $1 pro Million Input-Tokens und $5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.1/M abgerechnet.
Unterstützt Claude Haiku 4.5 Prompt-Caching?
Ja, per Opt-in: Markieren Sie stabile Präfixe mit cache_control-Breakpoints. Gecachte Input-Tokens werden mit $0.1/M statt $1/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 4,096 Tokens, um gecacht zu werden (TTL Standard 5 Min., optional 1 Std.). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Claude Haiku 4.5?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="claude-haiku-4-5", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Wo liegt der Knowledge Cutoff von Claude Haiku 4.5?
Der Knowledge Cutoff von Claude Haiku 4.5 liegt bei 2025-02, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-09).
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.