Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Claude Haiku 4.5

Veröffentlicht 2025-10-15

chatCodeTool-AufrufeVisionPrompt CachingReasoning

Claude Haiku 4.5 ist die Geschwindigkeitsstufe der aktuellen Claude-Reihe; Anthropic beschreibt es als „das schnellste Modell mit nahezu Frontier-Intelligenz“.

Eingabe
Text Bild $1/M
Ausgabe
Text $5/M
Cache-Read
$0.1/M
Kontext
200K
vs. GPT-4o
~80% günstiger
Knowledge Cutoff
2025-02

Benchmarks

Über dem Durchschnitt0 / 6
Claude Haiku 4.5 weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
SWE-Bench Pro
39.5%
OSWorld-Verified
50.7%
GDPval-AA v2 Elo · 642-1861
907
GDM-MRCR v2 (8-needle) 128k (average)
35.3%
CharXiv (RQ) no tools
61.7%

Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai

Preis im Vergleich

Preisposition unter 60 vergleichbaren Modellen

Eingabe$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 200.000
Max. Output (Anbieter-Spezifikation) 64.000
Knowledge Cutoff 2025-02
Trainingsdaten bis 2025-07 Wissensstand 2025-02

Prompt Caching

Modus explizit (Opt-in)
Min. Präfix 4.096 Anbieter-Standard: 1.024
Lebensdauer Standard 5 Min., optional 1 Std.
Schreibkosten 1.25x (5m) / 2x (1h)

Thinking

Anbieter-Parameter thinking.type "enabled" + budget_tokens
Zulässige Werte budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400
Standardwert aus, ohne Thinking, sofern die Anfrage es nicht setzt gilt, wenn die Anfrage nichts angibt
Abschaltbar Ja
Thinking-Verhalten Nur Extended Thinking, ohne effort-Parameter; die Thinking-Blöcke früherer Turns werden entfernt, nur der letzte bleibt erhalten; Interleaved Thinking wird nicht unterstützt, und der Beta-Header wird zwar akzeptiert, aber ignoriert.
Parameter reasoning_effort
Werte minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt

Modell

Modalitäten Text + Bild → Text
  • Schnellstes Claude-Modell mit nahezu Frontier-Intelligenz
  • Extended Thinking unterstützt (nicht adaptiv)
  • 200k Kontext / 64k max. Output

laut Offizielle Anthropic-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

Claude Haiku 4.5 bestanden · 3 sentences

# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.

Ausgabe 106 tok Latenz 2.8 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

Claude Haiku 4.5 bestanden · 8/8 cases

# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]

Ausgabe 310 tok Latenz 4.0 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

Claude Haiku 4.5 bestanden · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

Ausgabe 63 tok Latenz 1.6 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

Claude Haiku 4.5 bestanden · 123 words, 0 banned, 1 question

# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]

Ausgabe 165 tok Latenz 3.0 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

Claude Haiku 4.5 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-haiku-4-5",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Über Claude Haiku 4.5

  • Es bietet die niedrigste Latenz und den niedrigsten Preis aller aktuellen Claude-Modelle, mit einem Kontextfenster von 200K Token, bis zu 64K Output-Token, Unterstützung für Extended Thinking, Bildeingabe, Tool-Nutzung und Prompt-Caching.
  • Anthropics eigener Auswahlleitfaden benennt als seine Workloads Echtzeitanwendungen, intelligente Verarbeitung mit hohem Volumen, kostensensible Deployments, die dennoch starkes Reasoning brauchen, sowie Subagenten-Aufgaben, und es verankert einen ausdrücklich effizienzorientierten Einführungspfad: hier beginnen und erst dort hochstufen, wo eine konkrete Fähigkeitslücke dazu zwingt.
  • Sein Thinking-Modell ist das ältere, und das ist beim Portieren von Prompts relevant.
  • Es unterstützt ausschließlich Extended Thinking, mit einem expliziten Token-Budget, das über 1.024 und unter dem Antwortlimit liegen muss; der Thinking-Typ adaptive gibt einen Fehler zurück, und es gibt keinen effort-Parameter.
  • Interleaved Thinking wird ebenfalls nicht unterstützt.
  • Der Beta-Header wird akzeptiert und ignoriert.
  • Prompt-Caching erfordert ein Mindestpräfix von 4.096 Token, das restriktivste der Familie, und Thinking-Blöcke aus früheren Turns werden entfernt statt erhalten.
  • Strukturierte Ausgaben sind allgemein verfügbar, und das Kontextfenster ist fest auf 200K gesetzt, ohne Long-Context-Variante.
  • Dieses Profil eignet sich für Chat mit hohem Volumen, Klassifikation und Coding-Assistenten, bei denen Reaktionsschnelligkeit am wichtigsten ist.
  • Synthorai stellt Claude Haiku 4.5 über seinen OpenAI-kompatiblen Chat-Endpoint bereit, sodass der Wechsel nur eine Änderung des Modellnamens ist.

FAQ

Lässt sich die Claude Haiku 4.5 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1/M Input-Tokens deckt allein dieses Guthaben rund 125 Requests mit je ~8K Tokens gegen Claude Haiku 4.5 ab.

Worin ist Claude Haiku 4.5 am besten?

Am schnellsten, mit nahezu Frontier-Intelligenz; niedrigste Latenz und niedrigster Preis der aktuellen Reihe; Extended Thinking, Bildeingabe und Prompt-Caching. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Claude Haiku 4.5?

Claude Haiku 4.5 kostet auf Synthorai $1 pro Million Input-Tokens und $5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.1/M abgerechnet.

Unterstützt Claude Haiku 4.5 Prompt-Caching?

Ja, per Opt-in: Markieren Sie stabile Präfixe mit cache_control-Breakpoints. Gecachte Input-Tokens werden mit $0.1/M statt $1/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 4,096 Tokens, um gecacht zu werden (TTL Standard 5 Min., optional 1 Std.). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu Claude Haiku 4.5?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="claude-haiku-4-5", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Wo liegt der Knowledge Cutoff von Claude Haiku 4.5?

Der Knowledge Cutoff von Claude Haiku 4.5 liegt bei 2025-02, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-09).

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →