Claude Sonnet 4.6 ist die Generation, die der Sonnet-Stufe Big-Context-Fähigkeit brachte: Gegenüber Sonnet 4.5 erweitert es das Kontextfenster von 200K auf 1M Token, verdoppelt den maximalen Output auf 128K Token und ergänzt neben Extended Thinking adaptives Thinking.
- Eingabe
- Text Bild $3/M
- Ausgabe
- Text $15/M
- Cache-Read
- $0.3/M
- Kontext
- 1M
- vs. GPT-4o
- ~40% günstiger
- Knowledge Cutoff
- 2025-08
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 128.000 |
| Knowledge Cutoff | 2025-08 |
| Trainingsdaten bis | 2026-01 Wissensstand 2025-08 |
Prompt Caching
| Modus | explizit (Opt-in) |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | Standard 5 Min., optional 1 Std. |
| Schreibkosten | 1.25x (5m) / 2x (1h) |
Thinking
| Anbieter-Parameter | thinking.type + output_config.effort (budget_tokens still accepted, deprecated) |
|---|---|
| Zulässige Werte | thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh) |
| Standardwert | Thinking aus; effort high gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Adaptives Thinking verschränkt sich ohne Beta-Header automatisch zwischen Tool-Aufrufen; im manuellen Modus „enabled“ funktioniert der Header interleaved-thinking-2025-05-14 weiterhin, gilt aber als veraltet; die Thinking-Blöcke früherer Turns bleiben im Kontext und werden als Input abgerechnet. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild → Text |
|---|
- 1M-Token-Kontext GA zu Standardpreisen seit 2026-03-13
- bis zu 300k Output-Token über die Batch API mit dem Beta-Header output-300k-2026-03-24
Ein Prompt, gemessen über das Gateway
Claude Sonnet 4.6 bestanden · 3 sentences
Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.
Ausgabe 156 tok Latenz 4.9 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Claude Sonnet 4.6 bestanden · 8/8 cases
## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]
Ausgabe 685 tok Latenz 12.2 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Claude Sonnet 4.6 bestanden · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
Ausgabe 67 tok Latenz 1.3 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Claude Sonnet 4.6 bestanden · 121 words, 0 banned, 1 question
**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.
Ausgabe 177 tok Latenz 5.4 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Claude Sonnet 4.6 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-4-6",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-4-6",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-6",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-4-6",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-4-6")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Claude Sonnet 4.6
- Anthropic brachte es als sein ausgewogenes Modell auf den Markt, das Geschwindigkeit und Intelligenz für alltägliche Aufgaben verbindet, mit verbesserter agentischer Suchleistung bei geringerem Token-Verbrauch, und das 1M-Fenster ist zu Standardpreisen allgemein verfügbar, statt hinter einer Beta zu liegen.
- Es behält Sonnets schnelles Latenzprofil und die Preise von $3/$15 pro Million Token, mit Bildeingabe und Tool-Nutzung durchgängig, und es qualifiziert sich für die erweiterte 300K-Output-Beta der Batch API.
- Effort deckt low bis max ab, aber nicht xhigh; obwohl der Parameter standardmäßig auf high steht, empfiehlt Anthropic ausdrücklich, ihn bei diesem Modell zu setzen, um unerwartete Latenz zu vermeiden, und schlägt medium als praktischen Standard vor.
- Extended Thinking funktioniert weiterhin, ist aber zugunsten von adaptivem Thinking abgekündigt, und keiner der beiden Thinking-Typen wird rundheraus abgelehnt.
- Das Prefill der Assistant-Nachricht gibt hier einen Fehler zurück, während nicht standardmäßige Sampling-Parameter noch toleriert werden.
- Diese Einschränkung kommt mit Sonnet 5.
- Es nutzt den älteren Tokenizer, sodass die Token-Zahlen mit früheren Modellen vergleichbar bleiben.
- Anthropic listet es inzwischen als Legacy-Modell, das durch Claude Sonnet 5 abgelöst wurde.
- Über Synthorais OpenAI-kompatiblen Endpoint fügt es sich unverändert in jede bestehende GPT-artige Integration ein.
FAQ
Lässt sich die Claude Sonnet 4.6 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $3/M Input-Tokens deckt allein dieses Guthaben rund 41 Requests mit je ~8K Tokens gegen Claude Sonnet 4.6 ab.
Worin ist Claude Sonnet 4.6 am besten?
Kontext von 200K auf 1M Token erweitert; maximaler Output auf 128K Token verdoppelt; adaptives Thinking bei unveränderten $3/$15-Preisen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Claude Sonnet 4.6?
Claude Sonnet 4.6 kostet auf Synthorai $3 pro Million Input-Tokens und $15 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.3/M abgerechnet.
Unterstützt Claude Sonnet 4.6 Prompt-Caching?
Ja, per Opt-in: Markieren Sie stabile Präfixe mit cache_control-Breakpoints. Gecachte Input-Tokens werden mit $0.3/M statt $3/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL Standard 5 Min., optional 1 Std.). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Claude Sonnet 4.6?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="claude-sonnet-4-6", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Wo liegt der Knowledge Cutoff von Claude Sonnet 4.6?
Der Knowledge Cutoff von Claude Sonnet 4.6 liegt bei 2025-08, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-09).
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.