Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Claude Opus 4.8

Date de sortie : 2026-05-28

chatCodeRaisonnementAppel d'outilsVisionMise en cache des prompts

Claude Opus 4.8 est la version Opus d'Anthropic pour le codage agentique complexe et le travail d'entreprise, s'appuyant directement sur Opus 4.7.

Entrée
texte image $5/M
Sortie
texte $25/M
Lecture de cache
$0.5/M
Contexte
1M
Coupure des connaissances
2026-01

Benchmarks

Au-dessus de la moyenneAucun meilleur82 / 12918 / 129
Claude Opus 4.8 autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
SWE-Bench Pro
69.2%
BioMysteryBench hard
42.4%
OSWorld-Verified
83.4%
Cybergym
78.3%
HealthBench
52.4%
GDPval-AA v2 Elo · 642-1861
1593
Harvey Lab-AA
91.1%
GPQA Diamond
92%
Blueprint-Bench 2
14.5%
BrowseComp
84.3%
Video-MME (w. sub)
86%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Le prix en contexte

Position du prix parmi 60 modèles comparables

Entrée$5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$25/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.5/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 000 000
Sortie max (spéc. fournisseur) 128 000
Coupure des connaissances 2026-01

Mise en cache

Mode explicite (sur activation)
Préfixe min. 1 024
Durée de vie 5 min par défaut, 1 heure en option
Coût d'écriture 1.25x (5m) / 2x (1h)

Raisonnement

Paramètre du fournisseur thinking.type "adaptive" + output_config.effort
Valeurs acceptées thinking.type adaptive · disabled; effort low · medium · high · xhigh · max; "enabled" returns 400
Valeur par défaut réflexion désactivée ; effort high appliquée si la requête ne précise rien
Désactivable Oui
Comportement du raisonnement Le raisonnement entre les appels d'outils apparaît toujours dans des blocs de réflexion, sans en-tête bêta ; display vaut « omitted » par défaut, donc les blocs de réflexion reviennent avec un champ thinking vide tant que vous ne réglez pas display sur « summarized » ; les blocs de réflexion des tours précédents sont conservés dans le contexte et facturés en entrée.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique

Modèle

Modalités texte + image → texte
  • Contexte de 1M par défaut
  • l'effort vaut high par défaut
  • mode rapide disponible en préversion de recherche
  • messages système en milieu de conversation
  • prompt minimal cacheable abaissé à 1 024 tokens
  • entrée d'image haute résolution

selon docs officielles Anthropic ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

Claude Opus 4.8 réussi · 3 sentences

Reasoning models generate a hidden "thinking" phase before producing their final answer, and we're billed for every one of those internal tokens even though they never appear in the user-facing output. Because this deliberation often runs several times longer than the answer itself, our token consumption per request grew substantially even though our request volume stayed flat. The upside is that this trade buys us materially higher accuracy on complex tasks, so the right question isn't just cost but whether the improved output quality justifies the per-query premium for each use case.

sortie 162 tok latence 4.2 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

Claude Opus 4.8 réussi · 8/8 cases

## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ## Explanation of the Bug The original code counted **transitions between equal adjacent elements** rather than the **length of the run** itself. It initialized `best` and `cur` to `0` and incremented `cur` only when a match was found, so a run of length *N* recorded a count of *N-1* (e.g., a single element `[5]` never enters the loop and returns `0` instead of `1`, and `[5, 5]` returns `1` instead of `2`)—this is the off-by-one. […]

sortie 495 tok latence 9.2 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

Claude Opus 4.8 réussi · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

sortie 72 tok latence 1.8 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

Claude Opus 4.8 réussi · 121 words, 0 banned, 1 question

**Introducing Cross-Provider Prompt Caching** Today we're launching prompt caching directly within our API gateway, designed to cut latency and reduce your inference costs. When identical or overlapping prompts hit the gateway, cached responses are served instantly instead of being routed to the underlying model provider again. What makes this different from provider-specific caching? Our system works across OpenAI, Anthropic, Google, and any custom endpoint you configure, so you maintain one consistent cache regardless of which model handles a request. You control cache duration, invalidation rules, and scope through simple configuration settings. Teams running high-volume workloads can expect meaningful savings on repeated queries and faster response times for end users. Cross-provider prompt caching is available now for all customers on paid plans.

sortie 258 tok latence 5.3 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez Claude Opus 4.8 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-opus-4-8",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de Claude Opus 4.8

  • La page officielle des nouveautés met en avant un meilleur codage agentique à long horizon avec une récupération de compaction améliorée, une calibration de l'effort de raisonnement plus fiable et moins d'appels d'outils omis ; Anthropic le décrit aussi comme un collaborateur plus efficace qui corrige les problèmes de verbosité des commentaires et d'appel d'outils observés sur 4.7.
  • Nouveautés au lancement : des messages système en milieu de conversation qui préservent les hits de cache de prompt, un minimum de cache abaissé à 1 024 tokens (contre 2 048), et une préversion de recherche en mode rapide offrant jusqu'à 2,5x de vitesse de sortie en plus, à un tarif majoré.
  • Il embarque une fenêtre de contexte de 1M de tokens, 128K en sortie, la réflexion adaptative et la vision, plus l'utilisation de l'ordinateur et l'entrée d'image haute résolution introduite sur 4.7.
  • La réflexion adaptative est désactivée sauf demande explicite mais ne déclenche le raisonnement que là où un tour en a besoin, ce qui, selon Anthropic, gaspille moins de tokens de réflexion que 4.7 au même niveau d'effort ; l'effort vaut high par défaut sur toutes les surfaces et atteint xhigh et max, xhigh étant recommandé pour le codage et le travail à forte autonomie.
  • L'objet de refus qu'il documente renvoie une catégorie et une explication lisible par un humain, de sorte que les applications peuvent router différemment les différentes classes de refus.
  • Anthropic le range désormais parmi les modèles hérités (legacy) derrière la génération Opus 5.
  • Synthorai le propose via l'endpoint compatible OpenAI que les développeurs utilisent déjà.

FAQ

Peut-on essayer l'API Claude Opus 4.8 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $5/M de tokens en entrée, ce crédit couvre à lui seul environ 24 requêtes de ~8K tokens sur Claude Opus 4.8.

Quels sont les points forts de Claude Opus 4.8 ?

Meilleur codage à long horizon avec récupération de compaction ; messages système en milieu de conversation préservant les hits de cache ; préversion en mode rapide avec 2,5x de vitesse de sortie. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Claude Opus 4.8 ?

Sur Synthorai, Claude Opus 4.8 coûte $5 par million de tokens en entrée et $25 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.5/M.

Claude Opus 4.8 prend-il en charge la mise en cache des prompts ?

Oui, sur activation : marquez les préfixes stables avec des points d'arrêt cache_control. Les tokens d'entrée en cache sont facturés $0.5/M contre $5/M hors cache ; les prompts doivent avoir un préfixe stable de 1,024 tokens pour être mis en cache (TTL 5 min par défaut, 1 heure en option). Guide de mise en cache Claude Opus 4.8 →

Comment obtenir l'accès à Claude Opus 4.8 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="claude-opus-4-8", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Quelle est la date de coupure des connaissances de Claude Opus 4.8 ?

La date de coupure des connaissances de Claude Opus 4.8 est 2026-01, selon la documentation officielle du fournisseur (au 2026-07-09).

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →