Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Claude Opus 5 vs Gemini 3.1 Pro

vs

Lequel choisir, et quand

Choisissez Gemini 3.1 Pro lorsque la charge de travail concerne des documents longs et multimodaux : il lit le texte, l'image, l'audio et la vidéo à $2/$12 contre $5/$25 pour Opus 5. Choisissez Claude Opus 5 pour le codage par agent approfondi et l'utilisation d'outils sur de longs horizons, et notez que son tokenizer facture un texte identique comme contenant plus de tokens que la génération Sonnet 4.6 - comparez les nombres de tokens, pas les prix affichés.

Benchmarks

En têteAu-dessus de la moyenneNon dépasséClaude Opus 5738 / 468 / 46Gemini 3.1 Pro228 / 626 / 62

9 mesurés sur les deux.

Claude Opus 5 Gemini 3.1 Pro autres modèles mesurés moyenne des modèles comparés ★ aucun autre modèle n'a fait mieux
DeepSWE 1.1
68.8%
11.8%
WenetSpeech test-net (CER)
N/A
9.52%
BioMysteryBench hard
49.4%
N/A
OSWorld-Verified
N/A
64%
ExploitBench (Cap%)
70%
N/A
HealthBench Professional
59.8%
N/A
Finance Agent v2
58.6%
N/A
Legal Agent Benchmark
6.7%
N/A
GPQA Diamond
93.4%
94.3%
BrowseComp
90.8%
85.9%
LVBench
75.4%
N/A

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Tarifs

Claude Opus 5 Gemini 3.1 Pro Δ
Entrée / 1M de tokens $5 $2 2.5×
Sortie / 1M de tokens $25 $12 2.1×
Lecture de cache / 1M de tokens $0.5 $0.2 2.5×
Écriture de cache 1.25x (5m) / 2x (1h) - -

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix en entrée pour 1M de tokens, parmi les 76 modèles de chat facturés dans cette unité (échelle logarithmique)

Capacités

Claude Opus 5 Gemini 3.1 Pro
Appel d'outils oui oui
Contrôle de la réflexion configurable toujours activé
Sortie structurée oui oui
Mise en cache des prompts explicite (vous indiquez le préfixe) implicite + explicite
Durée de vie du cache 5m default, 1h option non publié
Préfixe minimal mis en cache 1024 tokens 4096 tokens

Spécifications

Claude Opus 5 Gemini 3.1 Pro
Modalités d'entrée texte image texte image audio vidéo
Modalités de sortie texte texte
Date de sortie 2026-07-24 2026-02-19
Coupure des connaissances 2026-05 2025-01
Fenêtre de contexte 1M 1M
Sortie maximale 128K 66K
Paramètre de réflexion
  • thinking.type
  • output_config.effort
thinkingLevel
Valeurs acceptées
thinking.type
  • adaptive
  • disabled
effort
  • low
  • medium
  • high
  • xhigh
  • max
  • low
  • medium
  • high (minimal is not supported)
Valeur par défaut

thinking on

effort
  • high (Claude API and Claude Code)
high

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Claude Opus 5 · Gemini 3.1 Pro

Un prompt, deux modèles, mesurés via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. CRITÈRE exactement 3 phrases

Claude Opus 5 réussi · 3 sentences

When reasoning is enabled, the model generates a hidden chain of "thinking" tokens before it writes the visible answer, and those internal tokens are billed at the output rate even though no one ever sees them — commonly 3–10x more tokens than the response itself. Because output tokens are priced several times higher than input tokens, that added volume hits us at our most expensive rate, which is why the bill roughly doubled while our request count stayed flat. The spend is controllable: we can cap the reasoning budget per call, route only genuinely hard requests to reasoning mode and cheaper models for the rest, and track cost per successfully completed task rather than cost per token, since a single correct answer usually beats three cheap retries plus human cleanup.

sortie 529 tok latence 9.0 s

Gemini 3.1 Pro réussi · 3 sentences

Enabling the AI's reasoning capability forces the model to generate a massive amount of invisible "thought" tokens to logically work through complex problems before delivering its final answer. Because our vendor's pricing model charges us for total computational effort—including all of these hidden background tokens—our billable usage effectively doubled per request. While this directly increases our upfront software expenses, we are trading this higher compute cost for a drastic reduction in expensive downstream errors and manual human rework.

sortie 1412 tok (+1318 réflexion) latence 12.7 s

Le respect de la consigne (exactement trois phrases, ça se compte), l'adaptation au public visé (le registre d'un directeur financier) et l'écart de facturation dû à la réflexion masquée, que révèlent les compteurs de tokens ci-dessous.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. CRITÈRE le correctif passe les tests

Claude Opus 5 réussi · 8/8 cases

## Fixed version ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 if cur > best: best = cur return best ``` ## The bug The counters were tracking the wrong quantity: `cur` counted *matching adjacent pairs* rather than *elements in the current run*, and both counters started at `0` instead of `1`. Since a run of length *n* contains only *n − 1* adjacent equal pairs, every result came back one too small — `[1, 1]` returned 1, `[3, 3, 3]` returned 2 — and a single-element list returned 0 because the loop body never executed and `best` kept its initial value of `0`. […]

sortie 1094 tok latence 16.1 s

Gemini 3.1 Pro réussi · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The original function initializes `cur` and `best` to 0 and only increments `cur` when two adjacent elements are equal. This effectively counts the number of *matching consecutive pairs* (or transitions) rather than the actual number of *elements* in the run, causing all calculated lengths to be […]

sortie 4092 tok (+3933 réflexion) latence 31.1 s

La justesse réelle du correctif (il s'exécute), la densité de l'explication et l'économie de tokens sur une tâche bien délimitée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. CRITÈRE JSON valide, schéma exact

Claude Opus 5 réussi · 5/5 fields, guidance "Withheld pending Q4 close"

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "Withheld pending Q4 close" } ``` Notes on judgment calls: - **quarter**: "September quarter" is labeled Q3 because the text refers to an upcoming "Q4 close," implying a calendar-aligned fiscal year. No fiscal year is given. - **revenue_usd_m**: 412 is stated as constant-currency and hedged ("call it"), so it's approximate; the currency is not explicitly stated as USD. - **growth_pct**: "up eleven and change" means slightly more than 11, so 11 is a floor rather than an exact figure.

sortie 539 tok latence 7.6 s

Gemini 3.1 Pro réussi · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": "11 and change", "guidance": "withheld" } ```

sortie 1806 tok (+1743 réflexion) latence 14.1 s

Le respect du schéma (aucun champ inventé), la tentation d'halluciner (le texte indique que la guidance n'est pas communiquée) et les différences entre les mécanismes de sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. CRITÈRE 120 mots, 0 mot interdit

Claude Opus 5 réussi · 123 words, 0 banned, 1 question

**Cross-Provider Prompt Caching** We're introducing Cross-Provider Prompt Caching in the API Gateway. Repeated system prompts, long documents, and few-shot examples are stored once at the gateway layer and reused across OpenAI, Anthropic, Google, and self-hosted models. Instead of paying full input token costs on every request, your application sends a cache reference, and the gateway rehydrates the context before forwarding it downstream. Why does that matter? Teams running high-volume agents and retrieval pipelines typically see input token spend fall 40 to 70 percent, with median latency dropping by several hundred milliseconds. Caches are scoped per project, encrypted at rest, and invalidated automatically when a prompt template changes. Enable it with a single header, and see the docs for TTL tuning and per-route controls.

sortie 1593 tok latence 19.1 s

Gemini 3.1 Pro réussi · 120 words, 0 banned, 1 question

We are excited to announce universal prompt caching for our API gateway. Handling multiple AI models usually means paying for redundant prompts across various platforms. Why should you pay twice for identical queries? Now, our gateway automatically stores and retrieves exact prompt matches regardless of the backend provider you select. This reduces latency and significantly cuts your inference costs. Whether you route a request to one service today or a different vendor tomorrow, our intelligent caching layer intercepts the call and serves the saved response instantly. Developers can configure cache expiration times and specify matching criteria directly in the control panel. Experience faster response times and optimized resource usage starting today. Upgrade your software client to version two right now.

sortie 4060 tok (+3929 réflexion) latence 28.6 s

Le respect des contraintes (nombre de mots, liste de mots interdits, une seule question), l'empreinte stylistique et la maîtrise de la longueur.

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    # model="gemini-3.1-pro-preview",  # décommentez cette ligne, commentez celle du dessus
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Obtenez votre clé API →

FAQ

Lequel est le moins cher, Claude Opus 5 ou Gemini 3.1 Pro ?

Gemini 3.1 Pro est moins cher sur la ligne « Entrée / 1M de tokens » ($2 contre $5, soit un écart de 2.5×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre Claude Opus 5 et Gemini 3.1 Pro sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

Claude Opus 5 et Gemini 3.1 Pro prennent-ils en charge la mise en cache des prompts ?

Oui. Les deux facturent les lectures de cache moins cher que leur tarif d'entrée : une charge de travail dont le préfixe est déjà en cache coûte donc moins que ne le laissent penser les tarifs publics. Les lignes de lecture de cache figurent dans le tableau des tarifs ci-dessus.

Comparatifs associés

Nos études, mesures à l'appui