Claude Opus 5 es el modelo de Anthropic para codificación agéntica compleja y trabajo empresarial, y su guía de migración lo califica de mejora radical sobre Claude Opus 4.8 en razonamiento profundo, tareas agénticas y de largo horizonte, y escalado del cómputo en tiempo de inferencia.
- Entrada
- texto imagen $5/M
- Salida
- texto $25/M
- Lectura de caché
- $0.5/M
- Contexto
- 1M
- Corte de conocimiento
- 2026-05
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 65 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 128.000 |
| Corte de conocimiento | 2026-05 |
Caché de prompts
| Modo | explícito (requiere activación) |
|---|---|
| Prefijo mín. | 512 predeterminado del proveedor: 1024 |
| Duración | 5 min por defecto, 1 hora opcional |
| Coste de escritura | 1.25x (5m) / 2x (1h) |
Razonamiento
| Parámetro del proveedor | thinking.type + output_config.effort |
|---|---|
| Valores admitidos | thinking.type adaptive · disabled; effort low · medium · high · xhigh · max |
| Valor por defecto | pensamiento on; effort high (Claude API y Claude Code) se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | Desactivar el pensamiento solo se acepta con effort high o inferior, y thinking {"type": "disabled"} con xhigh o max devuelve un error 400; display es "omitted" por defecto, así que los bloques de pensamiento vuelven con un campo thinking vacío salvo que fije display "summarized". |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen → texto |
|---|
- El contexto de 1M es a la vez el valor por defecto y el máximo, sin ninguna variante de contexto menor
- prompt mínimo cacheable reducido a 512 tokens
- entrada de imagen de alta resolución hasta 2576 px en el lado largo
- hasta 300k tokens de salida en la Message Batches API con la cabecera beta output-300k-2026-03-24
- cambios de herramientas a mitad de conversación en beta
- el modo rápido es un research preview solo en la Claude API
Un prompt, medido a través del gateway
Claude Opus 5 superado · 3 sentences
When reasoning is enabled, the model generates a hidden chain of "thinking" tokens before it writes the visible answer, and those internal tokens are billed at the output rate even though no one ever sees them — commonly 3–10x more tokens than the response itself. Because output tokens are priced several times higher than input tokens, that added volume hits us at our most expensive rate, which is why the bill roughly doubled while our request count stayed flat. The spend is controllable: we can cap the reasoning budget per call, route only genuinely hard requests to reasoning mode and cheaper models for the rest, and track cost per successfully completed task rather than cost per token, since a single correct answer usually beats three cheap retries plus human cleanup.
salida 529 tok latencia 9.0 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Claude Opus 5 superado · 8/8 cases
## Fixed version ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 if cur > best: best = cur return best ``` ## The bug The counters were tracking the wrong quantity: `cur` counted *matching adjacent pairs* rather than *elements in the current run*, and both counters started at `0` instead of `1`. Since a run of length *n* contains only *n − 1* adjacent equal pairs, every result came back one too small — `[1, 1]` returned 1, `[3, 3, 3]` returned 2 — and a single-element list returned 0 because the loop body never executed and `best` kept its initial value of `0`. […]
salida 1094 tok latencia 16.1 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Claude Opus 5 superado · 5/5 fields, guidance "Withheld pending Q4 close"
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "Withheld pending Q4 close" } ``` Notes on judgment calls: - **quarter**: "September quarter" is labeled Q3 because the text refers to an upcoming "Q4 close," implying a calendar-aligned fiscal year. No fiscal year is given. - **revenue_usd_m**: 412 is stated as constant-currency and hedged ("call it"), so it's approximate; the currency is not explicitly stated as USD. - **growth_pct**: "up eleven and change" means slightly more than 11, so 11 is a floor rather than an exact figure.
salida 539 tok latencia 7.6 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Claude Opus 5 superado · 123 words, 0 banned, 1 question
**Cross-Provider Prompt Caching** We're introducing Cross-Provider Prompt Caching in the API Gateway. Repeated system prompts, long documents, and few-shot examples are stored once at the gateway layer and reused across OpenAI, Anthropic, Google, and self-hosted models. Instead of paying full input token costs on every request, your application sends a cache reference, and the gateway rehydrates the context before forwarding it downstream. Why does that matter? Teams running high-volume agents and retrieval pipelines typically see input token spend fall 40 to 70 percent, with median latency dropping by several hundred milliseconds. Caches are scoped per project, encrypted at rest, and invalidated automatically when a prompt template changes. Enable it with a single header, and see the docs for TTL tuning and per-route controls.
salida 1593 tok latencia 19.1 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Claude Opus 5 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-opus-5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-opus-5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-opus-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-opus-5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Claude Opus 5
- La propia orientación de selección de Anthropic es empezar aquí y reservar Claude Fable 5 para las cargas de trabajo que necesiten la máxima capacidad disponible.
- Es una actualización de reemplazo directo con el precio de Opus 4.8 de $5 y $25 por millón de tokens de entrada y de salida, y mantiene la ventana de contexto de 1M tokens como valor por defecto sin cabecera beta, 128K de salida máxima, pensamiento adaptativo, caché de prompts, procesamiento por lotes, la Files API, soporte de PDF y visión, con dos carencias documentadas: la herramienta web fetch no está disponible y Priority Tier no se admite.
- Dos cambios afectan a las migraciones.
- El pensamiento está activado por defecto, así que una solicitud que omita el campo thinking ahora razona donde antes no lo hacía, y max_tokens sigue limitando conjuntamente el pensamiento y la respuesta.
- Y el pensamiento solo puede desactivarse con un esfuerzo high o inferior, porque combinar el pensamiento desactivado con xhigh o max devuelve un 400.
- El esfuerzo va de low a max y por defecto es high, la caché de prompts arranca con un prefijo de 512 tokens en lugar de 1024, el fast mode se ofrece como vista previa de investigación y la fecha de corte de conocimiento fiable es mayo de 2026.
- Los clasificadores de seguridad de ciberseguridad pueden rechazar una solicitud, y Anthropic señala que el modelo verifica su propio trabajo sin que se le pida, de modo que las instrucciones de verificación heredadas de prompts antiguos ahora provocan una verificación excesiva.
- Synthorai sirve Claude Opus 5 a través de su endpoint de chat compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Claude Opus 5?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $5/M por tokens de entrada, solo ese crédito cubre aproximadamente 24 solicitudes de ~8K tokens contra Claude Opus 5.
¿En qué destaca Claude Opus 5?
Construido para codificación agéntica compleja y trabajo empresarial; mejora radical sobre Opus 4.8 en razonamiento profundo y tareas de largo horizonte; pensamiento activado por defecto, desactivable solo con esfuerzo high o inferior. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Claude Opus 5?
Claude Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.5/M.
¿Claude Opus 5 admite caché de prompts?
Sí, requiere activación: marque los prefijos estables con puntos de corte cache_control. Los tokens de entrada en caché se facturan a $0.5/M frente a $5/M sin caché; los prompts necesitan un prefijo estable de 512 tokens para entrar en caché (TTL 5 min por defecto, 1 hora opcional). Guía de caché de prompts →
¿Cómo obtengo acceso a Claude Opus 5?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="claude-opus-5" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de Claude Opus 5?
La fecha de corte de conocimiento de Claude Opus 5 es 2026-05, según la documentación oficial del proveedor (a fecha de 2026-07-28).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.