🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Claude Opus 5 frente a Opus 4.8, medidos: mismo precio, 3x de diferencia

Claude Opus 5 frente a Opus 4.8, medidos: mismo precio, 3x de diferencia

Contenido
  1. ¿En qué se diferencian Opus 5, Opus 4.8 y Fable 5 como plataformas?
  2. ¿Cuánto cuesta Opus 5 con la configuración predeterminada frente a Opus 4.8?
  3. ¿En qué se va el coste adicional?
  4. ¿Qué hace realmente el ajuste de razonamiento?
  5. ¿Se mantiene el sobrecoste de 3x en cargas de trabajo de agentes?
  6. ¿Cuesta Opus 5 realmente la mitad que Fable 5?
  7. Contexto, caché y tokenizer: ¿qué más verificamos?
  8. Preguntas frecuentes

Claude Opus 5 y Claude Opus 4.8 cobran lo mismo: $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Sin embargo, con prompts idénticos, la configuración predeterminada de Opus 5 costó 3.1x más. La causa es el razonamiento adaptativo: Opus 5 razona de forma predeterminada, factura ese razonamiento como salida y nunca lo muestra. Un único ajuste de la petición elimina por completo la diferencia, pero el modelo superior, Fable 5, no admite ese ajuste. Opus 5 llegó a disponibilidad general el 2026-07-24, presentado como un modelo con la inteligencia de Fable 5 a mitad de precio por token. Que la factura se reduzca realmente a la mitad depende casi por completo de esta decisión.

TL;DR

  • Con la configuración predeterminada, Opus 5 facturó 3.1x más que Opus 4.8, pese a tener el mismo precio, en nuestra matriz de cinco tareas; entre el 42% y el 95% de sus tokens de salida correspondían a razonamiento oculto.
  • thinking: {"type": "disabled"} igualó exactamente a Opus 5 con 4.8 (384 frente a 384 tokens de salida) sin afectar a la precisión; Fable 5 rechaza ese parámetro.
  • En tráfico de agentes, el sobrecoste baja al +33%, y los escenarios con tools y batch quedan cerca de la paridad: el razonamiento adaptativo apenas se activa en los bucles de tools.
  • La ventana de contexto de 1M es real (recuperó una aguja situada a 969,950 tokens) y el mínimo de caché es de 512 tokens, la mitad que los 1,024 de 4.8.

¿En qué se diferencian Opus 5, Opus 4.8 y Fable 5 como plataformas?

Antes de analizar el coste en detalle, conviene situar los tres niveles actuales de Claude según sus dos principales ejes de diferenciación: tarifas y forma de las peticiones. Esta es la comparación directa; marcamos los datos medidos y tomamos el resto de la documentación de los modelos:

Opus 4.8Opus 5Fable 5
Precio de tarifa (entrada/salida por M)$5 / $25$5 / $25$10 / $50
Razonamiento predeterminadodesactivado salvo que se soliciteadaptativo, activado (medido)siempre activado
thinking: disabledaceptado, independientemente del esfuerzoaceptado con esfuerzo high o inferiorrechazado con 400 (medido)
Niveles de esfuerzolow-max, valor predeterminado highlow-max, valor predeterminado high (coste medido más abajo)low-max, valor predeterminado high
Contenido del razonamiento devuelton/a de forma predeterminadanunca (medido)nunca
Mínimo de caché1,024 tokens512 tokens (medido)512 tokens
Ventana de contexto1M1M, tanto predeterminada como máxima (aguja a 969,950 tokens, medido más abajo)1M
Prefill del assistantrechazadorechazado, con un 400 específico (medido)rechazado
Modo rápidodisponible (research preview)disponible, $10/$50no disponible
Fallbacks ante rechazosactúa como destino de fallback predeterminadofallbacks, incluido el nuevo modo "default" (beta)introducidos aquí (listas explícitas)
Retención de datosopciones estándaropciones estándarretención obligatoria durante 30 días

Tres filas requieren algo más de contexto. La de thinking: disabled es la trampa al migrar: en Opus 5 está vinculada al esfuerzo y, según la documentación, solo se acepta con high o niveles inferiores; 4.8 trataba ambos ajustes de forma independiente. Los scripts de migración deben comprobar la versión. La fila del modo rápido anticipa una comparación relevante: Opus 5 en modo rápido cuesta exactamente lo mismo que Fable 5. Por tanto, comparar «Opus 5 rápido frente a Fable 5 predeterminado» es una decisión pura entre velocidad y capacidad, con el mismo precio por token. La fila de retención refleja una ventaja discreta para compliance: Opus 5 ofrece inteligencia de clase Fable sin la retención obligatoria de 30 días de Fable 5.

Hay otras dos características de la plataforma que no encajan bien en la tabla. Anthropic documenta casos límite cuando el razonamiento está desactivado: llamadas a tools escritas ocasionalmente en el texto visible y filtraciones de tags internos. No observamos ninguno de los dos casos en las 84 llamadas sin razonamiento de la suite de agentes que medimos más abajo. Aun así, la recomendación respalda esta regla de routing: mantén el razonamiento activado en las rutas que usan muchas tools, donde además el sobrecoste es pequeño. Por otro lado, Opus 5 permite cambiar las tools durante una conversación (beta), añadiéndolas o quitándolas entre turnos sin invalidar el prompt cache. Así se conserva la rentabilidad de los prefijos en caché sobre la que se apoya nuestra guía de prompt caching para sesiones largas de agentes.

¿Cuánto cuesta Opus 5 con la configuración predeterminada frente a Opus 4.8?

3.1x más por el mismo trabajo y con las mismas tarifas. Ejecutamos los tres niveles actuales de Claude sobre una matriz de cinco tareas (n=3 por celda, con prompts aleatorizados) usando su configuración predeterminada y la API Messages nativa. Incluimos Fable 5 como referencia:

TareaOpus 5 predeterminadoOpus 4.8Fable 5Precisión
Aritmética trivial123123/3 todos
Respuesta factual de una línea406113/3 todos
Función de código pequeña703844
Problema verbal de varios pasos152102523/3 todos
Párrafo de 120 palabras1,031236264
Total de tokens de salida (coste por conjunto)1,305 ($0.03427)384 ($0.01120)383 ($0.02233)

Mismas respuestas, mismas tarifas que 4.8 y una factura tres veces mayor. Opus 4.8 no razona a menos que se le pida; Opus 5 incluye el razonamiento adaptativo activado, y esos tokens se cobran a la tarifa completa de salida de $25/M.

La columna de Fable 5 muestra un resultado poco intuitivo: aunque sus tarifas son el doble ($10/$50), facturó un 35% menos en términos absolutos que Opus 5 con la configuración predeterminada. Fable 5 resolvió las mismas tareas con 383 tokens de salida, frente a los 1,305 de Opus 5. Los tres modelos usan el mismo esfuerzo predeterminado documentado (high), por lo que la diferencia está en la calibración del razonamiento, no en la configuración. Hay dos mecanismos compatibles con los resultados. Primero, un modelo más capaz necesita deliberar menos para confirmar una respuesta sencilla: Fable 5 empleó 52 tokens en el problema verbal, frente a los 152 de Opus 5, y 264 en el párrafo, frente a 1,031. Segundo, la capacidad principal de Opus 5 es escalar el cómputo en tiempo de inferencia para convertir más deliberación en mayor calidad en problemas difíciles. Su calibración predeterminada paga ese margen de seguridad en todas las peticiones, incluso cuando no hace falta. Con tráfico sencillo se paga por una cobertura que no se utiliza; Fable 5, en general, prescinde de ella.

¿En qué se va el coste adicional?

En razonamiento que no puedes leer. Al comparar los tokens de salida facturados con el texto visible de la respuesta, entre el 42% y el 95% del gasto de salida predeterminado de Opus 5 correspondía a razonamiento oculto. Se activa incluso en preguntas que no lo necesitan: la respuesta a 17*23 llevaba 11 tokens de razonamiento detrás de una respuesta de 1 token, y la tarea de redacción de 120 palabras dedicó unos 806 de sus 1,031 tokens de salida a deliberar. El contenido del razonamiento nunca se devuelve, ni como resumen ni como traza. Esto sitúa a Opus 5, junto con Fable 5, en el extremo de menor visibilidad del espectro que trazamos en nuestro estudio sobre la anatomía del uso de tokens. El desglose de uso muestra la cantidad, pero no permite saber qué aportó.

¿Qué hace realmente el ajuste de razonamiento?

Hace que la factura de Opus 5 sea igual a la de Opus 4.8. Al enviar thinking: {"type": "disabled"}, el razonamiento cayó a cero en todas las tareas y los totales quedaron exactamente igualados con 4.8: 384 tokens de salida frente a 384 y $0.01130 frente a $0.01120 por conjunto:

VarianteTokens de salida (conjunto)Coste (conjunto)frente a Opus 4.8Precisión (3 tareas verificables)
Opus 5 predeterminado (= esfuerzo high)1,305$0.034273.1x9/9
Opus 5, esfuerzo low1,019$0.027202.4x9/9
Opus 5, esfuerzo medium1,167$0.030892.8x9/9
Opus 5, esfuerzo high explícito1,514$0.039563.5x9/9
Opus 5, esfuerzo xhigh1,633$0.042623.8x8/8
Opus 5, esfuerzo max1,569$0.040933.7x9/9
Opus 5, razonamiento desactivado384$0.011301.0x9/9
Opus 4.8 predeterminado (= esfuerzo high, sin razonamiento)384$0.011201.0x9/9
Fable 5 predeterminado (= esfuerzo high, razonamiento siempre activado)383$0.022332.0x9/9

Primero, una aclaración sobre las etiquetas: los tres modelos documentan el mismo valor predeterminado en la API, esfuerzo high, y Anthropic afirma que indicar high explícitamente equivale a omitir el parámetro. Nuestras variantes con valor predeterminado implícito y high explícito difieren aun así un 16%. Se trata de variabilidad entre ejecuciones en la tarea de redacción, la celda más ruidosa en todos los lotes que hemos ejecutado, no de una diferencia real. Esas dos filas deben interpretarse como la misma variante medida dos veces. Lo que diferencia a las tres configuraciones predeterminadas no es el nivel de esfuerzo, sino el comportamiento del razonamiento en ese nivel: inexistente en 4.8, moderado y adaptativo en Fable 5, y agresivo y adaptativo en Opus 5.

Destacan dos puntos. Primero, el control de esfuerzo es una escala de calidad, no un control de costes. La escala (low a max) no es nueva; 4.8 admite el mismo intervalo. Sin embargo, en tareas tan sencillas, cada nivel por encima de low solo compra más deliberación con la misma precisión, y xhigh alcanza una factura 3.8x superior a la de 4.8. Los niveles más altos están pensados para escalar el cómputo en tiempo de inferencia en problemas realmente difíciles, algo que una matriz básica de cinco tareas no puede evaluar. Sí permite medir el coste, y los resultados muestran que ningún nivel devuelve el precio a la paridad con 4.8. Solo lo consigue desactivar el razonamiento, con un coste un 67% inferior al predeterminado. Segundo, Opus 5 permite desactivarlo: Fable 5 rechaza thinking: {"type": "disabled"} con un 400. Por tanto, se trata de una diferencia real de Opus 5, no de una constante de la familia. El mismo objeto thinking funciona en las dos interfaces del gateway, /v1/messages y la compatible con OpenAI, /v1/chat/completions. En esta última, las ejecuciones con el razonamiento desactivado informan de cero reasoning_tokens en completion_tokens_details:

{"model": "claude-opus-5", "thinking": {"type": "disabled"}}

La limitación del análisis es clara: nuestras tareas verificables son de recuperación de información o de un solo paso, y la precisión se mantuvo en 9/9 sin razonamiento, incluido el problema verbal de varios pasos. El razonamiento adaptativo existe precisamente para trabajos agénticos más difíciles. La decisión debe tomarse por ruta, igual que concluimos con Kimi K3 y Gemini 3.6 Flash: desactivado para extracción, formateo y llamadas de un solo paso; configuración predeterminada cuando las evaluaciones demuestren que el razonamiento compensa su coste.

¿Se mantiene el sobrecoste de 3x en cargas de trabajo de agentes?

No, y esa diferencia es relevante. En nuestra suite de escenarios de agentes (bucles de tools, RAG, tooling, batch y chats largos; 50 episodios por variante), Opus 5 con la configuración predeterminada solo costó un 33% más que Opus 4.8, no un 210%. Los escenarios basados en tools quedaron cerca de la paridad (1.01-1.22x). En ese contexto, el razonamiento sí es adaptativo: unos 88 tokens de razonamiento por llamada dentro de los bucles de agentes, frente a 806 en un prompt de redacción sin más contexto. La excepción son los chats largos, con 1.58x, donde sigue compensando desactivarlo (1.22x sin razonamiento). Las llamadas a funciones no mostraron ningún sobrecoste de razonamiento: con la configuración predeterminada, una petición de llamada a una tool devolvió 52 tokens de salida sin razonamiento asociado, el mismo presupuesto que consumiría un modelo sin razonamiento.

La división práctica depende del tipo de tráfico, no del modelo: las completions simples y las llamadas con forma de chat soportan el sobrecoste predeterminado de 3x y conviene desactivarlo; el tráfico de agentes con un uso intensivo de tools normalmente no lo necesita.

¿Cuesta Opus 5 realmente la mitad que Fable 5?

Solo después de desactivar el razonamiento. Por token, sí: $5/$25 frente a los $10/$50 de Fable 5. En la práctica, sobre nuestra matriz de tareas simples, Opus 5 con la configuración predeterminada facturó $0.03427 por conjunto, frente a los $0.02233 de Fable 5, un 53% más en términos absolutos. Fable 5 resolvió las mismas tareas con 383 tokens de salida, mientras que Opus 5 necesitó 1,305. Con el razonamiento desactivado, los $0.01130 de Opus 5 son casi exactamente la mitad de la factura de Fable 5. Así se cumple la promesa del lanzamiento, mediante un parámetro que el propio Fable 5 no admite.

Contexto, caché y tokenizer: ¿qué más verificamos?

La ventana de 1M es real y los errores son explícitos. El modelo recuperó correctamente en 39 segundos una aguja situada al principio de un prompt de 969,950 tokens. Un prompt de 1,010,221 tokens devolvió el error claro prompt is too long: … > 1000000 maximum en lugar de truncarse silenciosamente.

El mínimo de caché se redujo a la mitad. Anthropic documenta un prefijo cacheable mínimo de 512 tokens para Opus 5 y Fable 5, frente a los 1,024 de Opus 4.8 y Sonnet 5. Nuestras pruebas coincidieron: los prefijos de unos 511 tokens nunca se guardaron en caché, mientras que los de 547 lo hicieron de forma fiable. Las lecturas de caché se facturan a $0.50/M (0.1x), las escrituras a 1.25x y el TTL es de 5 minutos. Ahora se pueden cachear system prompts más cortos, algo que tiene un impacto discreto pero relevante en rutas con mucho QPS.

El tokenizer no cambia entre Opus 5, Opus 4.8, Fable 5 y Sonnet 5. Obtuvimos recuentos de tokens idénticos en nuestras muestras multilingües y de código, por lo que los presupuestos por idioma y las estimaciones de tamaño de los prompts se mantienen sin necesidad de recalibrarlos.

Preguntas frecuentes

¿Se puede desactivar el razonamiento en Claude Opus 5?

Sí, con esfuerzo high o inferior; según la documentación, combinarlo con xhigh o max devuelve un 400. En nuestras pruebas, los tokens de razonamiento bajaron a cero y el coste quedó igualado con Opus 4.8 (384 frente a 384 tokens de salida en nuestra matriz). Esto es específico de Opus 5: Fable 5 rechaza el mismo parámetro con cualquier nivel de esfuerzo mediante un 400. El control de esfuerzo (low a max) también funciona, pero nunca alcanza la paridad: en nuestra matriz varió entre un -21% con low y un +24% con xhigh respecto a la configuración predeterminada.

¿Por qué mi factura de Opus 5 es mayor que la de Opus 4.8 si tienen las mismas tarifas?

Porque Opus 5 razona de forma predeterminada y esos tokens se facturan como salida a $25/M. En prompts simples, entre el 42% y el 95% de la salida facturada correspondía a razonamiento oculto según nuestras mediciones; una multiplicación de dos dígitos llevaba 11 tokens de razonamiento detrás de una respuesta de 1 token. Consulta reasoning_tokens en el desglose de uso para medir su proporción en tu propio tráfico y desactiva el razonamiento en las rutas que no lo necesiten.

¿Conviene desactivar el razonamiento de Opus 5 en cargas de trabajo de agentes?

Normalmente, no. En nuestra suite de agentes, la configuración predeterminada solo costó un +33% frente a Opus 4.8, y los escenarios con tools y batch quedaron cerca de la paridad, porque el razonamiento adaptativo apenas se activa dentro de los bucles de tools. La excepción son las sesiones largas con forma de chat (1.58x), donde sigue compensando desactivarlo. Mide tu propia combinación de tráfico: el sobrecoste está en las completions simples, no en las llamadas a tools.

Mediciones realizadas del 2026-07-25 al 2026-07-27 con claude-opus-5, claude-opus-4-8 y claude-fable-5 a través del gateway de Synthorai: matriz de cinco tareas y ablación de esfuerzo/ajuste a partir de un lote canónico (n=3 por celda, prompts aleatorizados, API Messages nativa); cifras de agentes obtenidas de una suite de 150 episodios; pruebas de contexto y caché mediante recuperación de agujas y barridos de prefijos; filas sobre la forma de la API (prefill y aceptación del ajuste) a partir de peticiones directas. Los recuentos de precisión utilizan tareas con una única respuesta verificable. Los precios y el comportamiento pueden cambiar; contrástalos con tus propios registros de uso.

← Volver al blog