🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
El nuevo tokenizer de Claude Sonnet 5: un 41% más de tokens por prompt

El nuevo tokenizer de Claude Sonnet 5: un 41% más de tokens por prompt

Contenido
  1. Disponibilidad
  2. Precio: barato ahora, de vuelta a la tarifa de Sonnet 4.6 en septiembre
  3. Caché y TTL: sustitución directa
  4. La trampa del recuento de tokens
  5. Sonnet 5 frente a Opus 4.8: una ventaja duradera
  6. Checklist de migración
  7. Conclusión
  8. Preguntas frecuentes

claude-sonnet-5 ya está disponible en el gateway de Synthorai y, de momento, es barato: $2 / $10 por millón de tokens de entrada / salida, 2.5× menos que Opus 4.8 y por debajo de Sonnet 4.6. Pero durará poco. Es el precio de lanzamiento vigente hasta el 31 de agosto de 2026; el 1 de septiembre volverá a $3 / $15, la misma tarifa que Sonnet 4.6.

Si ya usas caché con la familia Claude, el contrato de caché y TTL no cambia. Donde hay que prestar atención es en el coste, porque Sonnet 5 cuenta los tokens de otra forma. Incorpora un nuevo tokenizer que convierte el mismo texto en inglés en aproximadamente un 41% más de tokens de entrada que Sonnet 4.6. Los límites y la facturación se calculan por número de tokens, así que la tarifa por token solo cuenta la mitad de la historia.

TL;DR

  • Claude Sonnet 5 cuesta $2/$10 por millón de tokens de entrada/salida hasta el 31 de agosto de 2026; el 1 de septiembre vuelve a $3/$15, la misma tarifa que Sonnet 4.6.
  • Un mismo texto genera 2,245 tokens en Sonnet 5 frente a 1,594 en Sonnet 4.6: un 41% más y exactamente la misma cantidad que Opus 4.8.
  • Con la tarifa estándar, el mismo prompt en inglés cuesta cerca de un 41% más en Sonnet 5 que en Sonnet 4.6.
  • La caché funciona sin cambios, con un descuento de lectura cercano al 90%; un turno con la caché caliente costó $0.0017 frente a $0.0043 en Opus 4.8.

Este cambio en el recuento de tokens afecta a lo siguiente, al margen de cualquier modificación de código o diferencia de calidad:

  • Coste por prompt. Con la tarifa estándar, el mismo prompt en inglés cuesta cerca de un 41% más que en Sonnet 4.6, porque el mismo texto se factura como más tokens al mismo precio por token.
  • Todas las estimaciones basadas en tokens. Un presupuesto por llamada o un recuento con un tokenizer local dimensionado para 4.6 se queda aproximadamente un 40% corto en Sonnet 5. Mide el usage real; no te fíes de una estimación local.
  • Margen de la ventana de contexto. El mismo documento ocupa cerca de un 41% más de la ventana. Las llamadas de contexto largo y RAG admiten menos texto real por solicitud.
  • Límites de tasa. Con la misma carga de trabajo, el límite de tokens por minuto se consume cerca de un 41% más rápido, lo que reduce el throughput.
  • Requisitos para usar la caché, con una pequeña ventaja. Es más fácil superar el mínimo de 1,024 tokens. Un prefijo que en 4.6 quedaba justo por debajo puede almacenarse en caché con Sonnet 5.

En el resto del artículo ponemos cifras medidas a cada punto: precio, economía de la caché y cambio en el recuento de tokens.

Precios, caché, TTL y recuentos de tokens medidos contra https://synthorai.io/ mediante el endpoint nativo de Anthropic /v1/messages el 2026-07-01. Los precios por token se calculan a partir del coste indicado en usage en llamadas reales; las tarifas de lanzamiento y estándar, así como la fecha de finalización del 31 de agosto, proceden del anuncio de Anthropic. Repite las mediciones con tu propio prompt antes de citar estos datos.


Disponibilidad

import os
from anthropic import Anthropic

anth = Anthropic(
    api_key=os.environ["SYNTHORAI_KEY"],
    base_url="https://synthorai.io/",   # SDK appends /v1/messages
)

msg = anth.messages.create(
    model="claude-sonnet-5",            # the only line that changes
    max_tokens=512,
    system=[
        {"type": "text", "text": SYSTEM_PROMPT,
         "cache_control": {"type": "ephemeral"}},
    ],
    messages=[{"role": "user", "content": question}],
)
print(msg.usage)   # cache_creation_input_tokens, cache_read_input_tokens, cost

Cambia el campo model y no tendrás que tocar nada del flujo de caché. El funcionamiento de cache_control se explica en el tutorial de caché; la arquitectura que justifica la existencia de la caché está en la primera parte de la serie.


Precio: barato ahora, de vuelta a la tarifa de Sonnet 4.6 en septiembre

Precios por token en el gateway, calculados a partir del coste indicado en usage en llamadas normales sin caché:

ModeloEntrada ($/M)Salida ($/M)
claude-sonnet-5 (lanzamiento, hasta el 31 de agosto)$2.00$10.00
claude-sonnet-5 (estándar, desde el 1 de septiembre)$3.00$15.00
claude-sonnet-4-6$3.00$15.00
claude-opus-4-8$5.00$25.00

La tarifa de lanzamiento supone un descuento real. Frente a Opus 4.8, la ventaja se mantiene incluso después de la promoción: con la tarifa estándar de $3 / $15, Sonnet 5 sigue siendo más barato que Opus. Además, ambos comparten tokenizer, como veremos más adelante, así que la comparación es directa con cualquiera de las dos tarifas.

Frente a Sonnet 4.6, el descuento es temporal. El 1 de septiembre, la tarifa por token será idéntica. Cualquier cálculo que parta de que «Sonnet 5 es más barato que 4.6» con el precio actual dejará de ser válido cuando termine la promoción. Con la misma tarifa por token, Sonnet 5 resulta en realidad más caro para el mismo texto, como muestra la siguiente sección.

No publicamos benchmarks de capacidades que no hayamos ejecutado. Evaluar si la calidad de Sonnet 5 justifica el sobrecoste frente a 4.6 te corresponde a ti.


Caché y TTL: sustitución directa

El contrato de caché es idéntico al del resto de la familia Claude. Ejecutamos una secuencia de escritura en frío y lectura en caliente con un prefijo estable de 2.2K tokens. Cambiamos el mensaje del usuario en cada llamada para evitar que una caché a nivel de respuesta alterase el resultado. Coste de cada turno en caliente, con el precio de lanzamiento actual:

ModeloTurno en frío (escritura en caché)Turno en caliente (lectura de caché)Frío → caliente
claude-sonnet-5 (lanzamiento)$0.0069$0.00174.0×
claude-sonnet-4-6$0.0079$0.00243.3×
claude-opus-4-8$0.0172$0.00434.0×

Las propiedades se mantienen igual que en la familia Opus:

  • Descuento de lectura ≈ 90%. Una lectura con la caché caliente cuesta alrededor del 10% del precio de entrada, en línea con el ahorro documentado por Anthropic de «hasta un 90%» en lecturas desde caché. Se amortiza con el primer hit.
  • El TTL de 1 hora funciona igual. Sonnet 5 acepta cache_control: {"type": "ephemeral", "ttl": "1h"} y el objeto usage separa los grupos como antes: cache_creation.ephemeral_5m_input_tokens y ephemeral_1h_input_tokens. La escritura con TTL de 1 hora cuesta aproximadamente 2× más que sin caché, frente a unas 1.25× para la escritura de 5 minutos. Las lecturas se mantienen en ≈10% con cualquier TTL.

Hay una salvedad: los costes por turno en caliente de la tabla corresponden a la tarifa de lanzamiento. Desde el 1 de septiembre, hay que multiplicar los importes de Sonnet 5 por 1.5× ($2 → $3 en entrada, $10 → $15 en salida). Un turno en caliente que hoy cuesta $0.0017 con Sonnet 5 costará unos $0.0026 en septiembre. Seguirá por debajo de los $0.0043 de Opus 4.8, pero ya no será más barato que Sonnet 4.6.


La trampa del recuento de tokens

El reajuste de septiembre afecta por partida doble. El mismo texto de sistema registra cerca de un 41% más de tokens de entrada en Sonnet 5 que en Sonnet 4.6.

ModeloTokens de entrada (texto idéntico)Coste de entrada con la tarifa estándar
claude-sonnet-4-61,594$0.0048
claude-sonnet-52,245$0.0067
claude-opus-4-82,245$0.0112

El mismo prompt en inglés genera 2,245 tokens en Sonnet 5, exactamente la misma cantidad que en Opus 4.8 y bastante más que los 1,594 de Sonnet 4.6. Sonnet 5 incorpora el tokenizer más reciente que la familia Opus adoptó en la versión 4.7.

Al combinar el precio con el recuento de tokens, el resultado queda claro:

  • Durante el periodo de lanzamiento, el aumento del 41% en tokens se compensa con una tarifa un 33% inferior ($2 frente a $3). El mismo prompt sin caché cuesta aproximadamente lo mismo que en 4.6, y los turnos en caliente son más baratos gracias al descuento en los tokens de salida.
  • Desde el 1 de septiembre, la tarifa coincide con la de 4.6, pero el recuento de tokens no. El mismo prompt en inglés cuesta cerca de un 41% más en Sonnet 5 que en Sonnet 4.6 ($0.0067 frente a $0.0048 para este prefijo), porque el mismo texto se cuenta como más tokens al mismo precio por token.

Frente a Opus 4.8 no existe esa trampa: ambos usan el mismo tokenizer (2,245 = 2,245). Sonnet 5 es claramente más barato tanto con la tarifa de lanzamiento (2.5×) como con la estándar (1.67×).

Calcula el presupuesto con la factura de septiembre, no con la de julio: la tarifa por token sube 1.5× el 1 de septiembre y el mayor recuento de tokens ya se aplica hoy. Lee cache_creation_input_tokens / cache_read_input_tokens de la respuesta real en vez de usar un tokenizer local que todavía podría trabajar con el vocabulario anterior.


Sonnet 5 frente a Opus 4.8: una ventaja duradera

Este es el cambio que se mantiene tras el lanzamiento. Sonnet 5 y Opus 4.8 comparten tokenizer, por lo que cualquier prompt genera el mismo número de tokens en ambos modelos. La diferencia de coste depende únicamente de la tarifa: Sonnet 5 es 2.5× más barato con el precio de lanzamiento y 1.67× más barato con el precio estándar, tanto en turnos en frío como en caliente, y tanto en entrada como en salida. Hoy, un turno con la caché caliente cuesta $0.0017 frente a $0.0043; incluso en septiembre serán aproximadamente $0.0026 frente a $0.0043.

En un loop de agente de gran volumen que reutiliza el mismo prefijo en cada turno, la diferencia se acumula. La decisión es la habitual: ejecuta tus propias evaluaciones y, si Sonnet 5 cumple tus requisitos de calidad, los números del gateway lo favorecen a largo plazo, no solo hasta agosto. Si no los cumple, basta con cambiar un campo model para volver a Opus 4.8 usando el mismo código de caché.


Checklist de migración

  • El código de caché se reutiliza sin cambios. Los marcadores cache_control, el número de breakpoints, ttl: "1h" y los nombres de campos de usage son idénticos a los de la familia Opus.
  • Las opciones de TTL no cambian. 5m para cargas de trabajo en tiempo real o por sesión; 1h para cargas con ráfagas o agentes con pausas.
  • La economía de los descuentos se mantiene. ≈90% en lectura, ≈1.25× en escritura (5m) y ≈2× en escritura (1h).
  • ⚠️ Marca el 1 de septiembre en el presupuesto. La tarifa de lanzamiento termina el 31 de agosto; Sonnet 5 pasa a $3 / $15. Modela el aumento de 1.5× antes de que entre en vigor.
  • ⚠️ Vuelve a medir el recuento de tokens si migras desde 4.6 o una versión anterior. El mismo texto genera cerca de un 41% más de tokens en Sonnet 5. Con la tarifa estándar, el mismo prompt resulta más caro que en 4.6, no más barato.
  • ⚠️ Confía en el objeto usage real. Lee *_input_tokens y cost de la respuesta, no de una estimación guardada de la generación anterior.

Conclusión

Sonnet 5 ofrece una buena relación coste-rendimiento, pero la promoción tiene fecha de caducidad. Frente a Opus 4.8, mantiene una ventaja de precio de 1.67–2.5× y permite reutilizar el flujo de caché sin cambios. Es el primer modelo que conviene evaluar para cualquier carga de Opus que no dependa de la máxima calidad. Frente a Sonnet 4.6, la ventaja se limita al descuento de lanzamiento: el 1 de septiembre igualará su tarifa y, debido al nuevo tokenizer, el mismo prompt costará más. Aprovecha el descuento, pero dimensiona el presupuesto con los precios de septiembre y confirma los recuentos de tokens con el objeto usage real antes de comprometer cifras con finanzas.

La guía completa está en la serie sobre caché de prompts, empezando por cómo funcionan KV Cache y TTL y el tutorial práctico en Python.


Preguntas frecuentes

¿Sonnet 5 es más barato que Sonnet 4.6? Solo durante el periodo de lanzamiento. Hasta el 31 de agosto de 2026 cuesta $2 / $10, frente a los $3 / $15 de 4.6. Desde el 1 de septiembre cuesta $3 / $15, la misma tarifa. Como el mismo texto genera cerca de un 41% más de tokens en Sonnet 5, con la tarifa estándar el mismo prompt cuesta más que en 4.6.

¿Cuándo termina el precio de lanzamiento? El 31 de agosto de 2026, según el anuncio de Anthropic. El 1 de septiembre, la tarifa pasa a $3 por millón de tokens de entrada y $15 por millón de tokens de salida.

¿Cuánto más barato es Sonnet 5 que Opus 4.8? 2.5× con la tarifa de lanzamiento y 1.67× con la tarifa estándar, tanto en entrada como en salida. Comparten tokenizer, así que generan el mismo número de tokens y la diferencia se debe únicamente a la tarifa con cualquiera de los dos precios.

¿Tengo que cambiar el código de cache_control? No. La sintaxis de los marcadores, el límite de breakpoints y las opciones de TTL son idénticos a los de la familia Opus. Cambia el campo model y nada más. Las lecturas en caliente cuestan ≈10% del precio de entrada; la escritura de 1 hora cuesta ≈2× más que sin caché y la de 5 minutos, ≈1.25×.

¿Sonnet 5 sustituye directamente a Opus 4.8? En caché, TTL y costes, la migración es trivial y Sonnet 5 es más barato con ambas tarifas. En cuanto a calidad, ejecuta tus propias evaluaciones; no publicamos benchmarks de capacidades que no hayamos realizado. Para consultar las capacidades del modelo, revisa la model card de Anthropic.


Verificación: las cifras de precios, caché, TTL y recuento de tokens se midieron contra https://synthorai.io/ el 2026-07-01 mediante el endpoint nativo de Anthropic /v1/messages, con un único tenant. Los precios por token se calcularon a partir del coste indicado en usage en llamadas normales; el coste por turno es la mediana de una muestra pequeña con un prefijo en caché de 2.2K tokens y refleja la tarifa de lanzamiento actual. El precio de lanzamiento y su finalización el 31 de agosto de 2026 proceden del anuncio de Sonnet 5 de Anthropic; los ratios de descuento y recargo se contrastaron con la documentación de Anthropic sobre Prompt Caching. Tus resultados variarán según el prompt, la región y la carga.

← Volver al blog