Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Claude Haiku 4.5

Lanzamiento: 2025-10-15

chatCódigoLlamada a herramientasVisiónCaché de promptsRazonamiento

Claude Haiku 4.5 es el nivel de velocidad de la línea Claude actual; Anthropic lo describe como «el modelo más rápido con inteligencia casi de frontera».

Entrada
texto imagen $1/M
Salida
texto $5/M
Lectura de caché
$0.1/M
Contexto
200K
vs GPT-4o
~80% más barato
Corte de conocimiento
2025-02

Benchmarks

Sobre la media0 / 6
Claude Haiku 4.5 otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro
39.5%
OSWorld-Verified
50.7%
GDPval-AA v2 Elo · 642-1861
907
GDM-MRCR v2 (8-needle) 128k (average)
35.3%
CharXiv (RQ) no tools
61.7%

Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 200.000
Salida máxima (especificación del proveedor) 64.000
Corte de conocimiento 2025-02
Datos de entrenamiento hasta 2025-07 conocimiento hasta 2025-02

Caché de prompts

Modo explícito (requiere activación)
Prefijo mín. 4096 predeterminado del proveedor: 1024
Duración 5 min por defecto, 1 hora opcional
Coste de escritura 1.25x (5m) / 2x (1h)

Razonamiento

Parámetro del proveedor thinking.type "enabled" + budget_tokens
Valores admitidos budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400
Valor por defecto off, sin pensamiento salvo que la solicitud lo active se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento Solo pensamiento extendido, sin parámetro de esfuerzo; los bloques de pensamiento de los turnos anteriores se eliminan y solo se conserva el último; el pensamiento intercalado no está admitido, y la cabecera beta se acepta pero se ignora.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto + imagen → texto
  • El Claude más rápido con inteligencia casi de frontera
  • pensamiento extendido admitido (no adaptativo)
  • contexto de 200k / salida máxima de 64k

según documentación oficial de Anthropic ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Claude Haiku 4.5 superado · 3 sentences

# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.

salida 106 tok latencia 2.8 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Claude Haiku 4.5 superado · 8/8 cases

# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]

salida 310 tok latencia 4.0 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Claude Haiku 4.5 superado · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

salida 63 tok latencia 1.6 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Claude Haiku 4.5 superado · 123 words, 0 banned, 1 question

# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]

salida 165 tok latencia 3.0 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Claude Haiku 4.5 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-haiku-4-5",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Acerca de Claude Haiku 4.5

  • Ofrece la latencia y el precio más bajos de cualquier modelo Claude actual, con una ventana de contexto de 200K tokens, hasta 64K tokens de salida, soporte de pensamiento extendido, entrada visual, uso de herramientas y caché de prompts.
  • La propia guía de selección de Anthropic nombra sus cargas de trabajo: aplicaciones en tiempo real, procesamiento inteligente de alto volumen, despliegues sensibles al coste que aun así necesitan un razonamiento sólido y tareas de subagente; además ancla una ruta de adopción explícitamente orientada a la eficiencia: empiece aquí y actualice solo donde una carencia concreta de capacidad lo obligue.
  • Su modelo de pensamiento es el antiguo, y esto importa al portar prompts.
  • Admite únicamente pensamiento extendido, con un presupuesto explícito de tokens que debe situarse por encima de 1024 y por debajo del límite de respuesta; el tipo de pensamiento adaptativo devuelve un error y no existe parámetro de esfuerzo.
  • Tampoco se admite el pensamiento intercalado.
  • La cabecera beta se acepta y se ignora.
  • La caché de prompts exige un prefijo mínimo de 4096 tokens, el más restrictivo de la familia, y los bloques de pensamiento de turnos anteriores se eliminan en lugar de conservarse.
  • Las salidas estructuradas están en disponibilidad general y la ventana de contexto está fijada en 200K sin variante de contexto largo.
  • Ese perfil encaja con chat de alto volumen, clasificación y asistentes de codificación donde la capacidad de respuesta importa más.
  • Synthorai sirve Claude Haiku 4.5 a través de su endpoint de chat compatible con OpenAI, así que cambiar es solo cuestión de cambiar el nombre del modelo.

Preguntas frecuentes

¿Se puede probar gratis la API de Claude Haiku 4.5?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1/M por tokens de entrada, solo ese crédito cubre aproximadamente 125 solicitudes de ~8K tokens contra Claude Haiku 4.5.

¿En qué destaca Claude Haiku 4.5?

El más rápido con inteligencia casi de frontera; la latencia y el precio más bajos de la línea actual; pensamiento extendido, entrada visual y caché de prompts. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Claude Haiku 4.5?

Claude Haiku 4.5 cuesta $1 por millón de tokens de entrada y $5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.1/M.

¿Claude Haiku 4.5 admite caché de prompts?

Sí, requiere activación: marque los prefijos estables con puntos de corte cache_control. Los tokens de entrada en caché se facturan a $0.1/M frente a $1/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché (TTL 5 min por defecto, 1 hora opcional). Guía de caché de prompts →

¿Cómo obtengo acceso a Claude Haiku 4.5?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="claude-haiku-4-5" y listo. Una sola clave API cubre todos los modelos del gateway.

¿Cuál es la fecha de corte de conocimiento de Claude Haiku 4.5?

La fecha de corte de conocimiento de Claude Haiku 4.5 es 2025-02, según la documentación oficial del proveedor (a fecha de 2026-07-09).

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →