Claude Haiku 4.5 es el nivel de velocidad de la línea Claude actual; Anthropic lo describe como «el modelo más rápido con inteligencia casi de frontera».
- Entrada
- texto imagen $1/M
- Salida
- texto $5/M
- Lectura de caché
- $0.1/M
- Contexto
- 200K
- vs GPT-4o
- ~80% más barato
- Corte de conocimiento
- 2025-02
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 200.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 64.000 |
| Corte de conocimiento | 2025-02 |
| Datos de entrenamiento hasta | 2025-07 conocimiento hasta 2025-02 |
Caché de prompts
| Modo | explícito (requiere activación) |
|---|---|
| Prefijo mín. | 4096 predeterminado del proveedor: 1024 |
| Duración | 5 min por defecto, 1 hora opcional |
| Coste de escritura | 1.25x (5m) / 2x (1h) |
Razonamiento
| Parámetro del proveedor | thinking.type "enabled" + budget_tokens |
|---|---|
| Valores admitidos | budget_tokens at least 1,024 and below max_tokens; "adaptive" returns 400 |
| Valor por defecto | off, sin pensamiento salvo que la solicitud lo active se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | Solo pensamiento extendido, sin parámetro de esfuerzo; los bloques de pensamiento de los turnos anteriores se eliminan y solo se conserva el último; el pensamiento intercalado no está admitido, y la cabecera beta se acepta pero se ignora. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen → texto |
|---|
- El Claude más rápido con inteligencia casi de frontera
- pensamiento extendido admitido (no adaptativo)
- contexto de 200k / salida máxima de 64k
Un prompt, medido a través del gateway
Claude Haiku 4.5 superado · 3 sentences
# Why Your LLM Bill Doubled Reasoning models like o1 and o3 process queries through extended chains of thought before responding, consuming 5-10x more tokens internally than standard models while also charging higher per-token rates. This means both your input token usage and per-unit costs increased simultaneously—a compounding effect that easily doubles overall spend. Unless you've significantly reduced queries to other models or have very selective reasoning deployment, the math makes a doubling entirely predictable.
salida 106 tok latencia 2.8 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Claude Haiku 4.5 superado · 8/8 cases
# Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` # Bug Explanation The original function has two related bugs stemming from incorrect initialization and loop logic. First, `best` and `cur` start at 0, which causes single-element lists to incorrectly return 0 instead of 1—a run of one identical element should have length 1. Second, `cur` is reset to 0 (not 1) when a mismatch occurs, causing the next matching pair to be undercounted. More critically, if the longest run ends at the last index, `best` is only updated *during* the loop when a mismatch is encountered; if no mismatch follows the final run, `best` never captures it. […]
salida 310 tok latencia 4.0 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Claude Haiku 4.5 superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
salida 63 tok latencia 1.6 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Claude Haiku 4.5 superado · 123 words, 0 banned, 1 question
# Introducing Prompt Cache Across Providers We're excited to announce our latest API gateway feature: intelligent prompt caching that works across multiple AI providers. This powerful capability stores frequently used prompts and their contexts, dramatically reducing latency and API costs for your applications. By intelligently managing cached prompts across providers like OpenAI, Anthropic, and others, you can optimize your infrastructure without changing your code. Why wait for responses when cached results can be delivered instantly? The system automatically handles cache invalidation and updates, ensuring your applications always access current information while maintaining performance gains. With support for complex multi-turn conversations and dynamic content, this feature scales seamlessly with your business needs. […]
salida 165 tok latencia 3.0 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Claude Haiku 4.5 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-haiku-4-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-haiku-4-5",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-haiku-4-5",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-haiku-4-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-haiku-4-5")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Claude Haiku 4.5
- Ofrece la latencia y el precio más bajos de cualquier modelo Claude actual, con una ventana de contexto de 200K tokens, hasta 64K tokens de salida, soporte de pensamiento extendido, entrada visual, uso de herramientas y caché de prompts.
- La propia guía de selección de Anthropic nombra sus cargas de trabajo: aplicaciones en tiempo real, procesamiento inteligente de alto volumen, despliegues sensibles al coste que aun así necesitan un razonamiento sólido y tareas de subagente; además ancla una ruta de adopción explícitamente orientada a la eficiencia: empiece aquí y actualice solo donde una carencia concreta de capacidad lo obligue.
- Su modelo de pensamiento es el antiguo, y esto importa al portar prompts.
- Admite únicamente pensamiento extendido, con un presupuesto explícito de tokens que debe situarse por encima de 1024 y por debajo del límite de respuesta; el tipo de pensamiento adaptativo devuelve un error y no existe parámetro de esfuerzo.
- Tampoco se admite el pensamiento intercalado.
- La cabecera beta se acepta y se ignora.
- La caché de prompts exige un prefijo mínimo de 4096 tokens, el más restrictivo de la familia, y los bloques de pensamiento de turnos anteriores se eliminan en lugar de conservarse.
- Las salidas estructuradas están en disponibilidad general y la ventana de contexto está fijada en 200K sin variante de contexto largo.
- Ese perfil encaja con chat de alto volumen, clasificación y asistentes de codificación donde la capacidad de respuesta importa más.
- Synthorai sirve Claude Haiku 4.5 a través de su endpoint de chat compatible con OpenAI, así que cambiar es solo cuestión de cambiar el nombre del modelo.
Preguntas frecuentes
¿Se puede probar gratis la API de Claude Haiku 4.5?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1/M por tokens de entrada, solo ese crédito cubre aproximadamente 125 solicitudes de ~8K tokens contra Claude Haiku 4.5.
¿En qué destaca Claude Haiku 4.5?
El más rápido con inteligencia casi de frontera; la latencia y el precio más bajos de la línea actual; pensamiento extendido, entrada visual y caché de prompts. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Claude Haiku 4.5?
Claude Haiku 4.5 cuesta $1 por millón de tokens de entrada y $5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.1/M.
¿Claude Haiku 4.5 admite caché de prompts?
Sí, requiere activación: marque los prefijos estables con puntos de corte cache_control. Los tokens de entrada en caché se facturan a $0.1/M frente a $1/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché (TTL 5 min por defecto, 1 hora opcional). Guía de caché de prompts →
¿Cómo obtengo acceso a Claude Haiku 4.5?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="claude-haiku-4-5" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de Claude Haiku 4.5?
La fecha de corte de conocimiento de Claude Haiku 4.5 es 2025-02, según la documentación oficial del proveedor (a fecha de 2026-07-09).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.