🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Blog de ingeniería

Problemas reales de ingeniería que encontramos al crear una pasarela de API LLM.

RSS
Reasoning effort en GLM 5.2: el ajuste que reduce el coste 20 veces (medido)
★ Destacado

Reasoning effort en GLM 5.2: el ajuste que reduce el coste 20 veces (medido)

24 de junio de 2026 · glm · coding · llm-gateway · cost · reasoning

La misma solución de código: $0.0031 con el reasoning effort adecuado frente a $0.062 con el valor predeterminado sin límite de GLM 5.2. 20 veces más barato y 30 veces más rápido. Cómo ajustar el nivel según la tarea.

Claude Fable 5 no funciona con ZDR: la retención de 30 días es obligatoria
★ Destacado

Claude Fable 5 no funciona con ZDR: la retención de 30 días es obligatoria

12 de junio de 2026 · claude-fable-5 · data-retention · compliance

Las organizaciones con ZDR reciben un error 400 en claude-fable-5: no hay opción de exclusión en Claude API, Bedrock, Vertex ni Foundry. Qué implica para HIPAA y COPPA, y cómo resolverlo mediante routing.

Caché de prompts en LLM: guía completa de 2026 (reduce el coste de entrada entre un 50 y un 90%)
★ Destacado

Caché de prompts en LLM: guía completa de 2026 (reduce el coste de entrada entre un 50 y un 90%)

26 de mayo de 2026 · prompt-cache · series-overview · llm-architecture

Cómo funciona la caché de prompts en Claude, GPT, Gemini y DeepSeek: reduce el coste de entrada entre un 50 y un 90% y mejora el TTFT entre 3 y 10 veces. Arquitectura, comparativa de proveedores y código Python.