Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Blog de ingeniería

Problemas reales de ingeniería que encontramos al crear una pasarela de API LLM.

RSS
Empieza aquí

Reasoning effort en GLM 5.2: el ajuste que reduce el coste 20x

· glm · coding · llm-gateway · cost · reasoning

La misma solución de código: $0.0031 con el reasoning effort adecuado frente a $0.062 con el valor predeterminado sin límite de GLM 5.2. 20 veces más barato y 30 veces más rápido. Cómo ajustar el nivel según la tarea.

Empieza aquí

Claude Fable 5 no funciona con ZDR: retención de 30 días obligatoria

· claude-fable-5 · data-retention · compliance

Las organizaciones con ZDR reciben un error 400 en claude-fable-5: no hay opción de exclusión en Claude API, Bedrock, Vertex ni Foundry. Qué implica para HIPAA y COPPA, y cómo resolverlo mediante routing.

Empieza aquí

Caché de prompts LLM: guía completa 2026, entrada 50-90% menos

· prompt-cache · series-overview · llm-architecture

Cómo funciona la caché de prompts en Claude, GPT, Gemini y DeepSeek: reduce el coste de entrada entre un 50 y un 90% y mejora el TTFT entre 3 y 10 veces. Arquitectura, comparativa de proveedores y código Python.

Todos los artículos45