Blog de ingeniería
Problemas reales de ingeniería que encontramos al crear una pasarela de API LLM.
Empieza aquí
Reasoning effort en GLM 5.2: el ajuste que reduce el coste 20x
La misma solución de código: $0.0031 con el reasoning effort adecuado frente a $0.062 con el valor predeterminado sin límite de GLM 5.2. 20 veces más barato y 30 veces más rápido. Cómo ajustar el nivel según la tarea.
Claude Fable 5 no funciona con ZDR: retención de 30 días obligatoria
Las organizaciones con ZDR reciben un error 400 en claude-fable-5: no hay opción de exclusión en Claude API, Bedrock, Vertex ni Foundry. Qué implica para HIPAA y COPPA, y cómo resolverlo mediante routing.
Caché de prompts LLM: guía completa 2026, entrada 50-90% menos
Cómo funciona la caché de prompts en Claude, GPT, Gemini y DeepSeek: reduce el coste de entrada entre un 50 y un 90% y mejora el TTFT entre 3 y 10 veces. Arquitectura, comparativa de proveedores y código Python.
Todos los artículos45
-
GPT-6 Astra: max cuesta 2.3x más que low con igual resultado
Medido en 11 tareas verificadas: none falla 17 de 33, disabled no desactiva nada, max cuesta 2.3x low y Astra cuesta 1.6x GPT-5.6 Sol por respuesta correcta.
-
Límites de LLM API: 13 proveedores y 2 SDK sin reintentos 429
Qué tokens cuentan para RPM y TPM en 13 LLM API y clouds, qué headers devuelven, los cuatro significados de un 429 y los dos SDK que nunca lo reintentan.
-
Precios por contexto largo: hasta 6.7x sin avisar
Nueve modelos cobraron hasta 6.7x al superar límites que el agregador no muestra, y un endpoint cobró 1.25x sobre la tarifa publicada. Cómo evitarlo.
-
Facturación de API de IA: 17 unidades, de tokens a PTU-horas
Un mismo dólar se mide de 17 formas: tokens, caracteres, minutos, GB-días, token-horas y PTU-horas. Guía práctica para evitar errores de facturación.
-
Mejor LLM para traducción: 9 modelos, 9 idiomas, coste 400x
9 LLM, 9 idiomas y 8,455 veredictos ciegos: gpt-5.6-sol lidera 7 de 9; gemini-3.7-flash empata en coreano e italiano. Coste: $0.26-$104 por 1M de caracteres.
-
Retención de datos y ZDR en LLM: quién puede leer tus prompts
Los proveedores borran los logs de API en unos 30 días. El tracing, la memoria vectorial y la consola del gateway guardan prompts hasta que los borras.
-
Salidas estructuradas LLM: 4 de 12 APIs dan JSON válido pero erróneo
Medimos salidas estructuradas en 12 APIs de LLM: JSON válido en el 100%, valores erróneos en 4 modelos con thinking y entre 30 y 4,959 tokens de prompt.
-
¿Qué APIs marcan contenido IA? 16 frente a 10 leyes
16 APIs generativas frente a 10 leyes: 7 incluyen C2PA, 4 la etiqueta china, ninguna ambas; audio y vídeo, nada; ningún manifiesto resiste un cambio de tamaño.
-
Coste de una API de voz: 10 minutos cuestan $0.04-$0.57
Medimos cada tramo: STT a $0.002-0.006/min, TTS a $0.004-0.034 por minuto de audio, turnos LLM y GPT Realtime. Cascada frente a voz a voz, con coste por llamada.
-
DeepSeek V4 Pro GA vs Preview: razona entre un 18% y 62% menos
deepseek-v4-pro-0813 frente a Preview en tareas idénticas: 18-62% menos tokens de razonamiento, un bucle fijo de 8,192 tokens y pierde el «no lo sé».
-
Coste de Gemini 3.7 Flash: tareas entre 2.5 y 8x más baratas
Pruebas de gemini-3.7-flash: 50% menos hasta el 31 de diciembre, thinking baja un 26-77% frente a 3.6, sin apagado y prefill con 400.
-
¿Cuántos tokens cuesta una imagen? 15 APIs: de 6 a 1,298
El mismo icono de 64px factura 6 tokens en GPT-5.6 y 1,298 en ByteDance Seed. Tres esquemas de cobro y tres reglas documentadas que no se cumplen.
-
Controles de razonamiento: qué hacen 13 modelos LLM
razonamiento_esfuerzo y presupuesto_de_pensamiento en 13 APIs de LLM: tres proveedores aplican los presupuestos hasta el último token, otros los ignoran silenciosamente, un límite de 16 puede consumir 97.
-
Web Search API y Web Fetch API: cómo funcionan y qué dan por $0.01
Cómo se facturan web search y web fetch: $0.01, entre 1,500 y 3,100 tokens de resultados a la tarifa del modelo y un segundo turno que puede repetir la búsqueda.
-
API de Qwen-Image 3.0: 9 escenas en una imagen de $0.03
Pruebas iniciales de qwen-image-3.0: $0.03 por imagen, prompts gratis incluso con 5,000 tokens, nueve escenas en una y erratas en la letra pequeña.
-
DeepSeek V4 Flash: pensar corrompe JSON estricto
Mediciones del primer día de 0731: $0.14/$0.28, páginas de caché de 1,024 tokens y un fallo: pensar con json_schema estricto corrompió enteros en 8 de 13 ejecuciones.
-
Precio de Qwen 3.8 Max: 16 tokens superan a desactivar thinking
Mediciones de qwen3.8-max a $2/$6: el nivel de esfuerzo limita el presupuesto, desactivar thinking hunde la precisión a 1/6 y 16 tokens la recuperan.
-
Coste de MCP medido: 26 tools, $0.03 por llamada
Cada tool de MCP vuelve a facturarse como tokens de entrada en cada llamada: uno pequeño consume 401 tokens en Claude, GitHub cuesta $0.03/llamada y hay diferencias de 2.7x entre familias.
-
Coste de escritura de prompt cache: ¿cuándo compensa el 1.25x?
Una suite de agentes medida: 6% de pérdida en RAG y 83% de ahorro en batch. La ratio lectura:escritura decide; mídela antes de recibir la factura.
-
Claude Opus 5 frente a Opus 4.8, medidos: mismo precio, 3x de diferencia
Opus 5 y Opus 4.8 comparten tarifas de $5/$25, pero, con la configuración predeterminada, Opus 5 facturó 3.1x más en tareas idénticas. Explicamos en qué se va el coste y qué ajuste elimina la diferencia.
-
API de voz a texto: 14 modelos, de $0.002 a $0.016 por minuto
14 API de voz a texto tras un único gateway: tarifas por minuto, modelos con streaming, equivalencia por minuto de gpt-4o facturado por tokens y el nivel de ASR chino que casi todas las comparativas omiten.
-
Gemini 3.6 Flash: el dial de thinking que mueve el coste 30x
Gemini 3.6 Flash factura tokens de razonamiento que nunca ves, y un ajuste por petición puede multiplicar por 30 el coste de una misma tarea. Lo medimos en cinco tipos de tareas, con una salvedad.
-
Precios de la API de Seedance, medidos: resolvemos la fórmula de tokens de vídeo
Seedance factura W×H×(24s+1)/1024 tokens de vídeo; hemos resuelto la fórmula hasta el último token. 720p se factura como 1248×704 y, aunque 4k tiene una tarifa menor, cuesta 2.1x más por segundo. Datos medidos.
-
Guía de prompting GPT-5.6: dos defaults que cuestan 1.5x y 10x más
Los valores predeterminados de GPT-5.6 salen caros: omitir reasoning_effort cuesta 1.5x frente a 'none'; los prefijos sin marcar cuestan 10x más que las lecturas desde caché. Guía práctica basada en mediciones para estructurar las solicitudes.
-
Precios de Kimi K3: cómo desactivar el razonamiento «siempre activo»
La documentación de Kimi K3 dice que el razonamiento no se puede desactivar. reasoning_effort:'none' funciona y reduce 6 veces el coste de las consultas simples. Medimos los niveles de esfuerzo, el umbral de caché y las tarifas en 9 idiomas.
-
Precios de GPT Realtime API: hablar cuesta 4x más que escuchar
gpt-realtime-2.1 cobra $0.019/min por escuchar y $0.077/min por hablar; el silencio es gratis y reproducir desde caché cuesta 1/80. Tarifas medidas en $/min, funcionamiento de la caché y costes por escenario.
-
Uso de tokens en LLM: por qué una respuesta de 4 tokens factura 217
Mediciones en GPT-5.6, Claude Fable 5, Qwen3.7-max y cinco familias más: el razonamiento domina la factura de salida. Cómo interpretar y limitar cada campo de uso.
-
Mínimos de prompt cache: la documentación se queda corta 1.4-2.4x
Los proveedores publican un mínimo de tokens para el prompt cache. Las mediciones entre familias de LLM muestran que el cache automático necesita entre 1.4 y 2.4x más de lo indicado; el cache explícito de Claude sí coincide.
-
Costes de GPT-5.6: 90% menos con prompt caching y reasoning effort
Medimos las dos palancas de coste de GPT-5.6: los breakpoints explícitos facturan el input cacheado al 10% de la tarifa, y no enviar reasoning_effort cuesta 1.5x más que fijarlo en none.
-
¿Qué LLM es más barato para tu idioma? Costes medidos por tokenizer
GPT-5.5 factura menos tokens en idiomas europeos, Kimi en chino y DeepSeek en japonés; Claude Fable 5, Opus 4.8 y Sonnet 5 consumen entre 1.2 y 2.3 veces más. Datos medidos.
-
Claude Fable 5 para agentes: rechazos de tool calls, coste vs GLM 5.2
Claude Fable 5 en cinco cargas de agentes frente a glm-5.2, opus-4-8 y sonnet-5: rechazos durante tool calls, razonamiento adaptativo y costes que varían entre 5 y 15 veces según el tipo de carga.
-
Caché de prompts en LangChain: configuraciones que sí aciertan
La sintaxis más cómoda de LangChain desactiva silenciosamente la caché de prompts de Claude. Soluciones medidas: cache_control en bloques de contenido, ubicación de variables y campos de uso.
-
El nuevo tokenizer de Claude Sonnet 5: un 41% más de tokens por prompt
Con el nuevo tokenizer de Claude Sonnet 5, el mismo texto genera cerca de un 41% más de tokens que en Sonnet 4.6, lo que cambia los costes, los presupuestos y los requisitos para usar la caché en el gateway.
-
Tool calls de GLM 5.2: lo que oculta la compatibilidad con OpenAI
GLM 5.2 usa la API de llamadas a herramientas de OpenAI, pero devuelve texto junto con las llamadas y muestra el razonamiento en el mismo turno. Así se compara con OpenAI y Anthropic.
-
Coste de las API de transcripción: 7 modelos con el mismo audio
Siete modelos de transcripción, un conjunto de audios multilingües y un único gateway: el coste por minuto va de $0.0020 a $0.0164, y la precisión no es el factor diferencial.
-
Coste de API de generación de imágenes: 5 modelos ($0.006-$0.039)
Cinco modelos de generación de imágenes, los mismos prompts y un único gateway: entre $0.006 y $0.039 por imagen con la configuración predeterminada, además de un ajuste de calidad que multiplica por 36 la factura de uno de los modelos. Datos medidos.
-
Caché de LLM de pesos abiertos: depende de la ruleta del proveedor
En los LLM de pesos abiertos, el motor de inferencia resuelve la caché de prompts, pero el routing la rompe. Un mapa de cinco capas, medido con DeepSeek, Qwen y Kimi.
-
Caché de Claude Fable 5: mismo contrato, 2.9x vs Opus 4.6
Claude Fable 5 ya está disponible en Synthorai. Medimos la caché de prompts, el TTL, la tokenización y el coste frente a Opus 4.6/4.8: mismo contrato de caché, nuevo tokenizer y una factura ~2.9x mayor.
-
Deriva de proveedor: cómo el enrutamiento predeterminado dispara el coste de los LLM
Con el enrutamiento predeterminado de un gateway multiproveedor, solicitudes idénticas se reparten entre upstreams con cachés independientes. La tasa de aciertos se desploma y la factura sube.
-
¿Tu gateway de LLM miente sobre la caché? Audítalo en 5 minutos
Un gateway puede informar aciertos de caché y cobrar la tarifa completa. Un único script audita en cinco minutos tanto la caché automática (DeepSeek) como la basada en marcadores (Claude).
-
Claude Opus 4.8 en Synthorai: caché y TTL frente a 4.7/4.6
Claude Opus 4.8 ya está disponible en Synthorai. Medimos el comportamiento de la caché de prompts y el TTL frente a Opus 4.7/4.6: qué se mantiene y qué cambio de tokenizador conviene revisar.
-
Mejor LLM según el caso de uso (2026): matriz de costes para chat, RAG y agentes
¿Chat, RAG o agentes? Elige el modelo más barato que mantenga el rendimiento, con estimaciones de costes medidas (una tarea de agente de 15 pasos y RAG con 100K consultas/día) y una matriz de decisión.
-
Caché de prompts para LLM en Python: tutorial práctico con código
Ahorro medido con caché de prompts en Claude, GPT-5, Gemini 2.5, DeepSeek-v4 y Qwen3 mediante el gateway compatible con OpenAI de Synthorai. Datos reales de usage.cost y TTFT.
-
¿Qué caché de prompts LLM es más barata? 5 proveedores (2026)
Claude, GPT-5.x, Gemini, DeepSeek y Qwen ofrecen cinco enfoques de caché: explícita o automática, TTL de 5 minutos o 1 hora y lecturas entre 0.1x y 0.5x. Comparativa con mediciones en las mismas condiciones.
-
Cómo funciona el almacenamiento en caché de prompts en LLM: KV cache y TTL
Cómo funciona realmente la caché de prompts en LLM: las matemáticas de atención de los Transformer que permiten reutilizar K/V, el equilibrio entre memoria y cómputo que determina el TTL y por qué reduce el coste y el TTFT.
Aún no hay artículos sobre ese tema.