Blog de engenharia
Problemas reais de engenharia que encontramos ao construir um gateway de API LLM.
Reasoning Effort no GLM 5.2: o ajuste que reduz o custo em 20x (medido)
A mesma resposta de programação: $0.0031 com o reasoning effort ajustado corretamente, contra $0.062 com o padrão ilimitado do GLM 5.2. 20x mais barato e 30x mais rápido. Como ajustar o nível para cada tarefa.
Claude Fable 5 não funciona com ZDR: retenção de 30 dias é obrigatória
Organizações com ZDR recebem erro 400 no claude-fable-5: não há opt-out na API do Claude, Bedrock, Vertex ou Foundry. O impacto em HIPAA/COPPA e a correção via roteamento.
Cache de prompts em LLMs: guia completo de 2026 (reduza o custo de entrada em 50–90%)
Como funciona o cache de prompts no Claude, GPT, Gemini e DeepSeek: reduza o custo de entrada em 50–90% e o TTFT em 3–10x. Arquitetura, comparação entre provedores e código Python.
-
Claude Opus 5 vs Opus 4.8, em números: mesmo preço, custo 3x maior
Opus 5 e Opus 4.8 têm a mesma tabela de $5/$25, mas, com a configuração padrão, o Opus 5 cobrou 3.1x mais nas mesmas tarefas. Veja para onde vai esse custo e qual opção elimina a diferença.
-
APIs de transcrição de áudio: 14 modelos, de $0.002 a $0.016 por minuto
14 APIs de transcrição de áudio em um único gateway: preços por minuto, modelos com streaming, conversão da cobrança por token do gpt-4o e a faixa chinesa de ASR que a maioria dos comparativos ignora.
-
Gemini 3.6 Flash: o controle de raciocínio que altera o custo em 30x (medido)
O Gemini 3.6 Flash cobra pelo raciocínio que você não vê, e uma configuração por requisição pode alterar em até 30x o custo da mesma tarefa. Medições em cinco tipos de tarefa, com uma ressalva importante.
-
Preços da API Seedance, medidos: a fórmula dos tokens de vídeo
A Seedance cobra W×H×(24s+1)/1024 tokens de vídeo; chegamos à fórmula exata. 720p é faturado como 1248×704, e a tarifa menor de 4k custa 2.1x mais por segundo. Dados medidos.
-
Guia de prompting para GPT-5.6: dois padrões que custam 1.5x e 10x mais
Os padrões do GPT-5.6 são caros: omitir reasoning_effort custa 1.5x mais que 'none'; prefixos não marcados custam 10x mais que leituras em cache. Guia prático baseado em medições para estruturar requests.
-
Preço da API do Kimi K3, medido: desative o raciocínio sempre ativo
A documentação do Kimi K3 diz que o raciocínio não pode ser desativado. reasoning_effort:'none' funciona e reduz em 6x o custo de consultas simples. Medições: níveis de esforço, piso do cache e taxas em 9 idiomas.
-
Preços da API GPT Realtime: falar custa 4x mais que ouvir (medido)
gpt-realtime-2.1 cobra $0.019/min para ouvir e $0.077/min para falar; silêncio é grátis, e o replay em cache custa 1/80. Taxas medidas em $/min, funcionamento do cache e custos por cenário.
-
Uso de tokens em LLMs: por que uma resposta de 4 tokens cobra 217
Medições com GPT-5.6, Claude Fable 5, Qwen3.7-max e mais cinco famílias mostram que o raciocínio domina a cobrança de saída. Veja como interpretar e limitar cada campo de uso.
-
Mínimos do cache de prompts: a documentação subestima em 1,4–2,4x
Os fornecedores publicam um mínimo de tokens para o cache de prompts. Em medições com várias famílias de LLMs, o cache automático exigiu 1,4–2,4x mais do que a documentação indica; o cache explícito do Claude foi exato.
-
Guia de custos do GPT-5.6: 90% de desconto com prompt caching e reasoning effort
Os dois principais controles de custo do GPT-5.6, medidos: breakpoints explícitos cobram o input em cache a 10% da tarifa, e omitir reasoning_effort custa 1.5x mais do que usar none.
-
Qual LLM é mais barato para o seu idioma? Medimos o custo dos tokenizers
GPT-5.5 cobra menos tokens em idiomas europeus, Kimi em chinês e DeepSeek em japonês; Claude Fable 5, Opus 4.8 e Sonnet 5 usam de 1.2 a 2.3x mais. Dados medidos.
-
Claude Fable 5 para agentes: recusas em tool calls e custo vs GLM 5.2
Claude Fable 5 em cinco cargas de agentes, comparado a glm-5.2, opus-4-8 e sonnet-5: recusas durante tool calls, pensamento adaptativo e custos que variam de 5 a 15 vezes conforme o formato da carga.
-
Cache de prompts no LangChain: configurações que realmente acertam o cache
A sintaxe mais simples do LangChain desativa silenciosamente o cache de prompts do Claude. Correções medidas: cache_control em blocos de conteúdo, posição das variáveis e campos de uso.
-
Novo tokenizer do Claude Sonnet 5: 41% mais tokens por prompt
O novo tokenizer do Claude Sonnet 5 gera cerca de 41% mais tokens para o mesmo texto do que o Sonnet 4.6, alterando custos, orçamentos e elegibilidade para cache no gateway.
-
Chamadas de ferramentas do GLM 5.2 em loops de agentes: o que a compatibilidade com OpenAI esconde
O GLM 5.2 usa a API de chamadas de ferramentas da OpenAI, mas envia texto junto com as chamadas e expõe o raciocínio no mesmo turno. Veja como ele se compara à OpenAI e à Anthropic.
-
Custo de APIs de transcrição: 7 modelos com o mesmo áudio
Sete modelos de transcrição, um conjunto de áudios em vários idiomas e um único gateway: o custo por minuto varia de $0.0020 a $0.0164, e a acurácia não é o principal critério de escolha.
-
Custo de APIs de geração de imagens: 5 modelos comparados ($0.006–$0.039)
Cinco modelos de imagem, os mesmos prompts e um único gateway: de $0.006 a $0.039 por imagem com as configurações padrão, além de um controle de qualidade que multiplica a conta de um modelo por 36. Valores medidos.
-
Cache de LLMs com pesos abertos: por que o seu depende da roleta dos provedores
Em LLMs com pesos abertos, o cache de prompts é resolvido no mecanismo de inferência e prejudicado pelo roteamento. Um mapa de cinco camadas, com medições em DeepSeek, Qwen e Kimi.
-
Cache do Claude Fable 5: mesmo contrato, conta 2,9x maior que no Opus 4.6
O Claude Fable 5 já está disponível na Synthorai. Medimos cache de prompt, TTL, tokenização e custo em relação ao Opus 4.6/4.8: mesmo contrato de cache, novo tokenizer e conta ~2,9x maior.
-
Deriva de provedor: como o roteamento padrão aumenta o custo dos LLMs
No roteamento padrão de um gateway com vários provedores, requisições idênticas se espalham por upstreams com caches separados. A taxa de acerto despenca e a conta aumenta.
-
Seu gateway de LLM mente sobre o cache? Uma auditoria de 5 minutos
Gateways podem informar cache hits e cobrar o preço integral. Um único script audita em cinco minutos tanto o cache automático (DeepSeek) quanto o cache baseado em marcadores (Claude).
-
Claude Opus 4.8 na Synthorai: cache e TTL em comparação com 4.7/4.6
Claude Opus 4.8 já está disponível na Synthorai. Medimos o comportamento de prompt caching e TTL em comparação com Opus 4.7/4.6: o que permanece igual e a mudança de tokenizer que você precisa revisar.
-
Melhor LLM por caso de uso (2026): matriz de custos para chat, RAG e agentes
Chat, RAG ou agentes? Escolha o modelo mais barato que ainda entregue o desempenho necessário, com estimativas de custo medidas (uma tarefa de agente com 15 etapas e RAG com 100 mil consultas por dia) e uma matriz de decisão.
-
Cache de prompts de LLM em Python: tutorial prático com código
Economia medida com cache de prompts no Claude, GPT-5, Gemini 2.5, DeepSeek-v4 e Qwen3 usando o gateway compatível com OpenAI da Synthorai. Dados reais de usage.cost e TTFT.
-
Qual cache de prompt para LLM é mais barato? Comparativo de 5 provedores (2026)
Claude, GPT-5.x, Gemini, DeepSeek e Qwen implementam cache de cinco formas: explícito ou automático, TTL de 5 minutos ou 1 hora e leituras de 0.1x a 0.5x. Comparação com medições lado a lado.
-
Como funciona o cache de prompts em LLMs: KV cache e TTL
Como o cache de prompts em LLMs realmente funciona: a matemática da atenção dos Transformers por trás da reutilização de K/V, a relação entre memória e processamento que define o TTL e por que isso reduz custos e TTFT.