Blog de engenharia
Problemas reais de engenharia que encontramos ao construir um gateway de API LLM.
Comece por aqui
Reasoning Effort no GLM 5.2: o ajuste que reduz o custo em 20x
A mesma resposta de programação: $0.0031 com o reasoning effort ajustado corretamente, contra $0.062 com o padrão ilimitado do GLM 5.2. 20x mais barato e 30x mais rápido. Como ajustar o nível para cada tarefa.
Claude Fable 5 não funciona com ZDR: retenção de 30 dias é obrigatória
Organizações com ZDR recebem erro 400 no claude-fable-5: não há opt-out na API do Claude, Bedrock, Vertex ou Foundry. O impacto em HIPAA/COPPA e a correção via roteamento.
Cache de prompts em LLMs: guia completo de 2026 (reduza o custo de entrada em 50-90%)
Como funciona o cache de prompts no Claude, GPT, Gemini e DeepSeek: reduza o custo de entrada em 50-90% e o TTFT em 3-10x. Arquitetura, comparação entre provedores e código Python.
Todos os artigos45
-
GPT-6 Astra: max custa 2.3x low com respostas idênticas
Medição em 11 tarefas verificadas: none falha em 17 de 33, disabled não desativa, max custa 2.3x low e o Astra custa 1.6x o GPT-5.6 Sol por resposta correta.
-
Rate limits de APIs de LLM: 13 provedores e 2 SDKs sem retry
Quais tokens contam para RPM e TPM em 13 APIs e nuvens, quais retornam cabeçalhos, o que um 429 pode significar e os dois SDKs que nunca tentam de novo.
-
Preço de contexto longo: até 6.7x, invisível nos gateways
Em um agregador, nove modelos cobraram até 6.7x após limites não exibidos, e um endpoint cobrou 1.25x o valor anunciado. Como evitar.
-
Cobrança de APIs de IA: 17 unidades, de tokens a horas de PTU
O mesmo dólar de API é medido de 17 formas: tokens, caracteres, minutos, GB-dias, token-horas e PTU-horas. Um guia prático para evitar erros no código de cobrança.
-
Melhor LLM para tradução: 9 modelos, 9 idiomas, custo 400x
9 LLMs, 9 idiomas e 8.455 avaliações cegas: gpt-5.6-sol lidera em 7 de 9; gemini-3.7-flash empata em coreano e vence em italiano. O custo vai de $0.26 a $104 por 1M de caracteres.
-
Retenção de dados em LLMs e ZDR: quem lê seus prompts
Fornecedores apagam logs de API em cerca de 30 dias. Tracing SaaS, memória vetorial e consoles de gateway mantêm prompts até você apagá-los. O que o ZDR realmente cobre.
-
Saídas estruturadas: 4 de 12 APIs retornam JSON válido, mas errado
Teste em 12 APIs de LLM: JSON 100% válido, valores errados em 4 modelos com thinking e 30 a 4,959 prompt tokens na mesma chamada.
-
Quais APIs marcam conteúdo de IA? 16 APIs e 10 leis
16 APIs generativas frente a 10 leis: 7 incluem C2PA, 4 o rótulo chinês, nenhuma inclui ambos, áudio e vídeo não têm marcação, e nenhum manifesto C2PA sobrevive a um redimensionamento.
-
Custo de API para agente de voz: chamada de 10 min por $0.04-$0.57
Todos os trechos medidos: STT a $0.002-0.006/min, TTS a $0.004-0.034 por minuto de áudio, turnos de LLM e GPT Realtime. Cascata vs voz a voz, com custo por chamada.
-
DeepSeek V4 Pro GA vs Preview: 18-62% menos raciocínio
deepseek-v4-pro-0813 vs preview nas mesmas tarefas: 18-62% menos tokens de raciocínio, fuga fixa em 8,192 tokens e perda do “não sei”.
-
Gemini 3.7 Flash: tarefas custam de 2,5x a 8x menos
Testes no lançamento do gemini-3.7-flash: preço pela metade até 31 de dezembro, thinking 26-77% menor que no 3.6, sem opção de desligar e prefill com erro 400.
-
Quantos tokens tem uma imagem? 15 APIs, de 6 a 1.298
O mesmo ícone de 64px cobra 6 tokens no GPT-5.6 e 1.298 no ByteDance Seed. Três esquemas de cobrança e três regras da documentação que não se confirmam.
-
Controles de raciocínio em LLMs: teste com 13 modelos
reasoning_effort e thinking_budget em 13 APIs de LLM: três fornecedores aplicam os orçamentos até o último token, outros os ignoram silenciosamente, um limite de 16 pode consumir 97.
-
APIs de busca e captura web: como funcionam e o que $0.01 compra
Como busca e captura web no servidor são cobradas: taxa de $0.01, 1,500-3,100 tokens de resultados na tarifa do modelo e nova busca no segundo turno.
-
API Qwen-Image 3.0: 9 cenas em uma imagem por $0.03
Testes no lançamento do qwen-image-3.0: $0.03 por imagem, prompts grátis até 5.000 tokens, nove cenas em uma e erros nas letras miúdas.
-
DeepSeek V4 Flash: thinking corrompe JSON estrito
Medições do primeiro dia da versão 0731: preços de $0.14/$0.28, páginas de cache de 1.024 tokens e um bug que corrompeu inteiros em 8 de 13 execuções.
-
Qwen 3.8 Max: 16 tokens de raciocínio vencem o modo off
Medições do qwen3.8-max no lançamento a $2/$6: o seletor de esforço limita o orçamento, desligar o raciocínio derruba a precisão para 1/6 e 16 tokens resolvem.
-
Custo das tools MCP: 26 tools, $0.03 por chamada
Cada tool MCP volta a ser cobrada como tokens de entrada a cada chamada: uma tool pequena usa 401 tokens no Claude, o servidor GitHub custa $0.03/chamada e as famílias variam 2.7x.
-
Custo de gravação do prompt cache: quando 1.25x compensa?
Uma suíte de agentes medida, um adicional: perda de 6% em RAG e economia de 83% em batch. A proporção entre leituras e gravações decide.
-
Claude Opus 5 vs Opus 4.8, em números: mesmo preço, custo 3x maior
Opus 5 e Opus 4.8 têm a mesma tabela de $5/$25, mas, com a configuração padrão, o Opus 5 cobrou 3.1x mais nas mesmas tarefas. Veja para onde vai esse custo e qual opção elimina a diferença.
-
APIs de transcrição de áudio: 14 modelos, de $0.002 a $0.016 por minuto
14 APIs de transcrição de áudio em um único gateway: preços por minuto, modelos com streaming, conversão da cobrança por token do gpt-4o e a faixa chinesa de ASR que a maioria dos comparativos ignora.
-
Gemini 3.6 Flash: o controle de raciocínio que altera o custo em 30x (medido)
O Gemini 3.6 Flash cobra pelo raciocínio que você não vê, e uma configuração por requisição pode alterar em até 30x o custo da mesma tarefa. Medições em cinco tipos de tarefa, com uma ressalva importante.
-
Preços da API Seedance, medidos: a fórmula dos tokens de vídeo
A Seedance cobra W×H×(24s+1)/1024 tokens de vídeo; chegamos à fórmula exata. 720p é faturado como 1248×704, e a tarifa menor de 4k custa 2.1x mais por segundo. Dados medidos.
-
Guia de prompting GPT-5.6: 2 padrões que custam 1.5x e 10x mais
Os padrões do GPT-5.6 são caros: omitir reasoning_effort custa 1.5x mais que 'none'; prefixos não marcados custam 10x mais que leituras em cache. Guia prático baseado em medições para estruturar requests.
-
Preço da API do Kimi K3, medido: desative o raciocínio sempre ativo
A documentação do Kimi K3 diz que o raciocínio não pode ser desativado. reasoning_effort:'none' funciona e reduz em 6x o custo de consultas simples. Medições: níveis de esforço, piso do cache e taxas em 9 idiomas.
-
Preços da API GPT Realtime: falar custa 4x mais que ouvir (medido)
gpt-realtime-2.1 cobra $0.019/min para ouvir e $0.077/min para falar; silêncio é grátis, e o replay em cache custa 1/80. Taxas medidas em $/min, funcionamento do cache e custos por cenário.
-
Uso de tokens em LLMs: por que uma resposta de 4 tokens cobra 217
Medições com GPT-5.6, Claude Fable 5, Qwen3.7-max e mais cinco famílias mostram que o raciocínio domina a cobrança de saída. Veja como interpretar e limitar cada campo de uso.
-
Mínimos do cache de prompts: a documentação subestima em 1,4-2,4x
Os fornecedores publicam um mínimo de tokens para o cache de prompts. Em medições com várias famílias de LLMs, o cache automático exigiu 1,4-2,4x mais do que a documentação indica; o cache explícito do Claude foi exato.
-
Custos GPT-5.6: 90% de desconto com prompt caching e reasoning effort
Os dois principais controles de custo do GPT-5.6, medidos: breakpoints explícitos cobram o input em cache a 10% da tarifa, e omitir reasoning_effort custa 1.5x mais do que usar none.
-
Qual LLM é mais barato no seu idioma? Custo dos tokenizers
GPT-5.5 cobra menos tokens em idiomas europeus, Kimi em chinês e DeepSeek em japonês; Claude Fable 5, Opus 4.8 e Sonnet 5 usam de 1.2 a 2.3x mais. Dados medidos.
-
Claude Fable 5 para agentes: recusas em tool calls e custo vs GLM 5.2
Claude Fable 5 em cinco cargas de agentes, comparado a glm-5.2, opus-4-8 e sonnet-5: recusas durante tool calls, pensamento adaptativo e custos que variam de 5 a 15 vezes conforme o formato da carga.
-
Cache de prompts no LangChain: o que realmente acerta o cache
A sintaxe mais simples do LangChain desativa silenciosamente o cache de prompts do Claude. Correções medidas: cache_control em blocos de conteúdo, posição das variáveis e campos de uso.
-
Novo tokenizer do Claude Sonnet 5: 41% mais tokens por prompt
O novo tokenizer do Claude Sonnet 5 gera cerca de 41% mais tokens para o mesmo texto do que o Sonnet 4.6, alterando custos, orçamentos e elegibilidade para cache no gateway.
-
Tool calls do GLM 5.2: o que a compatibilidade com OpenAI esconde
O GLM 5.2 usa a API de chamadas de ferramentas da OpenAI, mas envia texto junto com as chamadas e expõe o raciocínio no mesmo turno. Veja como ele se compara à OpenAI e à Anthropic.
-
Custo de APIs de transcrição: 7 modelos com o mesmo áudio
Sete modelos de transcrição, um conjunto de áudios em vários idiomas e um único gateway: o custo por minuto varia de $0.0020 a $0.0164, e a acurácia não é o principal critério de escolha.
-
Custo de API de geração de imagens: 5 modelos ($0.006-$0.039)
Cinco modelos de imagem, os mesmos prompts e um único gateway: de $0.006 a $0.039 por imagem com as configurações padrão, além de um controle de qualidade que multiplica a conta de um modelo por 36. Valores medidos.
-
Cache em LLMs de pesos abertos: depende da roleta dos provedores
Em LLMs com pesos abertos, o cache de prompts é resolvido no mecanismo de inferência e prejudicado pelo roteamento. Um mapa de cinco camadas, com medições em DeepSeek, Qwen e Kimi.
-
Cache do Claude Fable 5: mesmo contrato, 2,9x vs Opus 4.6
O Claude Fable 5 já está disponível na Synthorai. Medimos cache de prompt, TTL, tokenização e custo em relação ao Opus 4.6/4.8: mesmo contrato de cache, novo tokenizer e conta ~2,9x maior.
-
Deriva de provedor: como o roteamento padrão aumenta o custo dos LLMs
No roteamento padrão de um gateway com vários provedores, requisições idênticas se espalham por upstreams com caches separados. A taxa de acerto despenca e a conta aumenta.
-
Seu gateway de LLM mente sobre o cache? Uma auditoria de 5 minutos
Gateways podem informar cache hits e cobrar o preço integral. Um único script audita em cinco minutos tanto o cache automático (DeepSeek) quanto o cache baseado em marcadores (Claude).
-
Claude Opus 4.8 na Synthorai: cache e TTL em comparação com 4.7/4.6
Claude Opus 4.8 já está disponível na Synthorai. Medimos o comportamento de prompt caching e TTL em comparação com Opus 4.7/4.6: o que permanece igual e a mudança de tokenizer que você precisa revisar.
-
Melhor LLM por caso de uso 2026: matriz de custos chat/RAG/agentes
Chat, RAG ou agentes? Escolha o modelo mais barato que ainda entregue o desempenho necessário, com estimativas de custo medidas (uma tarefa de agente com 15 etapas e RAG com 100 mil consultas por dia) e uma matriz de decisão.
-
Cache de prompts de LLM em Python: tutorial prático com código
Economia medida com cache de prompts no Claude, GPT-5, Gemini 2.5, DeepSeek-v4 e Qwen3 usando o gateway compatível com OpenAI da Synthorai. Dados reais de usage.cost e TTFT.
-
Qual cache de prompt para LLM é mais barato? Comparativo de 5 provedores (2026)
Claude, GPT-5.x, Gemini, DeepSeek e Qwen implementam cache de cinco formas: explícito ou automático, TTL de 5 minutos ou 1 hora e leituras de 0.1x a 0.5x. Comparação com medições lado a lado.
-
Como funciona o cache de prompts em LLMs: KV cache e TTL
Como o cache de prompts em LLMs realmente funciona: a matemática da atenção dos Transformers por trás da reutilização de K/V, a relação entre memória e processamento que define o TTL e por que isso reduz custos e TTFT.
Ainda não há artigos sobre esse tema.