Blog di ingegneria
I veri problemi di ingegneria incontrati costruendo un gateway API per LLM.
Reasoning effort di GLM 5.2: l'impostazione che riduce i costi di 20 volte (dati misurati)
Stessa soluzione di coding: $0.0031 con il reasoning effort corretto, contro $0.062 con il valore predefinito senza limiti di GLM 5.2. Costa 20 volte meno ed è 30 volte più veloce. Come regolare il parametro in base al task.
Claude Fable 5 non funziona con ZDR: la conservazione per 30 giorni è obbligatoria
Le organizzazioni ZDR ricevono un errore 400 con claude-fable-5: nessuna possibilità di rinuncia su Claude API, Bedrock, Vertex o Foundry. Impatti su HIPAA/COPPA e soluzione tramite routing.
Prompt caching per LLM: guida 2026 (costi input -50/-90%)
Come funziona il prompt caching con Claude, GPT, Gemini e DeepSeek: costi di input ridotti del 50-90% e TTFT 3-10 volte più rapido. Architettura, confronto tra provider e codice Python.
-
Miglior LLM per tradurre: 9 modelli e costi fino a 400x
9 LLM, 9 lingue, 8.455 verdetti ciechi: gpt-5.6-sol prevale in 7 lingue su 9, gemini-3.7-flash pareggia in coreano e italiano; costi da $0.26 a $104 per 1M di caratteri.
-
Output strutturati LLM: JSON valido ma errato in 4 API su 12
Output strutturati su 12 API LLM: JSON sempre valido, valori errati su 4 modelli con thinking attivo, stessa chiamata fatturata da 30 a 4,959 token.
-
Quali API marcano i contenuti AI? 16 API, 10 normative
16 API generative e 10 normative: 7 integrano C2PA, 4 l'etichetta cinese, nessuna entrambe; audio e video nulla; nessun manifest C2PA resiste al ridimensionamento.
-
Costo API per voice agent: una chiamata di 10 minuti costa $0.04-$0.57
Tutti i passaggi misurati: STT a $0.002-0.006/min, TTS a $0.004-0.034 per minuto audio, turni LLM e GPT Realtime. Cascata e speech-to-speech, con costo per chiamata.
-
DeepSeek V4 Pro GA vs Preview: 18-62% di ragionamento in meno
deepseek-v4-pro-0813 e Preview sugli stessi task: 18-62% di token di ragionamento in meno, un runaway fisso da 8,192 token e la perdita di «non lo so».
-
Costi Gemini 3.7 Flash: task 2.5-8x più economici di 3.6
Test al lancio di gemini-3.7-flash: prezzo dimezzato fino al 31 dicembre, thinking ridotto del 26-77% rispetto a 3.6, niente off, prefill in 400. Costi per task inferiori di 2.5-8x.
-
Quanti token costa un'immagine? 15 API, da 6 a 1.298
La stessa icona da 64px costa 6 token su GPT-5.6 e 1.298 su ByteDance Seed. Tre sistemi di fatturazione e tre regole documentate errate.
-
Controlli di ragionamento LLM: test su 13 modelli
reasoning_effort e thinking_budget su 13 API di LLM: tre fornitori applicano i budget al singolo token, altri li ignorano silenziosamente, un limite di 16 può bruciarne 97.
-
API di ricerca e fetch web: come funzionano e cosa compri con $0.01
Come vengono fatturati ricerca e fetch web lato server: $0.01, 1.500-3.100 token di risultati alla tariffa del modello e possibili nuove ricerche al turno successivo.
-
Qwen-Image 3.0 API: 9 scene in un'immagine da $0.03
Test al day one di qwen-image-3.0: $0.03 per immagine, prompt gratis fino a 5.000 token, nove scene in una e refusi nei testi piccoli.
-
DeepSeek V4 Flash: thinking corrompe il JSON strict
Misure del day one su 0731: prezzi $0.14/$0.28, pagine cache da 1.024 token e integer corrotti in 8 run su 13 con thinking e json_schema strict.
-
Prezzi API Qwen 3.8 Max: 16 token battono lo switch off
Misure del day one su qwen3.8-max a $2/$6: effort come limite di budget, accuratezza crollata a 1/6 senza thinking e recuperata con 16 token.
-
Overhead MCP misurato: 26 tool, $0.03 per chiamata
Ogni tool MCP viene fatturato come token di input a ogni chiamata: un piccolo tool usa 401 token su Claude, il server GitHub costa $0.03/chiamata e le famiglie differiscono di 2.7x.
-
Costo di scrittura della prompt cache: quando conviene 1.25x?
Una suite di agent misurata, un sovrapprezzo: perdita del 6% sul RAG, risparmio dell'83% sul batch. Decide il rapporto letture:scritture, misurabile prima della fattura.
-
Claude Opus 5 e Opus 4.8 alla prova: stesso prezzo, costi fino a 3 volte diversi
Opus 5 e Opus 4.8 hanno lo stesso listino da $5/$25, ma con le impostazioni predefinite Opus 5 ha fatturato 3.1 volte di più sugli stessi task. Ecco dove finiscono i costi e quale opzione li riallinea.
-
API di trascrizione vocale: 14 modelli, da $0.002 a $0.016 al minuto
14 API di trascrizione vocale dietro un unico gateway: tariffe al minuto, modelli con streaming, costo al minuto dei modelli gpt-4o fatturati a token e fascia ASR cinese ignorata da molti confronti.
-
Gemini 3.6 Flash: il selettore del reasoning che fa variare i costi di 30x (misurato)
Gemini 3.6 Flash fattura token di reasoning che non vedi, e una singola impostazione della richiesta può far variare fino a 30x il costo dello stesso task. Misure su cinque tipi di task, con un limite importante.
-
Prezzi delle API Seedance misurati: la formula dei video token, risolta
Seedance fattura W×H×(24s+1)/1024 video token; abbiamo ricavato la formula esatta. Il 720p viene conteggiato come 1248×704 e il 4k, pur avendo una tariffa inferiore, costa 2.1x di più al secondo. Dati misurati.
-
Guida al prompting GPT-5.6: due default che costano 1.5x e 10x
I valori predefiniti di GPT-5.6 sono costosi: omettere reasoning_effort costa 1.5x rispetto a 'none'; i prefissi non contrassegnati costano 10x rispetto alle letture dalla cache. Indicazioni operative sulla struttura delle richieste, basate su misurazioni.
-
Prezzi API di Kimi K3: disattivare il reasoning «sempre attivo»
La documentazione di Kimi K3 dice che il reasoning non può essere disattivato. reasoning_effort:'none' funziona e riduce di 6 volte il costo delle query semplici. Misurati: livelli di effort, soglia della cache e tariffe per 9 lingue.
-
Prezzi della GPT Realtime API: parlare costa 4 volte più che ascoltare (dati misurati)
gpt-realtime-2.1 addebita $0.019/min per l'ascolto e $0.077/min per la voce; il silenzio è gratuito, la riproduzione dalla cache costa 1/80. Tariffe misurate in $/min, funzionamento della cache e costi per scenario.
-
Token negli LLM: perché una risposta di 4 token ne fattura 217
Misure su GPT-5.6, Claude Fable 5, Qwen3.7-max e altre cinque famiglie: il reasoning domina il costo dell'output. Come leggere tutti i campi di utilizzo e limitarli.
-
Soglie minime della prompt cache: la documentazione le sottostima di 1.4-2.4x
I vendor pubblicano una soglia minima di token per la prompt cache. Le misurazioni sulle diverse famiglie di LLM mostrano che la cache automatica richiede 1.4-2.4x token in più rispetto a quanto dichiarato; la cache esplicita di Claude rispetta invece i valori documentati.
-
Costi GPT-5.6: 90% di sconto con prompt caching e reasoning effort
I due fattori di costo di GPT-5.6, misurati: i breakpoint espliciti fatturano l'input in cache al 10% della tariffa, mentre omettere reasoning_effort costa 1.5x rispetto a none.
-
Qual è l'LLM più economico per lingua? Costi dei tokenizer
GPT-5.5 fattura meno token per le lingue europee, Kimi per il cinese e DeepSeek per il giapponese; Claude Fable 5, Opus 4.8 e Sonnet 5 richiedono 1.2-2.3x token. Dati misurati.
-
Claude Fable 5 per gli agent: rifiuti durante le tool call e costi rispetto a GLM 5.2
Claude Fable 5 su cinque workload agentici, a confronto con glm-5.2, opus-4-8 e sonnet-5: rifiuti durante le tool call, adaptive thinking e costi che variano da 5 a 15 volte in base al workload.
-
Prompt caching con LangChain: configurazioni che funzionano davvero
La sintassi più comoda di LangChain disattiva silenziosamente il prompt cache di Claude. Soluzioni verificate: cache_control nei content block, posizione delle variabili e campi di utilizzo.
-
Nuovo tokenizer di Claude Sonnet 5: +41% di token per prompt
Con il nuovo tokenizer di Claude Sonnet 5, lo stesso testo genera circa il 41% di token in più rispetto a Sonnet 4.6, con effetti su costi, budget e idoneità alla cache sul gateway.
-
Tool call di GLM 5.2 negli agent loop: cosa nasconde la compatibilità con OpenAI
GLM 5.2 usa l'API OpenAI per i tool call, ma restituisce testo insieme alle chiamate e mostra il reasoning nello stesso turno. Ecco il confronto con OpenAI e Anthropic.
-
Costo delle API di trascrizione: 7 modelli sullo stesso audio
Sette modelli di trascrizione, un unico set audio multilingue e un solo gateway: il costo al minuto varia da $0.0020 a $0.0164, mentre l'accuratezza non è il fattore discriminante.
-
Costo delle API di generazione di immagini: confronto tra 5 modelli ($0.006-$0.039)
Cinque modelli di immagini, gli stessi prompt e un unico gateway: da $0.006 a $0.039 per immagine con le impostazioni predefinite, più un parametro di qualità che fa variare di 36 volte il costo di un modello. Dati misurati.
-
Cache degli LLM open-weight: perché dipende dalla roulette dei provider
Negli LLM open-weight, il prompt caching è risolto nell'inference engine ma compromesso dal routing. Una mappa a cinque livelli, con misurazioni su DeepSeek, Qwen e Kimi.
-
Cache di Claude Fable 5: stesso contratto, costo 2.9x rispetto a Opus 4.6
Claude Fable 5 è disponibile su Synthorai. Abbiamo misurato prompt caching, TTL, tokenizzazione e costi rispetto a Opus 4.6/4.8: stesso contratto di cache, nuovo tokenizer, costo ~2.9x.
-
Deriva del provider: come il routing predefinito fa aumentare i costi degli LLM
Con il routing predefinito di un gateway multi-provider, richieste identiche vengono distribuite tra upstream con cache separate. L'hit rate crolla e i costi aumentano.
-
Il tuo gateway LLM mente sulla cache? Verificalo in 5 minuti
Un gateway può segnalare cache hit e addebitare comunque il prezzo pieno. Un solo script verifica in cinque minuti sia la cache automatica (DeepSeek) sia quella basata su marker (Claude).
-
Claude Opus 4.8 su Synthorai: cache e TTL a confronto con 4.7/4.6
Claude Opus 4.8 è disponibile su Synthorai. Abbiamo misurato prompt caching e comportamento dei TTL rispetto a Opus 4.7/4.6: cosa resta invariato e quale variazione del tokenizer verificare.
-
Miglior LLM per caso d'uso (2026): matrice dei costi per chat, RAG e agenti
Chat, RAG o agenti? Scegli il modello più economico che garantisce comunque le prestazioni richieste, con stime dei costi misurate (un task agentico da 15 passaggi e un sistema RAG da 100.000 query al giorno) e una matrice decisionale.
-
Prompt caching per LLM in Python: tutorial con codice funzionante
Risparmi misurati con il prompt cache su Claude, GPT-5, Gemini 2.5, DeepSeek-v4 e Qwen3 tramite il gateway OpenAI-compatible di Synthorai. Dati reali per usage.cost e TTFT.
-
Qual è la prompt cache per LLM più economica? Confronto tra 5 provider (2026)
Claude, GPT-5.x, Gemini, DeepSeek e Qwen implementano la cache in cinque modi diversi: esplicita o automatica, TTL di 5 minuti o 1 ora, letture con costi da 0.1x a 0.5x. Confronto basato su misurazioni dirette.
-
Come funziona la cache dei prompt negli LLM: KV cache e TTL
Come funziona davvero la cache dei prompt negli LLM: la matematica dell'attenzione dei Transformer che consente di riutilizzare K/V, il compromesso tra memoria e calcolo che determina il TTL e i motivi per cui riduce costi e TTFT.