Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Blog di ingegneria

I veri problemi di ingegneria incontrati costruendo un gateway API per LLM.

RSS
Reasoning effort di GLM 5.2: l'impostazione che riduce i costi di 20 volte (dati misurati)
★ In evidenza

Reasoning effort di GLM 5.2: l'impostazione che riduce i costi di 20 volte (dati misurati)

24 giugno 2026 · glm · coding · llm-gateway · cost · reasoning

Stessa soluzione di coding: $0.0031 con il reasoning effort corretto, contro $0.062 con il valore predefinito senza limiti di GLM 5.2. Costa 20 volte meno ed è 30 volte più veloce. Come regolare il parametro in base al task.

Claude Fable 5 non funziona con ZDR: la conservazione per 30 giorni è obbligatoria
★ In evidenza

Claude Fable 5 non funziona con ZDR: la conservazione per 30 giorni è obbligatoria

12 giugno 2026 · claude-fable-5 · data-retention · compliance

Le organizzazioni ZDR ricevono un errore 400 con claude-fable-5: nessuna possibilità di rinuncia su Claude API, Bedrock, Vertex o Foundry. Impatti su HIPAA/COPPA e soluzione tramite routing.

Prompt caching per LLM: guida 2026 (costi input -50/-90%)
★ In evidenza

Prompt caching per LLM: guida 2026 (costi input -50/-90%)

26 maggio 2026 · prompt-cache · series-overview · llm-architecture

Come funziona il prompt caching con Claude, GPT, Gemini e DeepSeek: costi di input ridotti del 50-90% e TTFT 3-10 volte più rapido. Architettura, confronto tra provider e codice Python.