工程博客
我们在构建多模态 AI 网关过程中遇到的真实工程问题。
从这里开始
GLM 5.2 Reasoning Effort:实测成本降低 20 倍的关键设置
同一道编程题可得到相同答案:正确设置推理强度时,GLM 5.2 成本仅为 0.0031 美元;采用不设上限的默认配置则需 0.062 美元。前者成本降低 20 倍、速度提高 30 倍,并说明如何按不同任务调整 reasoning effort 参数。
Claude Fable 5 无法在 ZDR 下运行:必须保留数据 30 天
ZDR 组织调用 claude-fable-5 时会收到 400 错误,因为 Claude API、Amazon Bedrock、Google Vertex AI 和 Azure AI Foundry 均未提供数据保留退出选项。本文说明该限制对 HIPAA、COPPA 合规工作负载的影响,并给出相应的请求路由修复方案。
LLM 提示词缓存:2026 完整指南(输入成本降低 50-90%)
详解 Claude、GPT、Gemini 和 DeepSeek 的提示词缓存机制,说明缓存复用如何将输入成本降低 50-90%,并使首个令牌生成时间(TTFT)提升 3-10 倍。涵盖缓存架构、各提供商实现差异、适用场景及可运行的 Python 示例代码。
全部文章45
-
GPT-6 Astra 推理强度:max 同答案成本是 low 的 2.3x
基于 11 个已验证任务的实测:none 在 33 次运行中失败 17 次,disabled 并未关闭推理,max 的成本是 low 的 2.3 倍,Astra 每个正确答案的成本是 GPT-5.6 Sol 的 1.6 倍。
-
LLM API 限流对比:13 家服务商,2 个 SDK 从不重试 429
对比13个LLM API及云平台的限流机制:哪些输入、输出或缓存令牌计入RPM与TPM,哪些服务返回配额响应头;解析HTTP 429可能代表的四种情况,并指出两个遇到429后从不自动重试的SDK,便于核对请求频率、令牌用量和客户端重试行为。
-
长上下文分级计价:最高 6.7 倍,网关页面却不展示
通过同一家聚合网关实测 9 个分级计价模型:请求越过页面从未注明的阈值后,费用最高升至页面价格的 6.7 倍,另有一个 endpoint 按标价的 1.25 倍计费。本文对比页面与账单,梳理各家分档规则,并给出让请求留在阈值以内的配置。
-
AI API 计费单位:从 token 到 PTU-hour 的 17 种计量方式
同一美元的 API 用量可按 token、字符、分钟、GB-day、token-hour、PTU-hour 等 17 种方式计量。本文逐项解释各单位的计量规则与常见陷阱,并梳理只改费率、不改单位的修正项和边界取整规则。
-
翻译用哪个 LLM:9 个模型、9 种语言,成本相差 400 倍
9 个 LLM × 9 种语言、8,455 次盲评:gpt-5.6-sol 在 7 种语言领先,gemini-3.7-flash 在韩语打平、意大利语反超;同一批翻译每 100 万字符的成本从 $0.26 到 $104,相差 400 倍。
-
LLM 数据留存与 ZDR:谁能读取你的 prompt
模型供应商约 30 天后删除 API 日志;你自己的 Tracing SaaS、向量记忆与网关控制台却会一直保留 prompt,直到你主动删除。本文梳理 Agent 链路上每个能读到明文的参与方,并讲清零数据留存(ZDR)真正覆盖哪些内容。
-
LLM 结构化输出实测:12 个 API 里 4 个合规但值错
实测 12 个 LLM API 的结构化输出:真正生效的开关全部返回 100% 合规 JSON,但 4 个模型开着 thinking 会往合规 JSON 里填错误值;同一次调用计费从 30 到 4,959 prompt token 不等,Claude 在兼容接口上还会静默忽略参数。
-
哪些 API 会标记 AI 内容?16 个 SKU 对照 10 项法规实测
实测 16 个生成式 API 对照 10 项标记法规:7 个嵌入 C2PA,4 个嵌入中国隐式标识,没有一个同时支持两者;音频和视频输出完全没有标记,图片一经缩放所有 C2PA 清单即丢失。本文给出每个缺口的位置和补齐成本。
-
语音智能体 API 成本:10 分钟通话需 $0.04 到 $0.57
逐环节实测通话成本:语音转文字每分钟 $0.002-0.006,文字转语音每音频分钟 $0.004-0.034,并计入 LLM 对话轮次与 GPT Realtime 的费用。按单次通话统一核算,对比级联式 STT、LLM、TTS 流程与端到端语音到语音方案。
-
DeepSeek V4 Pro 正式版对比预览版:思考量减少 18-62%
相同任务对比 deepseek-v4-pro-0813 与预览版:推理 token 少 18%-62%,8,192 token 失控已修复,严格 JSON 仅在正式版关闭思考时 8/8 正确,但它不再会说“我不知道”。
-
实测 Gemini 3.7 Flash API 成本:同任务比 3.6 便宜 2.5-8 倍
首日实测 Gemini 3.7 Flash:12 月 31 日前享半价,思考量比 3.6 少 26% 到 77%,关闭思考的开关已取消,预填充轮次返回 400,缓存构建也变慢。同任务账单实测便宜 2.5 到 8 倍。
-
一张图算多少 token?同一图标实测 15 个 API:6 到 1,298
同一张 64px 图标在 GPT-5.6 上输入计费为 6 个 token,在 ByteDance Seed 上为 1,298 个 token,相差 216 倍。归纳出三种图片计费方式、三条与实测不符的官方文档规则;美元成本跟着费率走,而不是图片本身。
-
LLM 思考控制实测:13 个模型如何接受、忽略或执行参数
13 个 LLM API 的 reasoning_effort 与 thinking_budget 实测:只有三家厂商把预算精确执行到 token,其余厂商静默忽略;Kimi 上限设为 16,实测烧掉 97 个推理 token。
-
Web Search API 与 Web Fetch API:工作原理及 $0.01 的实际成本
详解服务端网页搜索和网页抓取的计费方式:每次收取 $0.01 固定费用,并按所用模型费率计算注入的 1,500-3,100 个结果 token;第二轮请求还可能再次触发搜索,产生新的固定费用与结果 token 成本。
-
实测 Qwen-Image 3.0 API:$0.03 一张图生成 9 个场景
首日实测 qwen-image-3.0:每张图 $0.03,prompt 即使长达 5,000 token 也不计费;一张图里生成九个场景的省钱技巧是真的,但按要求听写的小字会拼错,自创文字反而全对。
-
DeepSeek V4 Flash API 成本:思考模式破坏严格 JSON
0731 首日实测记录:标价 $0.14/$0.28、缓存按 1,024-token 分页;并发现一项缺陷:开启思考模式并使用严格 json_schema 时,13 次运行中有 8 次整数字段损坏,关闭思考即可修复。
-
Qwen 3.8 Max API 定价:16 个思考 token 胜过关闭思考
qwen3.8-max 首日实测解析其 $2/$6 定价与推理表现:effort 档位并非思考强度开关,实际是隐藏的预算上限;关闭思考后两步数学正确率跌到 1/6,给 16 个思考 token 的预算即可恢复 6/6。
-
实测 MCP 工具开销:26 个工具每次调用 $0.03
每次调用都会把全部 MCP 工具重新计入输入 token:Claude 上一个小工具占 401 token,GitHub server 每次调用成本约 0.03 美元;不同模型系列的计费差异可达 2.7 倍,因此工具数量和调用频率都会直接推高总成本。
-
Prompt Cache 写入成本:1.25x 溢价何时回本?
基于同一套实测Agent与同一高级方案对比:RAG场景成本增加6%,批处理场景则节省83%。最终差异取决于读取与写入的比例;可在账单生成前测量自身读写比,据此预估实际费用,并判断该方案在具体工作负载中是溢价还是节省。
-
实测 Claude Opus 5 与 Opus 4.8:标价相同,成本相差 3 倍
Opus 5 与 Opus 4.8 的输入/输出价目表同为每百万令牌 $5/$25,但在默认配置下执行完全相同的任务时,Opus 5 的实际账单达到 4.8 的 3.1 倍。本文逐项分析额外费用流向,并说明应调整哪个配置开关,才能消除这项成本差距。
-
语音转文字 API:14 个模型,每分钟 $0.002 至 $0.016
通过一个网关接入 14 个语音转文字 API,逐项比较每分钟费率与实时流式转录支持情况,并将按 token 计费的 gpt-4o 换算为可直接对照的分钟成本,同时纳入多数横向评测未覆盖的中国 ASR 价格档位。
-
Gemini 3.6 Flash:思考档位让成本相差 30 倍(实测)
Gemini 3.6 Flash 会对用户看不到的内部推理过程计费,同一任务仅因一个请求参数设置不同,成本就可能相差最高 30 倍。本文对五类任务进行实测并比较费用变化,同时说明测试结果背后的限制与需要注意的条件。
-
Seedance API 定价实测:精确推导视频 token 公式
实测表明,Seedance 按 W×H×(24s+1)/1024 计算视频 token,并可精确到单个 token。720p 实际以 1248×704 的分辨率计费;4K 虽采用更低的每 token 费率,但由于像素数增加,每秒成本仍达到 720p 的 2.1 倍。
-
GPT-5.6 提示词指南:两个默认设置让费用增加到 1.5 倍和 10 倍
GPT-5.6 的默认设置会显著增加调用成本:省略 reasoning_effort 时,计费是设为“none”的 1.5 倍;未标记前缀的费用则是缓存读取的 10 倍。本文基于实测数据,说明如何调整请求结构、显式设置推理强度并正确标记可缓存前缀。
-
Kimi K3 API 实测定价:关闭“始终开启”的推理
Kimi K3 文档称推理无法关闭,但实测设置 reasoning_effort:'none' 确实生效,简单查询成本可降至原来的六分之一。本文还对比不同推理档位,测定缓存生效门槛,并整理 9 种语言输入与输出的实际费率。
-
GPT Realtime API 定价实测:说话成本是听取的 4 倍
gpt-realtime-2.1 听取语音按 $0.019/min 计费,生成语音按 $0.077/min 计费;静音时段免费,缓存音频重放成本仅为正常费用的 1/80。内容涵盖实测每分钟费率、缓存计费机制,以及不同听说时长和缓存使用情景下的成本计算。
-
LLM Token 用量:为什么只回答 4 个 Token,却按 217 个 Token 计费
实测 GPT-5.6、Claude Fable 5、Qwen3.7-max 等八个模型家族的用量与计费数据,结果显示推理令牌占据大部分输出费用。本文逐项解释 usage 返回值中的输入、输出、推理及缓存等字段,并说明如何设置上限以控制用量与成本。
-
提示词缓存最低门槛:文档低估了 1.4-2.4 倍
厂商通常会公布启用提示词缓存所需的最低 token 数。对多个大语言模型系列的测量结果显示,自动缓存的实际门槛通常是文档标称值的 1.4-2.4 倍;相比之下,Claude 的显式缓存最低 token 要求与官方文档完全一致。
-
GPT-5.6 成本指南:Prompt Cache 省 90%,Reasoning Effort 实测
实测 GPT-5.6 的两项成本控制因素及其计费差异:设置显式断点后,命中缓存的输入仅按标准输入费率的 10% 计费;调用时不传 reasoning_effort 参数,产生的费用是将该参数设为 none 时的 1.5 倍。
-
哪款 LLM 处理你的语言最便宜?实测分词成本
GPT-5.5 处理欧洲语言时计费 token 最少,Kimi 处理中文最少,DeepSeek 处理日文最少;Claude Fable 5、Opus 4.8 和 Sonnet 5 的 token 数高出 1.2-2.3x。实测结果。
-
Claude Fable 5 用于 Agent:工具调用中途拒绝、与 GLM 5.2 的成本对比
在五类智能体工作负载中对比 Claude Fable 5、glm-5.2、opus-4-8 与 sonnet-5,分析工具调用过程中途拒绝和自适应思考表现。不同任务形态会使推理与调用成本产生 5—15 倍差距。
-
LangChain 提示词缓存:真正能命中缓存的配置方式
LangChain 最便捷的语法可能会在无提示的情况下禁用 Claude 提示词缓存。本文通过实测说明修复方法:使用内容块传递 cache_control、调整模板变量的位置,并从响应的 usage 字段中核验缓存命中与用量。
-
Claude Sonnet 5 的新 tokenizer:同一 prompt 的 token 数增加 41%
Claude Sonnet 5 采用新的 tokenizer,同一段文本生成的 token 数量比 Sonnet 4.6 约多 41%。这一差异会提高网关调用成本和 token 预算占用,并可能改变请求是否符合提示缓存资格及其计费方式。
-
Agent 循环中的 GLM 5.2 工具调用:“兼容 OpenAI”没有告诉你的事
GLM 5.2 兼容 OpenAI 工具调用 API,但返回工具调用时会夹带文本内容,并在当前轮次中显示推理过程。本文从请求与响应格式、工具调用行为及推理信息呈现方式等方面,对比其与 OpenAI、Anthropic API 的具体差异。
-
转录 API 成本实测:7 个模型处理同一组音频
通过同一网关调用 7 个转录模型处理同一组多语言音频,并在统一条件下比较结果。各模型每分钟成本介于 $0.0020 至 $0.0164,相差超过 8 倍,而准确率并非主要差异,应结合价格、处理速度、语言覆盖和输出表现评估。
-
图像生成 API 成本:5 个模型对比($0.006-$0.039)
使用相同 prompt 通过同一网关实测 5 个图像模型:默认配置下每张 $0.006 到 $0.039,最高约为最低的 6.5 倍;quality 参数还能让单个模型的每张费用相差 36 倍。全部数字来自实际计费。
-
开放权重 LLM 的提示词缓存:为什么效果全看服务商
开放权重LLM的提示词缓存已由推理引擎解决,但请求路由可能破坏缓存命中。本文基于DeepSeek、Qwen和Kimi的实测数据,用五层架构图梳理缓存键、前缀复用、实例分配、路由策略与跨节点调度,比较不同模型和部署方式下的命中率变化及失效原因。
-
Claude Fable 5 缓存:契约不变,账单却是 Opus 4.6 的 2.9 倍
Claude Fable 5 已上线 Synthorai。实测其 prompt 缓存、TTL、tokenization 及相对 Opus 4.6/4.8 的成本:缓存契约不变,tokenizer 更新,账单约为 2.9 倍。
-
上游漂移:默认路由如何推高 LLM 成本
多供应商网关采用默认路由时,相同请求会被分散到多个上游,而各上游分别维护独立缓存,无法共享已缓存的响应。重复请求因此频繁绕过缓存并重新调用供应商接口,缓存命中率大幅下降,上游请求量和账单成本随之增加。
-
你的 LLM Gateway 会谎报缓存吗?5 分钟审计
Gateway 可能报告缓存命中,却仍按完整请求全价计费。一个脚本可在五分钟内核对缓存命中记录与实际账单,并同时审计 DeepSeek 的自动缓存和 Claude 的标记式缓存,识别命中状态与收费结果不一致的问题。
-
Synthorai 上的 Claude Opus 4.8:缓存与 TTL 对比 4.7/4.6
Claude Opus 4.8 已在 Synthorai 上线。本文实测其提示词缓存机制与 TTL 行为,并与 Opus 4.7、4.6 对比,说明哪些缓存配置和行为可直接沿用,以及 tokenizer 变更后需要重新核对的分词结果与相关设置。
-
按使用场景选择最佳大语言模型(2026):聊天、RAG 与智能体成本矩阵
聊天、RAG 还是智能体?在满足性能要求的模型中选择成本最低者,并用15步智能体任务和每日10万次查询的RAG测算推理成本、调用规模与费用差异;再结合决策矩阵,按任务复杂度、响应质量、上下文需求和预算限制比较模型,确定适合不同应用场景的方案。
-
Python 实战:用代码实现 LLM 提示词缓存
通过 Synthorai 的 OpenAI 兼容网关,实测 Claude、GPT-5、Gemini 2.5、DeepSeek-v4 和 Qwen3 的提示词缓存效果,对比各模型的实际成本节省、usage.cost 返回值及首个令牌生成时间(TTFT)。
-
哪家 LLM 提示词缓存最便宜?5 家提供商横向对比(2026)
并排实测 Claude、GPT-5.x、Gemini、DeepSeek 和 Qwen 的五种缓存方案,比较显式缓存与自动缓存、5 分钟与 1 小时 TTL,以及缓存读取成本为原价 0.1x 至 0.5x 时的具体差异。
-
LLM 提示词缓存如何工作:详解 KV Cache 与 TTL
解析LLM提示词缓存的实际机制:从Transformer注意力计算说明K/V状态如何复用,探讨内存占用与重复计算之间的权衡如何影响缓存TTL,并解释其降低推理成本、缩短首个令牌响应时间(TTFT)的原因。
该主题下暂无文章。