推理强度(reasoning effort)
reasoning_effort 限制模型作答前的思考量。对默认无界推理的模型来说,它是最大的单一成本杠杆——而它的实际效果,完全取决于你的模型跑在哪个上游。
取值
在请求体里传下列之一。强度越高,计费的推理 token 越多、响应越慢:
minimal · low · medium · high
示例请求
curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Refactor this function."}],
"reasoning_effort": "low"
}' 各上游的实际行为
网关对你说一种协议,对每个厂商说另一种。下表写明这个参数在出站时变成了什么——包括被丢弃的情况。
| 你调用的 | 上游 | 行为 | 说明 |
|---|---|---|---|
/v1/chat/completions | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 透传 | 按原样转发给厂商——网关既不校验取值,也不保证厂商会遵守。常见取值是 minimal、low、medium、high,但接受哪些由厂商决定:OpenAI 还接受 none,GLM 最高到 max。 |
/v1/chat/completions | Google Vertex — Gemini 3.x | 映射 | 转换为 Gemini 的 thinkingLevel:none 和 minimal 都映射为 minimal,low/medium/high 一一对应。请求里显式的 google.thinking_config 优先于此映射。 |
/v1/chat/completions | Google Vertex — Gemini 2.5 | 丢弃 | Gemini 2.5 只认 thinkingBudget,收到 thinkingLevel 会直接拒绝,所以网关两者都不发,让模型保持默认思考行为。要控制 2.5,请用 google.thinking_config 里的 thinking_budget。 |
/v1/chat/completions | Anthropic (Claude) | 丢弃 | 不转发。Anthropic 其实有对应语义(thinking.budget_tokens),网关也实现了反方向的映射,但这个方向从未实现——请改用 Anthropic 原生请求形态设置 thinking.budget_tokens。 |
/v1/messages | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 映射 | 在扩展思考已启用且预算大于 0 时,由 thinking.budget_tokens 分桶得出:≤2,048 为 low,≤8,192 为 medium,更高为 high。预算为 0 或缺失时不发送该字段。 |
/v1/responses | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 映射 | 从 Responses API 的 reasoning.effort 对象中读出,以扁平的 reasoning_effort 字段发送。 |
每一行都转录自实现它的转换器,并由 Go 测试钉住;所以这张表不可能在构建不失败的情况下与线上网关脱节。
成本影响
推理 token 按输出 token 计费。在默认无界推理的模型上,显式设定强度往往就是同一个答案花几分钱还是几美元的区别——选默认值前,先用你自己的 prompt 实测。
支持推理的模型
以下模型文档了推理模式。该参数在其上游如何处理,见各自的模型页:
ByteDance-Seed-1.8 · Dola-Seed-2.0-lite · Dola-Seed-2.0-mini · Dola-Seed-2.0-pro · claude-fable-5 · claude-haiku-4-5 · claude-opus-4-5 · claude-opus-4-6 · claude-opus-4-7 · claude-opus-4-8 · claude-opus-5 · claude-sonnet-4-5 · claude-sonnet-4-6 · claude-sonnet-5 · deepseek-v4-flash · deepseek-v4-pro · gemini-2.5-flash · gemini-2.5-flash-lite · gemini-2.5-flash-native-audio · gemini-2.5-pro · gemini-3-flash-preview · gemini-3-pro-image-preview · gemini-3.1-flash-image-preview · gemini-3.1-flash-lite-image · gemini-3.1-flash-lite-preview · gemini-3.1-flash-live · gemini-3.1-pro-preview · gemini-3.5-flash · gemini-3.5-flash-lite · gemini-3.6-flash · glm-5 · glm-5-turbo · glm-5.1 · glm-5.2 · gpt-5.2 · gpt-5.2-codex · gpt-5.3-codex · gpt-5.4 · gpt-5.4-mini · gpt-5.4-nano · gpt-5.4-pro · gpt-5.5 · gpt-5.5-pro · gpt-5.6 · gpt-5.6-luna · gpt-5.6-sol · gpt-5.6-terra · kimi-k2.5 · kimi-k2.7-code · kimi-k3 · minimax-m3 · qwen3-max · qwen3-vl-flash · qwen3-vl-plus · qwen3.5-flash · qwen3.5-plus · qwen3.6-flash · qwen3.7-max · qwen3.7-plus
完整请求体参考: Chat Completions