리즈닝 강도(reasoning effort)
reasoning_effort는 모델이 답하기 전에 얼마나 생각할지를 제한합니다. 기본값이 무제한 추론인 모델에서는 가장 큰 단일 비용 지렛대이며, 실제 효과는 해당 모델이 어느 업스트림에서 돌아가는지에 전적으로 달려 있습니다.
값
요청 본문에 다음 중 하나를 보냅니다. 강도가 높을수록 과금되는 추론 토큰이 늘고 응답은 느려집니다:
minimal · low · medium · high
요청 예시
curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Refactor this function."}],
"reasoning_effort": "low"
}' 업스트림별 실제 동작
게이트웨이는 여러분에게는 한 가지 프로토콜을, 각 공급사에는 다른 프로토콜을 사용합니다. 이 표는 이 파라미터가 나갈 때 무엇으로 바뀌는지를 — 폐기되는 경우까지 포함해 — 명시합니다.
| 호출 대상 | 업스트림 | 동작 | 설명 |
|---|---|---|---|
/v1/chat/completions | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 그대로 전달 | 보낸 그대로 공급사로 전달됩니다. 게이트웨이는 값을 검증하지 않으며 공급사가 이를 따른다고 보장하지도 않습니다. 흔히 minimal, low, medium, high를 쓰지만 허용 범위는 공급사가 정합니다(OpenAI는 none도, GLM은 max까지 받습니다). |
/v1/chat/completions | Google Vertex — Gemini 3.x | 변환 | Gemini의 thinkingLevel로 변환됩니다. none과 minimal은 모두 minimal로, low/medium/high는 그대로 대응됩니다. 요청에 명시적인 google.thinking_config가 있으면 그쪽이 우선합니다. |
/v1/chat/completions | Google Vertex — Gemini 2.5 | 폐기 | Gemini 2.5는 thinkingBudget만 이해하고 thinkingLevel은 거부하므로, 게이트웨이는 둘 다 보내지 않고 모델의 기본 사고 동작을 유지합니다. 2.5를 제어하려면 google.thinking_config의 thinking_budget을 사용하세요. |
/v1/chat/completions | Anthropic (Claude) | 폐기 | 전달되지 않습니다. Anthropic에도 대응 기능(thinking.budget_tokens)이 있고 게이트웨이가 반대 방향은 변환하지만, 이 방향은 구현된 적이 없습니다. Anthropic 네이티브 요청 형식으로 thinking.budget_tokens를 설정하세요. |
/v1/messages | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 변환 | 확장 사고가 켜져 있고 예산이 0보다 클 때 thinking.budget_tokens에서 구간별로 도출됩니다: 2,048 이하는 low, 8,192 이하는 medium, 그 이상은 high. 예산이 0이거나 없으면 아무것도 보내지 않습니다. |
/v1/responses | OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) | 변환 | Responses API의 reasoning.effort 객체에서 읽어 평면 reasoning_effort 필드로 전송합니다. |
각 행은 이를 구현한 컨버터에서 그대로 옮겨졌고 Go 테스트로 고정되어 있습니다. 따라서 빌드를 깨뜨리지 않고 이 표가 실제 게이트웨이와 어긋날 수 없습니다.
비용 영향
추론 토큰은 출력 토큰으로 과금됩니다. 기본이 무제한 추론인 모델에서는 강도를 명시하는지 여부가 같은 답변에 대해 몇 센트와 몇 달러의 차이가 됩니다. 기본값을 정하기 전에 직접 프롬프트로 측정하세요.
리즈닝 지원 모델
다음 모델은 리즈닝 모드를 문서화합니다. 해당 업스트림에서 파라미터가 어떻게 처리되는지는 각 모델 페이지를 참고하세요:
ByteDance-Seed-1.8 · Dola-Seed-2.0-lite · Dola-Seed-2.0-mini · Dola-Seed-2.0-pro · claude-fable-5 · claude-haiku-4-5 · claude-opus-4-5 · claude-opus-4-6 · claude-opus-4-7 · claude-opus-4-8 · claude-opus-5 · claude-sonnet-4-5 · claude-sonnet-4-6 · claude-sonnet-5 · deepseek-v4-flash · deepseek-v4-pro · gemini-2.5-flash · gemini-2.5-flash-lite · gemini-2.5-flash-native-audio · gemini-2.5-pro · gemini-3-flash-preview · gemini-3-pro-image-preview · gemini-3.1-flash-image-preview · gemini-3.1-flash-lite-image · gemini-3.1-flash-lite-preview · gemini-3.1-flash-live · gemini-3.1-pro-preview · gemini-3.5-flash · gemini-3.5-flash-lite · gemini-3.6-flash · glm-5 · glm-5-turbo · glm-5.1 · glm-5.2 · gpt-5.2 · gpt-5.2-codex · gpt-5.3-codex · gpt-5.4 · gpt-5.4-mini · gpt-5.4-nano · gpt-5.4-pro · gpt-5.5 · gpt-5.5-pro · gpt-5.6 · gpt-5.6-luna · gpt-5.6-sol · gpt-5.6-terra · kimi-k2.5 · kimi-k2.7-code · kimi-k3 · minimax-m3 · qwen3-max · qwen3-vl-flash · qwen3-vl-plus · qwen3.5-flash · qwen3.5-plus · qwen3.6-flash · qwen3.7-max · qwen3.7-plus
요청 본문 전체 레퍼런스: Chat Completions