🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

리즈닝 강도(reasoning effort)

reasoning_effort는 모델이 답하기 전에 얼마나 생각할지를 제한합니다. 기본값이 무제한 추론인 모델에서는 가장 큰 단일 비용 지렛대이며, 실제 효과는 해당 모델이 어느 업스트림에서 돌아가는지에 전적으로 달려 있습니다.

요청 본문에 다음 중 하나를 보냅니다. 강도가 높을수록 과금되는 추론 토큰이 늘고 응답은 느려집니다:

minimal · low · medium · high

요청 예시

curl https://synthorai.io/v1/chat/completions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Refactor this function."}],
    "reasoning_effort": "low"
  }'

업스트림별 실제 동작

게이트웨이는 여러분에게는 한 가지 프로토콜을, 각 공급사에는 다른 프로토콜을 사용합니다. 이 표는 이 파라미터가 나갈 때 무엇으로 바뀌는지를 — 폐기되는 경우까지 포함해 — 명시합니다.

호출 대상 업스트림 동작 설명
/v1/chat/completions OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) 그대로 전달 보낸 그대로 공급사로 전달됩니다. 게이트웨이는 값을 검증하지 않으며 공급사가 이를 따른다고 보장하지도 않습니다. 흔히 minimal, low, medium, high를 쓰지만 허용 범위는 공급사가 정합니다(OpenAI는 none도, GLM은 max까지 받습니다).
/v1/chat/completions Google Vertex — Gemini 3.x 변환 Gemini의 thinkingLevel로 변환됩니다. none과 minimal은 모두 minimal로, low/medium/high는 그대로 대응됩니다. 요청에 명시적인 google.thinking_config가 있으면 그쪽이 우선합니다.
/v1/chat/completions Google Vertex — Gemini 2.5 폐기 Gemini 2.5는 thinkingBudget만 이해하고 thinkingLevel은 거부하므로, 게이트웨이는 둘 다 보내지 않고 모델의 기본 사고 동작을 유지합니다. 2.5를 제어하려면 google.thinking_configthinking_budget을 사용하세요.
/v1/chat/completions Anthropic (Claude) 폐기 전달되지 않습니다. Anthropic에도 대응 기능(thinking.budget_tokens)이 있고 게이트웨이가 반대 방향은 변환하지만, 이 방향은 구현된 적이 없습니다. Anthropic 네이티브 요청 형식으로 thinking.budget_tokens를 설정하세요.
/v1/messages OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) 변환 확장 사고가 켜져 있고 예산이 0보다 클 때 thinking.budget_tokens에서 구간별로 도출됩니다: 2,048 이하는 low, 8,192 이하는 medium, 그 이상은 high. 예산이 0이거나 없으면 아무것도 보내지 않습니다.
/v1/responses OpenAI-compatible (GPT, GLM, DeepSeek, Qwen, Kimi…) 변환 Responses API의 reasoning.effort 객체에서 읽어 평면 reasoning_effort 필드로 전송합니다.

각 행은 이를 구현한 컨버터에서 그대로 옮겨졌고 Go 테스트로 고정되어 있습니다. 따라서 빌드를 깨뜨리지 않고 이 표가 실제 게이트웨이와 어긋날 수 없습니다.

비용 영향

추론 토큰은 출력 토큰으로 과금됩니다. 기본이 무제한 추론인 모델에서는 강도를 명시하는지 여부가 같은 답변에 대해 몇 센트와 몇 달러의 차이가 됩니다. 기본값을 정하기 전에 직접 프롬프트로 측정하세요.

리즈닝 지원 모델

다음 모델은 리즈닝 모드를 문서화합니다. 해당 업스트림에서 파라미터가 어떻게 처리되는지는 각 모델 페이지를 참고하세요:

ByteDance-Seed-1.8 · Dola-Seed-2.0-lite · Dola-Seed-2.0-mini · Dola-Seed-2.0-pro · claude-fable-5 · claude-haiku-4-5 · claude-opus-4-5 · claude-opus-4-6 · claude-opus-4-7 · claude-opus-4-8 · claude-opus-5 · claude-sonnet-4-5 · claude-sonnet-4-6 · claude-sonnet-5 · deepseek-v4-flash · deepseek-v4-pro · gemini-2.5-flash · gemini-2.5-flash-lite · gemini-2.5-flash-native-audio · gemini-2.5-pro · gemini-3-flash-preview · gemini-3-pro-image-preview · gemini-3.1-flash-image-preview · gemini-3.1-flash-lite-image · gemini-3.1-flash-lite-preview · gemini-3.1-flash-live · gemini-3.1-pro-preview · gemini-3.5-flash · gemini-3.5-flash-lite · gemini-3.6-flash · glm-5 · glm-5-turbo · glm-5.1 · glm-5.2 · gpt-5.2 · gpt-5.2-codex · gpt-5.3-codex · gpt-5.4 · gpt-5.4-mini · gpt-5.4-nano · gpt-5.4-pro · gpt-5.5 · gpt-5.5-pro · gpt-5.6 · gpt-5.6-luna · gpt-5.6-sol · gpt-5.6-terra · kimi-k2.5 · kimi-k2.7-code · kimi-k3 · minimax-m3 · qwen3-max · qwen3-vl-flash · qwen3-vl-plus · qwen3.5-flash · qwen3.5-plus · qwen3.6-flash · qwen3.7-max · qwen3.7-plus

요청 본문 전체 레퍼런스: Chat Completions