신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Qwen3 Max

2025-09-23 출시

chat코드리즈닝도구 호출프롬프트 캐싱

Qwen3-Max는 공식 포스트 “Qwen3-Max: Just Scale”로 소개된 Qwen 팀의 조 단위 파라미터급 플래그십으로, 256K 토큰 컨텍스트를 갖추고 있습니다.

입력
텍스트 $1.2/M
출력
텍스트 $6/M
캐시 읽기
$0.359/M
컨텍스트
256K
GPT-4o 대비
약 76% 저렴

벤치마크

Qwen3 Max
LiveCodeBench Instruct, v6 (25.02-25.05) Alibaba (Qwen) 공표
다른 모델의 공개 성적 없음
69%
SWE-bench Verified Instruct Alibaba (Qwen) 공표
다른 모델의 공개 성적 없음
69.6%
AIME 2025 Instruct Alibaba (Qwen) 공표
다른 모델의 공개 성적 없음
81.6%
SuperGPQA Instruct Alibaba (Qwen) 공표
다른 모델의 공개 성적 없음
65.1%
τ²-Bench Instruct, weighted Alibaba (Qwen) 공표
다른 모델의 공개 성적 없음
74.8%

벤더 공개: Alibaba (Qwen)

가격의 위치

동종 60개 모델 중 가격 위치

입력$1.2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
출력$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
캐시 읽기$0.359/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

컨텍스트 윈도우(공급사 사양) 256,000
최대 출력(벤더 스펙) 65,536

프롬프트 캐싱

캐싱 방식 자동 + 명시적
최소 프리픽스 1,024
수명 명시적 모드: 5분, 적중 시 리셋
쓰기 비용 1.25x

사고

공급사 파라미터 enable_thinking + thinking_budget
허용 값 enable_thinking true · false; thinking_budget in tokens
기본값 off; enable_thinking의 기본값은 false이고, thinking_budget의 기본값은 모델의 최대 체인 오브 소트 길이 요청에서 지정하지 않을 때 적용
비활성화 가능 지원
사고 동작 트레이스는 reasoning_content로 반환됩니다. 메시지 기록의 reasoning_content는 기본적으로 무시되며, qwen3-max는 preserve_thinking을 받아들이는 모델에 포함되지 않습니다.
파라미터 reasoning_effort
minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다

모델

모달리티 텍스트 → 텍스트
파라미터 전체 1T+ MoE
  • 1조 파라미터를 넘긴 최초의 Qwen 플래그십(비공개 가중치), 텍스트 전용
  • 에이전틱 코딩과 도구 호출을 공식 포지셔닝
  • 하이브리드 사고, 기본 비활성

출처: Alibaba 공식 문서 ↗

30초 만에 Qwen3 Max 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Qwen3 Max 소개

  • Alibaba는 지식, 추론, 코딩, 지시 이행, 에이전트 과제, 다국어 이해에 대한 자체 평가 전반에서 최고 수준의 결과를 보고하며, 릴리스 노트는 에이전틱 코딩과 도구 호출의 업그레이드를 특히 짚습니다.
  • 이 라인은 Instruct 형태와 함께, 더 어려운 추론 문제를 위해 코드 인터프리터와 적응형 도구 사용을 통합한 Thinking 변형으로 출시됩니다.
  • Qwen3 시리즈 최대 모델로서 까다로운 프로덕션 워크로드를 겨냥합니다.
  • 텍스트를 받아 텍스트를 반환하는 모델이며(비전은 Qwen3-VL 형제 모델의 몫입니다) 최대 65,536 출력 토큰을 지원하고, Model Studio는 도구 호출, 구조화 출력, 배치 추론, 그리고 명시적·암묵적 컨텍스트 캐싱을 명시합니다.
  • 이 카탈로그에 있는 이후의 모든 Qwen 세대와 구별되는 동작상의 세부가 하나 있습니다.
  • 이 모델은 하이브리드 사고 모델로, 추론을 enable_thinking 파라미터로 전환하며 기본값이 꺼짐인 반면 Qwen3.5 이후 세대는 사고가 이미 켜진 상태로 나옵니다.
  • 추론을 켜면 thinking_budget 파라미터가 소비량에 상한을 걸고, 트레이스는 reasoning_content로 따로 반환되어 출력으로 과금됩니다.
  • 호스팅되는 이 플래그십의 가중치는 공개되지 않으며, Alibaba는 이제 이 모델을 레거시 모델로 분류하고 신규 프로젝트에는 Qwen3.5 및 Qwen3.6 시리즈를 안내합니다.
  • Synthorai는 OpenAI 호환 챗 엔드포인트로 이 모델을 제공합니다.

자주 묻는 질문

Qwen3 Max API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $1.2/M 기준으로, 이 크레딧만으로도 Qwen3 Max에 약 8K 토큰 규모의 요청을 대략 104회 보낼 수 있습니다.

Qwen3 Max는 무엇에 가장 강한가요?

256K 컨텍스트의 조 단위 파라미터급 플래그십, 코드 인터프리터를 통합한 Thinking 변형, 어려운 추론을 위한 적응형 도구 사용. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Qwen3 Max의 가격은 얼마인가요?

Synthorai에서 Qwen3 Max는 입력 토큰 100만 개당 $1.2, 출력 토큰 100만 개당 $6입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.359/M로 과금됩니다.

Qwen3 Max는 프롬프트 캐싱을 지원하나요?

네, 자동 캐싱이 기본으로 켜져 있고, 확정적 절감을 위한 명시적 모드도 있습니다. 캐시된 입력 토큰은 $0.359/M로 과금됩니다(미캐시 시 $1.2/M); 캐시되려면 프롬프트에 1,024 토큰 이상의 안정적인 프리픽스가 필요합니다 (TTL 명시적 모드: 5분, 적중 시 리셋). 프롬프트 캐싱 가이드 →

Qwen3 Max는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="qwen3-max"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →