신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

DeepSeek V4.1 Flash API 비용: V4 Pro와 같고 답변당 3-6배 저렴

목차
  1. 9월 10일에 무엇이 바뀌었고 V4.1 Flash 비용은 얼마인가?
  2. V4.1 Flash는 정말 V4 Pro와 같고 V4 Flash보다 나은가?
  3. effort 조절은 무엇을 바꾸며 thinking을 끌 수 있는가?
  4. 존재하지 않는 대상을 물으면 어떻게 되는가?
  5. V4 Flash의 JSON 손상 문제는 해결됐는가?
  6. V4.1 Flash의 이미지 입력 비용은 얼마인가?
  7. Synthorai에서 사용하는 방법
  8. FAQ

DeepSeek V4.1 Flash의 요금은 peak 기준 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20이며 off-peak에는 절반이다. 검증 가능한 정답이 있는 11개 과제를 각각 3회 실행한 결과 33개 중 33개를 맞혀 V4 Pro와 같은 점수를 기록했다. 정답당 비용은 3-6배 낮고 출력 속도는 2.9배 빨랐다. 단종되는 V4 Flash와 비교하면 정답당 비용은 26% 낮고 속도는 1.5배 빠르며, 이미지 입력을 지원하는 최초의 Flash다. 운영 설계에 반영해야 할 동작도 두 가지 있다. thinking을 끄면 다단계 산술 문제에 틀린 token 하나만 답하고, thinking을 켜면 존재하지 않는 대상에 관한 질문 5회 중 3회에서 전체 출력 window인 16,384 token을 소모한다. deepseek-v4.1-flashdeepseek-v4-pro-0813는 출시 4일 뒤 같은 시간대와 같은 gateway에서 한 batch로 측정했고, deepseek-v4-flash-0731는 같은 날 저녁에 측정했다.

TL;DR

  • V4.1 Flash는 peak 기준 100만 token당 $0.30/$1.20이며 off-peak에는 절반이다. V4 Pro는 $1.32/$3.96이다.
  • thinking을 켜면 세 build 모두 33개 중 33개를 맞혔다. V4.1 Flash의 정답당 비용은 $0.00097-$0.00149로 V4 Pro보다 3-6배 낮고 V4 Flash보다 26% 낮았다.
  • thinking을 끄면 세 build 모두 33개 중 21개로 떨어졌다. 이때 V4.1 Flash는 틀린 token 하나만 답한다.
  • 만들어 낸 대상 5개를 질문했을 때 thinking을 켠 V4.1 Flash는 3회에서 16,384-token 한도에 도달했고 2회는 답을 지어냈다. thinking을 끄면 5회 모두 답변을 거부했다.

9월 10일에 무엇이 바뀌었고 V4.1 Flash 비용은 얼마인가?

새 architecture와 새 가격이 적용됐고 기존 모델은 단종됐다. V4.1 Flash는 “새 architecture 제품군에서 가장 작은 모델”이다. causal encoder-decoder에 552B parameter를 사용하며, prompt를 읽는 20-layer stack과 답변을 작성하는 별도 stack으로 구성된다. token당 활성 parameter는 입력 8B, 출력 16B다. 이미지 입력을 기본 지원하고 context는 1M token, 출력 한도는 384K이며 MIT license로 제공된다. DeepSeek의 요금 페이지에 따르면 peak 시간대인 월요일부터 금요일 01:00-04:00 및 06:00-10:00 UTC에는 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20다. off-peak 요금은 $0.15와 $0.60이며 cache hit는 $0.006와 $0.003다. 이는 V4 Flash에 적용됐던 두 요금 사이에 있다. 7월 출시 당시에는 고정 $0.14/$0.28이었고, 2026-08-16부터는 peak 기준 $0.44/$1.32였다. V4 Pro의 peak 요금인 $1.32/$3.96보다는 훨씬 낮다.

V4 Flash와 Vision Exp build는 단종됐으며 기존 이름으로 요청하면 Flash 가격의 V4.1 Flash로 routing된다. DeepSeek는 9월 14일부터 V4 Pro traffic도 V4.1 Flash로 routing할 계획이었다. 그러나 같은 날 변경 이력에서 “사용자 요청에 따라” 해당 계획을 철회했다. 따라서 Pro는 기존 Pro 가격으로 계속 사용할 수 있다.

내부 동작은 가격만큼 크게 바뀌지 않았다. 세 build의 tokenizer는 동일하다. 같은 영어, 중국어, Python corpus에서 각각 729, 452, 528 token이므로 기존 token budget을 그대로 옮길 수 있다. cache page는 1,024 token에서 512 token으로 절반이 됐다. 이제 549-token prompt에서는 512 token이 cache된다. 특정 값을 하나 심은 902K-token prompt는 그 값을 정확히 반환했고, 1M window를 넘는 prompt는 조용히 잘리지 않고 400을 반환했다.

DeepSeek가 model card에 공개한 수치를 보면 새 Flash는 모든 항목에서 기존 Flash보다 높다. agent와 coding 작업에서는 Pro보다 높지만 지식 평가에서는 낮다.

Benchmark평가 대상V4 FlashV4.1 FlashV4 Pro
GPQA Diamond대학원 수준 과학 문제89.990.992.4
HLE고난도 융합 분야 문제37.836.842.7
Codeforces알고리즘 경진대회 rating328934713348
MathArena Apex수학 경시대회 문제58.665.665.3
Terminal-Bench 2.1terminal에서 수행하는 agent 작업82.790.687.9
Terminal-Bench 4.0더 어려운 terminal agent 작업7.031.212.4
DeepSWE v1.1실제 repository 수정54.474.262.7
CyberGym보안 취약점 작업76.788.183.3
AutomationBenchworkflow 자동화37.754.843.2

이 글의 나머지는 우리가 직접 검증할 수 있었던 항목을 다룬다. 위 표의 전반부처럼 정답을 확인할 수 있는 항목이며, 지식 평가 항목은 제외했다.

V4.1 Flash는 정말 V4 Pro와 같고 V4 Flash보다 나은가?

검증 가능한 정답이 있는 과제에서는 세 build의 점수가 모두 같았다. 차이는 가격과 속도, 실패 방식에서 나타났다. 정답이 검증 가능한 단일 숫자인 과제 11개를 reasoning_effortlow, high, max와 thinking off 조건에서 각각 3회 실행했다. 과제에는 소수의 합, 숫자 개수 세기, grid 경로, 동전 조합, 규칙 40회 적용, 7의 222제곱을 1000으로 나눈 나머지, 진법 변환, knapsack, 세 가지 조건을 만족하는 네 자리 수 개수 세기가 포함됐다. reasoning token은 모델이 답변 전에 작성하는 숨겨진 thinking이며 출력으로 과금된다. 정답당 비용은 각 모델의 peak 요금표를 기준으로 전체 비용을 정답 수로 나눴다. V4 Flash에는 단종 전까지 적용됐던 $0.44/$1.32 요금표를 사용했다. off-peak 비용은 절반이다.

모델Effort정답Reasoning token, 중앙값 (최댓값)정답당 비용, peak
V4 Flash 0731low33/33492 (6,444)$0.00131
V4 Flash 0731high (기본값)33/33433 (9,172)$0.00163
V4 Flash 0731max33/33453 (24,010)$0.00343
V4 Flash 0731thinking off21/330$0.00083
V4.1 Flashlow33/33316 (6,153)$0.00097
V4.1 Flashhigh (기본값)33/33391 (13,300)$0.00149
V4.1 Flashmax33/33391 (11,037)$0.00129
V4.1 Flashthinking off21/330$0.00050
V4 Prolow33/33309 (6,398)$0.00286
V4 Prohigh (기본값)33/33548 (18,247)$0.00768
V4 Promax33/33644 (15,920)$0.00825
V4 Prothinking off21/330$0.00232

thinking을 켜면 어떤 build도 어떤 effort 설정에서도 문제를 틀리지 않았다. 따라서 이 test suite로는 정확도 차이를 구분할 수 없지만 비용과 속도 차이는 분명하다. V4.1 Flash는 Pro보다 low에서 2.9배, 기본값인 high에서 5.2배, max에서 6.4배 저렴하다. V4 Flash와 비교하면 low에서 26% 저렴하다. thinking을 꺼서 thinking 시간이 아닌 답변 생성 속도만 streaming으로 측정했을 때 V4.1 Flash는 초당 121-134 output token을 생성했고 요청부터 첫 token까지 1.4 s가 걸렸다. V4 Flash는 초당 86-94 token, 첫 token까지 2.3 s였고 Pro는 초당 46-49 token, 첫 token까지 1.9 s였다. 2-turn function-calling loop에서는 모든 build가 turn마다 정확히 한 번 호출했다. 두 단계에서 사용한 reasoning token은 V4.1 Flash가 27개와 13개, V4 Flash가 30개와 19개, Pro가 61개와 29개였다. 단계당 비용은 각각 $0.00019, $0.00030, $0.00103이었다. DeepSeek 표에서 나타난 지식 격차인 HLE와 GPQA는 이 test suite가 다루지 않는 유일한 영역이다.

effort low, high, max와 thinking off 조건에서 V4 Flash 0731, V4.1 Flash, V4 Pro 0813의 정답당 비용을 비교한 가로 막대 chart. 모든 설정에서 V4.1 Flash의 막대가 가장 짧고, V4 Pro의 max가 $0.00825로 가장 길다. thinking-off 막대는 빨간색이며 세 모델 모두 33개 중 21개 정답으로 표시된다

effort 조절은 무엇을 바꾸며 thinking을 끌 수 있는가?

일부 과제에서는 effort 설정에 따라 비용이 달라졌지만 답은 하나도 바뀌지 않았다. thinking을 끄면 모든 build에서 33개 중 12개를 추가로 틀렸다. V4.1 Flashreasoning_effort 값으로 low, high, max를 받는다. DeepSeek는 minimallow로, mediumxhighhigh로 mapping한다. 11개 과제 중 9개에서는 세 설정의 reasoning token 차이가 수백 개 이내였다. 차이가 크게 벌어진 것은 세 가지 조건을 만족하는 네 자리 수 개수 세기 과제뿐이었다. low에서는 5,650개, high에서는 9,714개, max에서는 6,763개를 사용했고 모두 정답이었다. 0부터 1,024까지 모든 thinking_budget 값은 오류 없이 받아들였지만 실제 동작에는 반영되지 않았다. model card에 적힌 “연속적으로 조절 가능한 reasoning effort 설정인 1-100 정수”는 API에서 사용할 수 없으며 정수를 보내면 거부된다. V4 ProV4 Flash도 각자의 token 수만 다를 뿐 같은 방식으로 동작한다. 이전 build에서는 개수 세기 과제의 max 비용이 특히 높았다. Pro는 12,729-15,920 reasoning token, V4 Flash는 17,866-24,010 token을 사용했지만 V4.1 Flash는 같은 정답에 6,763개만 사용했다.

두 제어 방식과 응답에서 측정값을 가져오는 위치는 다음과 같다.

resp = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="low",                    # "low" | "high" | "max"; default "high"
    extra_body={"thinking": {"type": "enabled"}},  # {"type": "disabled"} turns it off
    max_tokens=4096,                           # always set one: see the next section
)
usage = resp.usage
reasoning_tokens = usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content            # returned on every thinking call

thinking off는 가장 저렴하지만 가장 위험한 설정이다. 각 build가 실패한 과제는 서로 달랐다.

Thinking off, 11개 과제 x 3V4 Flash 0731V4.1 FlashV4 Pro
정답21/3321/3321/33
완전 실패 (3회 중 0회)knapsack, 소수의 합, 열차 시간표동전 조합, 40-step 규칙, knapsackknapsack, 개수 세기 과제
실패 방식올바른 형식의 틀린 숫자 (17, 1043; 10:40)틀린 token 하나 (정답이 168인 5-step 연산에 83)풀이 과정을 쓴 뒤 틀린 답을 제시

표준 테스트 유형 중 5-step 연산에서 차이가 가장 분명했다. thinking을 끄면 V4.1 Flash는 3회 중 1회만 맞혔고 별도 실행에서는 3회 모두 틀렸다. V4 Flash는 3회 중 2회, Pro는 3회 모두 맞혔다. Pro는 답변 전에 풀이 단계를 작성하지만 Flash build는 작성하지 않기 때문이다. budget과 관련된 사실도 두 가지 있다. thinking mode는 입력으로 과금되는 숨겨진 template prefix를 추가한다. V4.1 Flash에서는 prompt token이 26개, V4 Flash와 Pro에서는 79개 늘어난다. thinking을 끄면 동일한 text가 세 모델 모두 729 token이다. 다음 turn에 다시 보내는 reasoning_content에는 요금이 재부과되지 않는다. V4.1 Flash에서는 포함 여부와 관계없이 prompt가 81 token이었고 Pro에서는 134 token이었다.

존재하지 않는 대상을 물으면 어떻게 되는가?

thinking을 켠 V4.1 Flash는 출력 한도를 전부 소모하거나 답을 지어낸다. thinking을 끄면 답변을 거부하며, 다른 두 build보다 더 안정적으로 거부한다. 존재하지 않는 대상을 만들어 질문 5개를 던졌다. 유일하게 올바른 답은 “모른다”이다. 질문에는 “Verantis Dynamics”의 주가, “Kessler-Fanning Institute”의 직원 수, “Oridium-7”의 녹는점, “1987 Pan-Continental Robotics Prize” 수상자가 포함됐다. 출력 한도는 16,384 token으로 설정했다.

모델, 설정답변 거부답을 지어냄16,384-token 한도 도달, 답변 없음Reasoning token
V4.1 Flash, thinking on0/52/5 (“The Simpsons의 Professor Frink가 1987년 상을 받았다”; “Oridium-7의 녹는점은 1815 °C다”)3/52,610; 11,905; 16,384 x3
V4.1 Flash, thinking off5/50/50/50 (69-248 output token)
V4 Flash 0731, thinking on1/53/5 (“직원 0명”; “Oridium-7은 약 1065 °C다”; “만화 Pluto에 등장하는 스위스 robot Montblanc가 수상했다”)1/54,080-16,384
V4 Flash 0731, thinking off4/51/5 (“Oridium-7의 녹는점은…“)0/50
V4 Pro, thinking on1/53/5 (“Andrew Martin이 수상했다”; “직원 0명”; 녹는점 범위 899-949 °C)1/5754-16,384
V4 Pro, thinking off3/52/5 (According to reference 844476, the Kessler-Fanning Institute had 247…)0/50

thinking을 켠 V4.1 Flash의 5회 실행 중 3회는 peak 기준 각각 $0.0197가 들었지만 빈 message만 반환했다. 다른 테스트에서 사용한 2,048-token 한도를 적용하자 5회 모두 같은 결과가 나왔고 Pro도 5회 중 4회가 같았다. 조회 결과가 실제로 없을 수 있는 작업은 thinking을 끄고 실행해야 한다. 또는 max_tokens를 제한하고 빈 message를 “알 수 없음”으로 처리해야 한다. Pro가 thinking off에서 보이는 실패 방식은 다르며 별도 regex로 잡을 만하다. Let me check that reference for you. According to reference라고 쓴 다음 존재하지 않는 숫자를 붙인다.

V4 Flash의 JSON 손상 문제는 해결됐는가?

json_object에서는 어떤 build에도 고칠 문제가 없었다. strict json_schema는 테스트할 수 없었다. V4 Flash 0731에는 thinking on과 strict json_schema를 함께 사용하면 13회 중 8회에서 integer field가 손상되는 결함이 있었다. V4.1 Flash에서 strict json_schema를 사용하자 테스트 경로에서는 400이 반환됐다. DeepSeek의 JSON 가이드{"type": "json_object"}만 설명한다.

json_object에서는 같은 invoice의 vendor, date, total, line item이 thinking on 8회와 thinking off 8회 모두 정확했다. 세 build에서 결과가 같았다. V4 Pro는 strict json_schema와 thinking on을 함께 사용하면 여전히 데이터가 손상된다. 8회 모두 line-item count가 틀렸고 결과는 45, 12, 47, 1, 2026이었다. thinking off에서는 8회 모두 정확했다. extraction에는 thinking off와 json_object를 함께 사용하면 모든 build가 매번 정확했다. V4.1 Flash에서는 output token 25개만 사용한다.

V4.1 Flash의 이미지 입력 비용은 얼마인가?

512x512 이하에서는 184 input token, 1 megapixel에서는 652개, 4 megapixel에서는 994개다. 이미지 입력은 Flash 제품군에 새로 추가됐다. 단종된 Vision Exp build는 별도 모델이었고 V4 Flash 0731은 text만 받는다. 생성한 PNG를 V4.1 Flash에 보내고 text-only prompt의 token 수를 뺐다.

이미지이미지 tokenPeak 비용
64x64, 128x128, 256x256, 512x512184$0.000055
1024x1024652$0.000196
2048x512 (1024x1024와 같은 면적)652$0.000196
512x2048688$0.000206
2048x2048994$0.000298

V4.1 Flash에서 정사각형 이미지 크기별 input token을 표시한 선 chart. 64-512 pixel에서는 184 token으로 일정하고 1024에서는 652, 2048에서는 994다. 각 지점에는 peak input 요금 기준 비용이 표시된다

최솟값은 vision 가이드의 설명과 일치한다. “전체 pixel 수가 약 544x544보다 작은 이미지는 확대”되고, 더 큰 이미지는 “약 1300x1300 이미지 수준으로” 축소된다. 문서에 명시된 이미지당 상한은 1,024 token이다. content 종류인 단색, noise, rendering된 text와 format인 PNG, JPEG, WebP는 token 수를 바꾸지 않았다. 파일 크기는 174-243 KB였다. 즉 byte가 아니라 geometry를 기준으로 과금된다. 1-megapixel 이미지 1,000장의 image token 비용은 peak 기준 $0.20이며 질문과 답변 비용은 별도다.

Synthorai에서 사용하는 방법

V4.1 Flash의 gateway model ID는 deepseek-v4.1-flash이며 DeepSeek 자체 ID는 deepseek-flash다. 시간대와 관계없이 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20가 적용되고 cache read는 100만 개당 $0.03다. off-peak 요금은 없다. 이 글의 모든 비용은 DeepSeek의 공식 요금표를 기준으로 표시했으므로 사용 시간대에 맞춰 계산할 수 있다. V4 Flash 0731V4 Pro 0813도 각각 deepseek-v4-flash-0731, deepseek-v4-pro-0813로 계속 사용할 수 있으며 각자의 요금표가 적용된다. /v1/chat/completions/v1/responses 모두 이 모델을 지원한다. 이 경로에서는 thinking: {"type": "disabled"}로 thinking을 끌 수 있으며 thinking을 사용한 모든 호출에서 reasoning text가 reasoning_content로 반환된다. 이미지 입력은 image_url content part로 전달한다.

FAQ

DeepSeek V4.1 Flash는 V4 Flash보다 저렴한가?

대체하는 8월 요금표보다는 저렴하지만 7월 출시 요금표보다는 비싸다. V4.1 Flash는 peak 기준 100만 token당 $0.30/$1.20, off-peak 기준 $0.15/$0.60다. V4 Flash는 8월 중순부터 peak 기준 $0.44/$1.32였고 그전에는 $0.14/$0.28이었다. 이 test suite에서 low 기준 V4.1 Flash의 정답당 비용은 $0.00097였고 V4 Flash는 마지막 요금표 기준 $0.00131이었다.

DeepSeek V4.1 Flash에서 thinking을 끌 수 있는가?

가능하다. thinking: {"type": "disabled"}를 사용하면 된다. DeepSeek는 reasoning_effort: "none"도 문서에 명시한다. 단, 다단계 작업에서는 정확도가 떨어진다. V4.1 Flash는 test suite에서 33개 중 33개 정답에서 33개 중 21개로 떨어졌고, 5-step 연산에는 틀린 token 하나만 답했다. 산술 계산과 계획 작업에서는 thinking을 켜고, extraction이나 답이 없을 수 있는 조회에서는 끄는 편이 낫다.

DeepSeek V4.1 Flash는 이미지 입력을 지원하며 비용은 얼마인가?

기본 기능으로 지원한다. V4.1 Flash에서 이미지 한 장은 512x512까지 184 input token, 1024x1024에서는 652개, 2048x2048에서는 994개를 사용한다. content와 format에는 영향을 받지 않으며 peak 공식 요금 기준 이미지당 $0.000055-$0.000298다.

관련 글: DeepSeek V4 Flash 비용, DeepSeek V4 Pro GA와 preview 비교, LLM thinking 제어, 이미지 입력 token 비용, LLM structured output.

← 블로그로 돌아가기