DeepSeek V4.1 Flash API 비용: V4 Pro와 같고 답변당 3-6배 저렴
목차
DeepSeek V4.1 Flash의 요금은 peak 기준 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20이며 off-peak에는 절반이다. 검증 가능한 정답이 있는 11개 과제를 각각 3회 실행한 결과 33개 중 33개를 맞혀 V4 Pro와 같은 점수를 기록했다. 정답당 비용은 3-6배 낮고 출력 속도는 2.9배 빨랐다. 단종되는 V4 Flash와 비교하면 정답당 비용은 26% 낮고 속도는 1.5배 빠르며, 이미지 입력을 지원하는 최초의 Flash다. 운영 설계에 반영해야 할 동작도 두 가지 있다. thinking을 끄면 다단계 산술 문제에 틀린 token 하나만 답하고, thinking을 켜면 존재하지 않는 대상에 관한 질문 5회 중 3회에서 전체 출력 window인 16,384 token을 소모한다. deepseek-v4.1-flash와 deepseek-v4-pro-0813는 출시 4일 뒤 같은 시간대와 같은 gateway에서 한 batch로 측정했고, deepseek-v4-flash-0731는 같은 날 저녁에 측정했다.
TL;DR
- V4.1 Flash는 peak 기준 100만 token당 $0.30/$1.20이며 off-peak에는 절반이다. V4 Pro는 $1.32/$3.96이다.
- thinking을 켜면 세 build 모두 33개 중 33개를 맞혔다. V4.1 Flash의 정답당 비용은 $0.00097-$0.00149로 V4 Pro보다 3-6배 낮고 V4 Flash보다 26% 낮았다.
- thinking을 끄면 세 build 모두 33개 중 21개로 떨어졌다. 이때 V4.1 Flash는 틀린 token 하나만 답한다.
- 만들어 낸 대상 5개를 질문했을 때 thinking을 켠 V4.1 Flash는 3회에서 16,384-token 한도에 도달했고 2회는 답을 지어냈다. thinking을 끄면 5회 모두 답변을 거부했다.
9월 10일에 무엇이 바뀌었고 V4.1 Flash 비용은 얼마인가?
새 architecture와 새 가격이 적용됐고 기존 모델은 단종됐다. V4.1 Flash는 “새 architecture 제품군에서 가장 작은 모델”이다. causal encoder-decoder에 552B parameter를 사용하며, prompt를 읽는 20-layer stack과 답변을 작성하는 별도 stack으로 구성된다. token당 활성 parameter는 입력 8B, 출력 16B다. 이미지 입력을 기본 지원하고 context는 1M token, 출력 한도는 384K이며 MIT license로 제공된다. DeepSeek의 요금 페이지에 따르면 peak 시간대인 월요일부터 금요일 01:00-04:00 및 06:00-10:00 UTC에는 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20다. off-peak 요금은 $0.15와 $0.60이며 cache hit는 $0.006와 $0.003다. 이는 V4 Flash에 적용됐던 두 요금 사이에 있다. 7월 출시 당시에는 고정 $0.14/$0.28이었고, 2026-08-16부터는 peak 기준 $0.44/$1.32였다. V4 Pro의 peak 요금인 $1.32/$3.96보다는 훨씬 낮다.
V4 Flash와 Vision Exp build는 단종됐으며 기존 이름으로 요청하면 Flash 가격의 V4.1 Flash로 routing된다. DeepSeek는 9월 14일부터 V4 Pro traffic도 V4.1 Flash로 routing할 계획이었다. 그러나 같은 날 변경 이력에서 “사용자 요청에 따라” 해당 계획을 철회했다. 따라서 Pro는 기존 Pro 가격으로 계속 사용할 수 있다.
내부 동작은 가격만큼 크게 바뀌지 않았다. 세 build의 tokenizer는 동일하다. 같은 영어, 중국어, Python corpus에서 각각 729, 452, 528 token이므로 기존 token budget을 그대로 옮길 수 있다. cache page는 1,024 token에서 512 token으로 절반이 됐다. 이제 549-token prompt에서는 512 token이 cache된다. 특정 값을 하나 심은 902K-token prompt는 그 값을 정확히 반환했고, 1M window를 넘는 prompt는 조용히 잘리지 않고 400을 반환했다.
DeepSeek가 model card에 공개한 수치를 보면 새 Flash는 모든 항목에서 기존 Flash보다 높다. agent와 coding 작업에서는 Pro보다 높지만 지식 평가에서는 낮다.
| Benchmark | 평가 대상 | V4 Flash | V4.1 Flash | V4 Pro |
|---|---|---|---|---|
| GPQA Diamond | 대학원 수준 과학 문제 | 89.9 | 90.9 | 92.4 |
| HLE | 고난도 융합 분야 문제 | 37.8 | 36.8 | 42.7 |
| Codeforces | 알고리즘 경진대회 rating | 3289 | 3471 | 3348 |
| MathArena Apex | 수학 경시대회 문제 | 58.6 | 65.6 | 65.3 |
| Terminal-Bench 2.1 | terminal에서 수행하는 agent 작업 | 82.7 | 90.6 | 87.9 |
| Terminal-Bench 4.0 | 더 어려운 terminal agent 작업 | 7.0 | 31.2 | 12.4 |
| DeepSWE v1.1 | 실제 repository 수정 | 54.4 | 74.2 | 62.7 |
| CyberGym | 보안 취약점 작업 | 76.7 | 88.1 | 83.3 |
| AutomationBench | workflow 자동화 | 37.7 | 54.8 | 43.2 |
이 글의 나머지는 우리가 직접 검증할 수 있었던 항목을 다룬다. 위 표의 전반부처럼 정답을 확인할 수 있는 항목이며, 지식 평가 항목은 제외했다.
V4.1 Flash는 정말 V4 Pro와 같고 V4 Flash보다 나은가?
검증 가능한 정답이 있는 과제에서는 세 build의 점수가 모두 같았다. 차이는 가격과 속도, 실패 방식에서 나타났다. 정답이 검증 가능한 단일 숫자인 과제 11개를 reasoning_effort의 low, high, max와 thinking off 조건에서 각각 3회 실행했다. 과제에는 소수의 합, 숫자 개수 세기, grid 경로, 동전 조합, 규칙 40회 적용, 7의 222제곱을 1000으로 나눈 나머지, 진법 변환, knapsack, 세 가지 조건을 만족하는 네 자리 수 개수 세기가 포함됐다. reasoning token은 모델이 답변 전에 작성하는 숨겨진 thinking이며 출력으로 과금된다. 정답당 비용은 각 모델의 peak 요금표를 기준으로 전체 비용을 정답 수로 나눴다. V4 Flash에는 단종 전까지 적용됐던 $0.44/$1.32 요금표를 사용했다. off-peak 비용은 절반이다.
| 모델 | Effort | 정답 | Reasoning token, 중앙값 (최댓값) | 정답당 비용, peak |
|---|---|---|---|---|
| V4 Flash 0731 | low | 33/33 | 492 (6,444) | $0.00131 |
| V4 Flash 0731 | high (기본값) | 33/33 | 433 (9,172) | $0.00163 |
| V4 Flash 0731 | max | 33/33 | 453 (24,010) | $0.00343 |
| V4 Flash 0731 | thinking off | 21/33 | 0 | $0.00083 |
| V4.1 Flash | low | 33/33 | 316 (6,153) | $0.00097 |
| V4.1 Flash | high (기본값) | 33/33 | 391 (13,300) | $0.00149 |
| V4.1 Flash | max | 33/33 | 391 (11,037) | $0.00129 |
| V4.1 Flash | thinking off | 21/33 | 0 | $0.00050 |
| V4 Pro | low | 33/33 | 309 (6,398) | $0.00286 |
| V4 Pro | high (기본값) | 33/33 | 548 (18,247) | $0.00768 |
| V4 Pro | max | 33/33 | 644 (15,920) | $0.00825 |
| V4 Pro | thinking off | 21/33 | 0 | $0.00232 |
thinking을 켜면 어떤 build도 어떤 effort 설정에서도 문제를 틀리지 않았다. 따라서 이 test suite로는 정확도 차이를 구분할 수 없지만 비용과 속도 차이는 분명하다. V4.1 Flash는 Pro보다 low에서 2.9배, 기본값인 high에서 5.2배, max에서 6.4배 저렴하다. V4 Flash와 비교하면 low에서 26% 저렴하다. thinking을 꺼서 thinking 시간이 아닌 답변 생성 속도만 streaming으로 측정했을 때 V4.1 Flash는 초당 121-134 output token을 생성했고 요청부터 첫 token까지 1.4 s가 걸렸다. V4 Flash는 초당 86-94 token, 첫 token까지 2.3 s였고 Pro는 초당 46-49 token, 첫 token까지 1.9 s였다. 2-turn function-calling loop에서는 모든 build가 turn마다 정확히 한 번 호출했다. 두 단계에서 사용한 reasoning token은 V4.1 Flash가 27개와 13개, V4 Flash가 30개와 19개, Pro가 61개와 29개였다. 단계당 비용은 각각 $0.00019, $0.00030, $0.00103이었다. DeepSeek 표에서 나타난 지식 격차인 HLE와 GPQA는 이 test suite가 다루지 않는 유일한 영역이다.
effort 조절은 무엇을 바꾸며 thinking을 끌 수 있는가?
일부 과제에서는 effort 설정에 따라 비용이 달라졌지만 답은 하나도 바뀌지 않았다. thinking을 끄면 모든 build에서 33개 중 12개를 추가로 틀렸다. V4.1 Flash는 reasoning_effort 값으로 low, high, max를 받는다. DeepSeek는 minimal을 low로, medium과 xhigh를 high로 mapping한다. 11개 과제 중 9개에서는 세 설정의 reasoning token 차이가 수백 개 이내였다. 차이가 크게 벌어진 것은 세 가지 조건을 만족하는 네 자리 수 개수 세기 과제뿐이었다. low에서는 5,650개, high에서는 9,714개, max에서는 6,763개를 사용했고 모두 정답이었다. 0부터 1,024까지 모든 thinking_budget 값은 오류 없이 받아들였지만 실제 동작에는 반영되지 않았다. model card에 적힌 “연속적으로 조절 가능한 reasoning effort 설정인 1-100 정수”는 API에서 사용할 수 없으며 정수를 보내면 거부된다. V4 Pro와 V4 Flash도 각자의 token 수만 다를 뿐 같은 방식으로 동작한다. 이전 build에서는 개수 세기 과제의 max 비용이 특히 높았다. Pro는 12,729-15,920 reasoning token, V4 Flash는 17,866-24,010 token을 사용했지만 V4.1 Flash는 같은 정답에 6,763개만 사용했다.
두 제어 방식과 응답에서 측정값을 가져오는 위치는 다음과 같다.
resp = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": prompt}],
reasoning_effort="low", # "low" | "high" | "max"; default "high"
extra_body={"thinking": {"type": "enabled"}}, # {"type": "disabled"} turns it off
max_tokens=4096, # always set one: see the next section
)
usage = resp.usage
reasoning_tokens = usage.completion_tokens_details.reasoning_tokens # billed as output
thinking_text = resp.choices[0].message.reasoning_content # returned on every thinking call
thinking off는 가장 저렴하지만 가장 위험한 설정이다. 각 build가 실패한 과제는 서로 달랐다.
| Thinking off, 11개 과제 x 3 | V4 Flash 0731 | V4.1 Flash | V4 Pro |
|---|---|---|---|
| 정답 | 21/33 | 21/33 | 21/33 |
| 완전 실패 (3회 중 0회) | knapsack, 소수의 합, 열차 시간표 | 동전 조합, 40-step 규칙, knapsack | knapsack, 개수 세기 과제 |
| 실패 방식 | 올바른 형식의 틀린 숫자 (17, 1043; 10:40) | 틀린 token 하나 (정답이 168인 5-step 연산에 83) | 풀이 과정을 쓴 뒤 틀린 답을 제시 |
표준 테스트 유형 중 5-step 연산에서 차이가 가장 분명했다. thinking을 끄면 V4.1 Flash는 3회 중 1회만 맞혔고 별도 실행에서는 3회 모두 틀렸다. V4 Flash는 3회 중 2회, Pro는 3회 모두 맞혔다. Pro는 답변 전에 풀이 단계를 작성하지만 Flash build는 작성하지 않기 때문이다. budget과 관련된 사실도 두 가지 있다. thinking mode는 입력으로 과금되는 숨겨진 template prefix를 추가한다. V4.1 Flash에서는 prompt token이 26개, V4 Flash와 Pro에서는 79개 늘어난다. thinking을 끄면 동일한 text가 세 모델 모두 729 token이다. 다음 turn에 다시 보내는 reasoning_content에는 요금이 재부과되지 않는다. V4.1 Flash에서는 포함 여부와 관계없이 prompt가 81 token이었고 Pro에서는 134 token이었다.
존재하지 않는 대상을 물으면 어떻게 되는가?
thinking을 켠 V4.1 Flash는 출력 한도를 전부 소모하거나 답을 지어낸다. thinking을 끄면 답변을 거부하며, 다른 두 build보다 더 안정적으로 거부한다. 존재하지 않는 대상을 만들어 질문 5개를 던졌다. 유일하게 올바른 답은 “모른다”이다. 질문에는 “Verantis Dynamics”의 주가, “Kessler-Fanning Institute”의 직원 수, “Oridium-7”의 녹는점, “1987 Pan-Continental Robotics Prize” 수상자가 포함됐다. 출력 한도는 16,384 token으로 설정했다.
| 모델, 설정 | 답변 거부 | 답을 지어냄 | 16,384-token 한도 도달, 답변 없음 | Reasoning token |
|---|---|---|---|---|
| V4.1 Flash, thinking on | 0/5 | 2/5 (“The Simpsons의 Professor Frink가 1987년 상을 받았다”; “Oridium-7의 녹는점은 1815 °C다”) | 3/5 | 2,610; 11,905; 16,384 x3 |
| V4.1 Flash, thinking off | 5/5 | 0/5 | 0/5 | 0 (69-248 output token) |
| V4 Flash 0731, thinking on | 1/5 | 3/5 (“직원 0명”; “Oridium-7은 약 1065 °C다”; “만화 Pluto에 등장하는 스위스 robot Montblanc가 수상했다”) | 1/5 | 4,080-16,384 |
| V4 Flash 0731, thinking off | 4/5 | 1/5 (“Oridium-7의 녹는점은…“) | 0/5 | 0 |
| V4 Pro, thinking on | 1/5 | 3/5 (“Andrew Martin이 수상했다”; “직원 0명”; 녹는점 범위 899-949 °C) | 1/5 | 754-16,384 |
| V4 Pro, thinking off | 3/5 | 2/5 (According to reference 844476, the Kessler-Fanning Institute had 247…) | 0/5 | 0 |
thinking을 켠 V4.1 Flash의 5회 실행 중 3회는 peak 기준 각각 $0.0197가 들었지만 빈 message만 반환했다. 다른 테스트에서 사용한 2,048-token 한도를 적용하자 5회 모두 같은 결과가 나왔고 Pro도 5회 중 4회가 같았다. 조회 결과가 실제로 없을 수 있는 작업은 thinking을 끄고 실행해야 한다. 또는 max_tokens를 제한하고 빈 message를 “알 수 없음”으로 처리해야 한다. Pro가 thinking off에서 보이는 실패 방식은 다르며 별도 regex로 잡을 만하다. Let me check that reference for you. According to reference라고 쓴 다음 존재하지 않는 숫자를 붙인다.
V4 Flash의 JSON 손상 문제는 해결됐는가?
json_object에서는 어떤 build에도 고칠 문제가 없었다. strict json_schema는 테스트할 수 없었다. V4 Flash 0731에는 thinking on과 strict json_schema를 함께 사용하면 13회 중 8회에서 integer field가 손상되는 결함이 있었다. V4.1 Flash에서 strict json_schema를 사용하자 테스트 경로에서는 400이 반환됐다. DeepSeek의 JSON 가이드도 {"type": "json_object"}만 설명한다.
json_object에서는 같은 invoice의 vendor, date, total, line item이 thinking on 8회와 thinking off 8회 모두 정확했다. 세 build에서 결과가 같았다. V4 Pro는 strict json_schema와 thinking on을 함께 사용하면 여전히 데이터가 손상된다. 8회 모두 line-item count가 틀렸고 결과는 45, 12, 47, 1, 2026이었다. thinking off에서는 8회 모두 정확했다. extraction에는 thinking off와 json_object를 함께 사용하면 모든 build가 매번 정확했다. V4.1 Flash에서는 output token 25개만 사용한다.
V4.1 Flash의 이미지 입력 비용은 얼마인가?
512x512 이하에서는 184 input token, 1 megapixel에서는 652개, 4 megapixel에서는 994개다. 이미지 입력은 Flash 제품군에 새로 추가됐다. 단종된 Vision Exp build는 별도 모델이었고 V4 Flash 0731은 text만 받는다. 생성한 PNG를 V4.1 Flash에 보내고 text-only prompt의 token 수를 뺐다.
| 이미지 | 이미지 token | Peak 비용 |
|---|---|---|
| 64x64, 128x128, 256x256, 512x512 | 184 | $0.000055 |
| 1024x1024 | 652 | $0.000196 |
| 2048x512 (1024x1024와 같은 면적) | 652 | $0.000196 |
| 512x2048 | 688 | $0.000206 |
| 2048x2048 | 994 | $0.000298 |
최솟값은 vision 가이드의 설명과 일치한다. “전체 pixel 수가 약 544x544보다 작은 이미지는 확대”되고, 더 큰 이미지는 “약 1300x1300 이미지 수준으로” 축소된다. 문서에 명시된 이미지당 상한은 1,024 token이다. content 종류인 단색, noise, rendering된 text와 format인 PNG, JPEG, WebP는 token 수를 바꾸지 않았다. 파일 크기는 174-243 KB였다. 즉 byte가 아니라 geometry를 기준으로 과금된다. 1-megapixel 이미지 1,000장의 image token 비용은 peak 기준 $0.20이며 질문과 답변 비용은 별도다.
Synthorai에서 사용하는 방법
V4.1 Flash의 gateway model ID는 deepseek-v4.1-flash이며 DeepSeek 자체 ID는 deepseek-flash다. 시간대와 관계없이 입력 token 100만 개당 $0.30, 출력 token 100만 개당 $1.20가 적용되고 cache read는 100만 개당 $0.03다. off-peak 요금은 없다. 이 글의 모든 비용은 DeepSeek의 공식 요금표를 기준으로 표시했으므로 사용 시간대에 맞춰 계산할 수 있다. V4 Flash 0731과 V4 Pro 0813도 각각 deepseek-v4-flash-0731, deepseek-v4-pro-0813로 계속 사용할 수 있으며 각자의 요금표가 적용된다. /v1/chat/completions와 /v1/responses 모두 이 모델을 지원한다. 이 경로에서는 thinking: {"type": "disabled"}로 thinking을 끌 수 있으며 thinking을 사용한 모든 호출에서 reasoning text가 reasoning_content로 반환된다. 이미지 입력은 image_url content part로 전달한다.
FAQ
DeepSeek V4.1 Flash는 V4 Flash보다 저렴한가?
대체하는 8월 요금표보다는 저렴하지만 7월 출시 요금표보다는 비싸다. V4.1 Flash는 peak 기준 100만 token당 $0.30/$1.20, off-peak 기준 $0.15/$0.60다. V4 Flash는 8월 중순부터 peak 기준 $0.44/$1.32였고 그전에는 $0.14/$0.28이었다. 이 test suite에서 low 기준 V4.1 Flash의 정답당 비용은 $0.00097였고 V4 Flash는 마지막 요금표 기준 $0.00131이었다.
DeepSeek V4.1 Flash에서 thinking을 끌 수 있는가?
가능하다. thinking: {"type": "disabled"}를 사용하면 된다. DeepSeek는 reasoning_effort: "none"도 문서에 명시한다. 단, 다단계 작업에서는 정확도가 떨어진다. V4.1 Flash는 test suite에서 33개 중 33개 정답에서 33개 중 21개로 떨어졌고, 5-step 연산에는 틀린 token 하나만 답했다. 산술 계산과 계획 작업에서는 thinking을 켜고, extraction이나 답이 없을 수 있는 조회에서는 끄는 편이 낫다.
DeepSeek V4.1 Flash는 이미지 입력을 지원하며 비용은 얼마인가?
기본 기능으로 지원한다. V4.1 Flash에서 이미지 한 장은 512x512까지 184 input token, 1024x1024에서는 652개, 2048x2048에서는 994개를 사용한다. content와 format에는 영향을 받지 않으며 peak 공식 요금 기준 이미지당 $0.000055-$0.000298다.
관련 글: DeepSeek V4 Flash 비용, DeepSeek V4 Pro GA와 preview 비교, LLM thinking 제어, 이미지 입력 token 비용, LLM structured output.