2026년 Flash LLM API: 가성비 GLM, 성능 Gemini 3.8
목차
2026년 9월 기준으로 가장 좋은 Flash급 LLM API는 용도에 따라 다르다. GLM 5.3 Flash는 비용 대비 벤치마크 점수가 가장 높고, Gemini 3.8 Flash는 전반적인 성능이 가장 뛰어나며 오디오와 비디오 처리에도 적합하다. Claude Sonnet 5는 가격이 가장 높지만 답을 지어내는 경우가 가장 적다. Seed 2.0 Mini는 모든 자체 테스트를 통과한 모델 중 가장 저렴하다. 여기서 Flash급은 각 벤더가 제공하는 작고 빠른 모델을 뜻한다. 총 16개 모델을 평가한 결과, 모든 벤더의 최신 모델이 이전 세대 소형 모델보다 나았다. 이 글에서는 최신 모델 9종의 정가, cache 가격, 입력 형식, thinking 제어, 독립 벤치마크, 작업당 비용, 운영 환경에서 발생하는 문제를 비교한다.
TL;DR
- 각 벤더의 최신 모델로 옮기는 편이 낫다. Claude Sonnet 5, GPT-5.6 Terra, Gemini 3.8 Flash는 Haiku 4.5, GPT-5.4 mini, Gemini 3.5 Flash-Lite보다 token당 가격은 비싸지만 정답당 비용은 2.5-3.9배 낮다.
- 가성비 최고: GLM 5.3 Flash. Artificial Analysis 지수는 41.9, 작업당 비용은 $0.25다.
- 종합 성능과 멀티모달 최고: Gemini 3.8 Flash.
- 지어낸 답변이 가장 적은 모델: Claude Sonnet 5. 단, 작업당 비용은 가장 높다.
- 최저가: Seed 2.0 Mini, $0.10 / $0.40.
9개 모델을 어떻게 비교하고 테스트했나?
가격과 기능은 벤더 페이지, 벤치마크는 모든 모델을 동일한 하네스로 평가하는 독립 리더보드에서 가져왔다. 자체 테스트는 순위를 매기기 위한 것이 아니라 최소 통과 기준을 확인하기 위한 것이다. 사용한 리더보드는 Artificial Analysis(AA) Intelligence Index v4.3과 비환각률(추측하지 않고 답변을 거부하는 비율), LiveBench, Vals Index, Arena의 text 및 WebDev 투표다. 자체 테스트는 검산 가능한 숫자를 답으로 갖는 11개 문제로 구성했다. 자릿수 계산, 소수의 합, 격자 경로, 동전 교환, 모듈러 거듭제곱, 배낭 문제 등이 포함되며 각 문제를 3회 실행했다. 여기에 존재하지 않는 회사, 연구소, 마을, 합금, 상에 관한 질문 5개를 추가하고, 모델이 답변을 거부하는지 지어내는지 전체 응답을 직접 확인했다. Thinking은 모델이 최종 답변 전에 생성하는 reasoning token을 뜻한다. output으로 과금되며 요청마다 reasoning_effort 같은 필드로 설정한다. 모든 모델을 기본값과 지원하는 모든 thinking 설정에서 실행했다.
| 모델 | AA 지수 | AA 비환각률 | LiveBench | Vals Index | Arena text / WebDev | 자체 테스트: 기본 / 최고 | 기본값에서 지어낸 답 |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Terra | 42.3 at max | 12.1 | 77.9 | 59.6 | 1466 / 1521 | 31 / 33 | 2 of 5 |
| GLM 5.3 Flash | 41.9 | 72.4 | 71.6 | 47.2 | 1475 / 1607 | 31 / 31 | 0 of 5 |
| Gemini 3.8 Flash | 41.2 at high | 44.8 | 75.8 | 62.3 | 1493 / 1568 | 32 / 33 | 0 of 5 |
| Qwen3.8 Flash | 39.9 | 54.7 | 76.2 | 미등재 | 미등재 / 1635 | 33 / 33 | 2 of 5 |
| DeepSeek V4.1 Flash | 39.5 at max | 3.5 | 81.1 | 57.9 | 미등재 / 1614 | 33 / 33 | 4 of 5 |
| Claude Sonnet 5 | 38.4 at max | 60.6 | 76.0 | 59.6 | 1461 / 1537 | 33 / 33 | 0 of 5 |
| GPT-5.6 Luna | 37.5 at max | 7.4 | 73.6 | 59.9 | 1453 / 1519 | 31 / 32 | 4 of 5 |
| Hy3 | 25.8 | 25.9 | 미등재 | 미등재 | 1456 / 1513 | 33 / 33 | 0 of 5 |
| Seed 2.0 Mini | 미등재 | 미등재 | 미등재 | 미등재 | 미등재 | 33 / 33 | 0 of 5 |
출처, 2026-09-17 확인: Artificial Analysis, LiveBench, Vals Index, Arena text, Arena WebDev. Arena 점수는 Elo 방식이며 20점 차이는 크지 않다. Qwen3.8 Flash는 리더보드에 Qwen3.8-Flash-Next로 등재되어 있다. API의 기반이 되는 open-weight 모델이다. 측정은 2026-09-16과 17에 진행했고, 날짜 간 비교가 가능한지 확인하기 위해 모델 2개를 둘째 날 다시 실행했다.
모든 리더보드에서 1위인 모델은 없다. Terra는 AA 지수, DeepSeek는 LiveBench, Gemini 3.8 Flash는 Vals와 Arena text, Qwen3.8 Flash는 Arena WebDev에서 가장 높다. AA 비환각률과 자체 테스트의 가상 질문 5개는 어떤 모델이 추측하는지에 관해 같은 결과를 보였다. DeepSeek V4.1 Flash, Luna, Terra는 답변을 거의 거부하지 않았고, GLM 5.3 Flash와 Sonnet 5는 대체로 거부했다. Seed 2.0 Mini는 어디에도 독립 평가 점수가 없어 자체 테스트가 유일한 근거다.
어떤 벤더 모델을 Flash급으로 봤으며 최신 모델로 옮겨야 하나?
각 벤더의 최신 소형 모델을 Flash급으로 봤다. 최신 모델로 옮기는 것이 맞다. Google, DeepSeek, Alibaba, Z.ai, ByteDance, Tencent는 자사 모델을 Flash, Mini 또는 단일 저가 모델로 분류한다. Anthropic의 현 세대 제품군은 Fable, Opus, Sonnet이며 Haiku 4.5는 한 세대 전 모델이다. 2025년 10월 출시됐고 2026년 10월 15일 이전에는 종료되지 않는다. 따라서 Claude Sonnet 5를 Claude의 Flash급 모델로 분류했다. OpenAI 문서에서는 GPT-5.6 Terra를 기존 mini급, GPT-5.6 Luna를 nano급에 대응시킨다. Sonnet 5($2 / $10)와 Terra($2 / $12)는 나머지 7개 모델보다 token당 가격이 몇 배 비싸며, 아래 가격 비교에서도 별도 구간에 속한다.
4개 벤더의 이전 세대 소형 모델도 평가했다. 33회 실행에 지출한 총비용을 정답 수로 나눠 정답당 비용을 계산했다. 정답률이 절반이면 정답 하나를 얻는 데 드는 비용은 2배가 된다. 모든 비교에서 최신 모델이 앞섰다. TL;DR에 나온 3개 비교에서는 최신 모델의 token당 가격이 더 비쌌지만 정답당 비용은 더 낮았다.
- Claude Haiku 4.5보다 Claude Sonnet 5가 낫다. Haiku는 thinking을 최대로 설정해야 33개 중 32개를 맞혔다. Sonnet 5는 thinking이 켜진 모든 설정에서 33개를 전부 맞혔고, 가장 저렴한
max기준 정답당 비용은 2.9배 낮았다. 두 모델 모두 가상 질문 5개에 전부 답변을 거부했다. - GPT-5.4 mini보다 GPT-5.6 Terra가 낫다. Mini는 기본값에서 33개 중 9개를 맞혔고
high에서야 33개를 모두 맞혔다. Terra는low에서 33개를 모두 맞히면서 비용은 2.5배 낮았다. Mini는 가상 질문 5개에 전부 답변을 거부했지만 Terra는 2개를 지어냈다. - Gemini 3.5 Flash-Lite와 Gemini 3.7 Flash보다 Gemini 3.8 Flash가 낫다. Flash-Lite보다 정답당 비용이 3.9배 낮았고, Flash-Lite가 답을 지어낸 가상 질문 3개에도 답변을 거부했다. Flash-Lite가 여전히 적합한 용도는 단일 단계 추출뿐이다. 3.7 Flash와 비교하면 정가는 같고 호출당 비용은 3.8이 약 10% 높다. 비용 절감이 아니라 성능 향상을 위한 업그레이드다.
- GPT-5.4 nano보다 GPT-5.6 Luna가 낫다. 둘 다 33개 중 31개를 맞혔지만 정답당 비용은 약 3분의 1이다. Qwen3.6 Flash와 Qwen3.5 Flash보다 Qwen3.8 Flash가 낫다. 이전 모델들은 thinking token을 약 10배 많이 쓰고 정답당 비용은 6-27배 높다.
이하 내용은 최신 모델 9개만 다룬다.
9개 모델의 비용은 얼마인가?
output 정가를 기준으로 3개 구간으로 나눴다. 막대는 각 모델의 최적 설정에서 측정한 정답당 비용이다. 정가는 저렴하지만 thinking을 많이 쓰는 모델의 실제 비용도 함께 드러난다. 라벨에는 정가와 cache read 가격을 표시했다. cache read 가격은 반복되는 prompt prefix의 비용이 input 가격에서 차지하는 비율이다.
가격대만으로 실제 청구액을 예측하기는 어렵다. 가장 비싼 구간의 GPT-5.6 Terra는 정답당 비용이 Gemini 3.8 Flash보다 낮고, Seed 2.0 Mini보다 약 25% 높을 뿐이다. 모델이 사용하는 thinking token이 정가만큼이나 비용을 크게 바꾸기 때문이다. 가격은 자주 바뀌고 시간과 지역에 따라서도 달라진다. Google의 3.x Flash 가격은 2027년 1월 1일 2배로 오른다. Gemini 3.8 Flash는 $1.50 / $7.50이 된다. DeepSeek는 평일 01:00-04:00 및 06:00-10:00 UTC를 제외한 시간에 절반 가격을 적용한다. OpenAI는 7월에 GPT-5.6 Luna 가격을 80% 인하했다. Qwen3.8 Flash는 Alibaba의 Singapore 리전 밖에서 19-25% 저렴하다. 테스트 당시 Synthorai에서 이용할 수 없어 측정하지 못한 최신 소형 모델은 3개다. Mistral Small 4($0.15 / $0.60), StepFun Step 3.7 Flash($0.20 / $1.15), Amazon Nova 2 Lite($0.30 / $2.50)다.
각 모델이 지원하는 입력은 무엇이며 thinking을 끌 수 있나?
9개 중 8개가 이미지를 지원하고, 4개는 비디오, 2개는 오디오를 입력받는다. Tencent의 Hunyuan 3인 Hy3는 text만 지원한다. 마지막 열은 송장 추출 작업을 8회 실행했을 때 strict schema에 맞는 JSON과 올바른 값을 반환했는지 나타낸다.
| 모델 | 입력 | Context / 최대 output | Open weights | Thinking 끄기 | Thinking 기본값 | Schema JSON |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | text, image | 1M / 128K | 아니요 | 예 | adaptive, high | tool call로 8/8 |
| GPT-5.6 Terra | text, image | 1.05M / 128K | 아니요 | 예 | medium | 8/8 |
| Gemini 3.8 Flash | text, image, audio, video, PDF | 1M / 64K | 아니요 | 아니요 | medium | 8/8 |
| GPT-5.6 Luna | text, image | 1.05M / 128K | 아니요 | 예 | medium | 8/8 |
| DeepSeek V4.1 Flash | text, image | 1M / 384K | MIT | 예 | high | json_object만 지원, 8/8 |
| Seed 2.0 Mini | text, image, audio, video | 256K / 128K | 아니요 | 예 | medium | 8/8 |
| Qwen3.8 Flash | text, image, video | 1M / 128K | Qwen license | 예 | xhigh | 3/8, 잘못된 정수 |
| GLM 5.3 Flash | text, image, video, file | 1M / 128K | MIT | 아니요 | max | json_object만 지원, 8/8 |
| Hy3 | text | 256K / 128K | Apache 2.0 | 예 | high | json_object만 지원, 7/8 |
“tool call로”는 schema를 tool input으로 전달하고 Claude가 반드시 해당 tool을 호출하도록 했다는 뜻이다. “json_object만 지원”은 테스트한 요청 경로에서 strict schema 결과가 올바르게 반환되지 않아, prompt에 key를 명시하고 {"type": "json_object"}를 사용했다는 의미다. 오디오 입력이 필요하면 Gemini 3.8 Flash나 Seed 2.0 Mini를 선택하면 된다. 128K를 넘는 output은 DeepSeek V4.1 Flash가 지원한다. 직접 호스팅할 수 있는 weights가 필요하면 DeepSeek, GLM, Hy3, Qwen3.8 Flash가 대상이다.
Token 가격이 아니라 작업 전체 비용은 얼마인가?
호출 비용은 가격과 모델이 실제로 사용한 token 수를 곱해 결정된다. 이 등급에서는 두 번째 요인의 편차가 더 크다. 공개 지표 중 가장 공정한 것은 Artificial Analysis 지수의 작업 1개를 실행하는 비용이다. thinking token도 포함하며 9개 모델 중 8개에 이 수치가 있다.
GLM 5.3 Flash는 GPT-5.6 Terra와 지수 차이가 0.5점 이내지만 작업당 비용은 5분의 1이다. Qwen3.8 Flash의 정가는 GLM과 거의 같지만 작업당 비용은 50% 더 높다. 지수 측정에 GLM은 180 million output token을 쓴 반면 Qwen은 240 million을 썼기 때문이다. Claude Sonnet 5는 max에서 작업당 $5.09가 들고 기본값인 high에서는 $1.79가 든다. 지수 6점을 높이는 비용이다. 자체 단일 호출 테스트에서도 같은 효과가 나타났다. Seed 2.0 Mini는 정가가 Qwen3.8 Flash보다 낮지만 정답당 비용은 3.4배 높았다. 작업당 thinking token 중앙값이 Qwen은 530, Seed는 2,810이었기 때문이다.
Cache read 비용은 input 가격 대비 DeepSeek가 2%, Google, OpenAI, Anthropic, Alibaba가 약 10%, Z.ai와 ByteDance가 20%, Tencent가 25%다. Agent 및 RAG 트래픽에서 RAG는 검색 증강 생성으로, 검색한 문서를 매 prompt에 붙인다. 이 경우 청구액은 read 가격이 좌우한다. cache된 100K-token prefix의 호출당 비용은 DeepSeek V4.1 Flash에서 $0.0006, Sonnet 5나 Terra에서 $0.02다. OpenRouter는 V4.1 Flash 출시 후 하루 동안 제공한 token 중 90%가 cache read였다고 밝혔다(게시물). 몇 시간 안에 응답하는 batch tier를 사용하면 Gemini 3.8 Flash, GPT-5.6 Luna, Terra, Sonnet 5의 가격이 절반으로 내려간다. Qwen3.8 Flash, GLM 5.3 Flash, Hy3에는 batch tier가 없다.
어떤 Flash 모델을 선택해야 하나?
가성비는 GLM 5.3 Flash, 종합 성능과 멀티모달 입력은 Gemini 3.8 Flash, 지어낸 답변을 최소화하려면 Claude Sonnet 5, 가격은 Seed 2.0 Mini가 가장 좋다.
| 기준 | 선택 | 이유 |
|---|---|---|
| 가성비 최고 | GLM 5.3 Flash | 지수 41.9로 Terra에 이어 2위, 작업당 $0.25. 9개 중 비환각률 최고(72.4). $0.15 / $0.50. image, video, file 입력. MIT weights |
| 종합 성능 최고 | Gemini 3.8 Flash | 9개 중 Vals와 Arena text 1위. Terra보다 지수는 1.1점 낮지만 작업당 비용은 11% 저렴. low에서 33/33, 모든 가상 질문에 답변 거부 |
| 멀티모달 최고 | Gemini 3.8 Flash | audio, video, PDF 입력. audio를 text와 같은 가격으로 과금. schema JSON 8/8 |
| 빠르면서 지어낸 답변 최소 | Claude Sonnet 5 | thinking이 켜진 모든 설정에서 33/33. thinking on/off 모두 가상 질문 5개에 답변 거부. 첫 answer token까지 2.2초. 작업당 비용이 가장 높으므로 지어낸 답변의 손실이 호출 비용보다 큰 경우에 적합 |
| 최저가 | Seed 2.0 Mini | $0.10 / $0.40. 기본값에서 33/33, schema JSON 8/8, 가상 질문 5개에 모두 답변 거부, audio 및 video 입력 |
나머지 3개 모델은 각각 한 가지 이유로 추천 대상에서 빠졌다. GPT-5.6 Terra는 지수 1위이고 low에서 33/33을 기록했으며 정답당 비용도 $0.00199다. 하지만 million output token당 $12를 받으면서 가상 질문 5개 중 2개에 답을 지어냈다. DeepSeek V4.1 Flash는 LiveBench 1위이고 cache가 가장 저렴하지만 text와 image만 지원하며, thinking이 켜진 상태에서 5개 중 4개 답을 지어냈다. Qwen3.8 Flash는 자체 테스트에서 만점을 받은 모델 중 정답당 비용이 $0.00046로 가장 저렴했고 Arena WebDev 1위였다. 하지만 답 2개를 지어냈고 strict schema에서 잘못된 정수를 생성했으며, 400단어 설명에 거의 3분이 걸렸다.
한 모델만 고르지 말고 요청 유형에 따라 라우팅해야 한다. 검산 가능한 답이 있는 폐쇄형 작업은 통과한 모델 중 가장 저렴한 모델(GLM 5.3 Flash, Qwen3.8 Flash, Hy3)로 보낸다. 개방형 사실 질문은 답변을 거부할 줄 아는 모델(GLM 5.3 Flash, Sonnet 5, Gemini 3.8 Flash)로 보낸다. 긴 agent 실행은 예산 내에서 가장 강한 모델을 사용한다.
기본 설정에서 탈락하는 Flash 모델은?
9개 중 2개다. 개방형 질문만 답변을 거부하는 설정으로 보내면 둘 다 통과한다. 모델 출고 기본값에 적용한 최소 기준은 작업 33개 중 30개 이상 정답, 가상 질문 5개 중 지어낸 답이 2개 이하다.
| 모델 | 기본값 결과 | 변경 사항 | 변경 후 |
|---|---|---|---|
| DeepSeek V4.1 Flash | 5개 중 4개를 지어냄(“직원 50명”, “1790 °C”, Simpsons 등장인물을 수상자로 답변) | 개방형 질문에서 thinking 끄기 | 5개 모두 답변 거부. 단, 작업은 33개 중 21개만 정답이므로 개방형 질문만 이 설정으로 전송 |
| GPT-5.6 Luna | 5개 중 4개를 지어냄(“직원 약 20명”, “1974”, “1,400 °C”) | 개방형 질문에서 thinking 끄기 | 5개 중 4개에 답변 거부. 단, 작업은 33개 중 7개만 정답이므로 동일한 라우팅 필요 |
GPT-5.6 Terra와 Qwen3.8 Flash는 지어낸 답이 각각 2개로 통과 기준선에 걸쳐 있다. Terra는 “직원 0명”, “약 1,455 °C”라고 답했다. 개방형 질문에는 두 모델도 같은 방식으로 처리해야 한다.
Flash 모델로 충분한가, 더 큰 모델이 필요한가?
범위가 명확한 작업에는 충분하다. 실제 repository를 대상으로 shell에서 작업하는 짧은 agent 벤치마크에서 DeepSeek V4.1 Flash는 Terminal-Bench 2.1에서 DeepSeek V4 Pro보다 높다(90.6 대 87.9). DeepSWE에서도 74.2 대 62.7로 앞선다. Gemini 3.8 Flash는 Terminal-Bench 2.1에서 89.4를 기록해 Claude Opus 5의 89.1보다 높다. 9개 모델 모두 2-turn tool-calling loop를 3회 모두 완료했다.
작업이 길거나 context가 커지면 격차가 다시 벌어진다. Google 자체 표에서 Terminal-Bench 4.0 점수는 Gemini 3.8 Flash가 19.1, Opus 5가 51.8이다. OpenAI의 512K-1M token 구간 multi-needle retrieval 테스트에서는 GPT-5.6 Luna가 41.3, GPT-5.6 Terra가 72.5다. 1M context window가 있다고 해서 가장 작은 모델이 1M token을 안정적으로 기억한다는 뜻은 아니다. Flash 모델은 extraction, classification, 짧은 tool 단계, 형태가 정해진 코드 변경에 사용한다. 긴 agent 실행 계획과 매우 긴 문서에 대한 질의는 더 큰 모델에 맡기는 편이 낫다.
Flash 모델을 운영 환경에 넣으면 무엇이 문제인가?
모델 성능보다 기본값과 요청 형식에서 문제가 더 많이 생긴다.
- Thinking을 끌 수 없는 모델이 2개다. Gemini 3.8 Flash와 GLM 5.3 Flash는 테스트한 모든 off 설정에 400을 반환했다.
- 기본값이 양극단에 있다. GLM 5.3 Flash의 기본값은
max, Qwen3.8 Flash는xhigh다(Alibaba). 가상 질문 5개에서 Qwen3.8 Flash가 사용한 reasoning token 중앙값은 11,680이었다. Google은 thinking도max_output_tokens에 포함하므로 한도를 너무 낮게 잡으면 비용은 청구되면서 답변이 잘리거나 비어 있을 수 있다(thinking 가이드). - Claude는 별도 제어 방식을 쓴다. Claude Sonnet 5는 thinking 깊이를
output_config.effort로 설정하며 예전budget_tokens를 거부한다(effort).reasoning_effort는 지원하는 parameter가 아니다. - Tool loop에서는 reasoning을 다시 전송해야 한다. DeepSeek의 thinking mode는 이전 turn의
reasoning_content를 요구한다(thinking mode). Gemini는 function-call part에 thought signature를 붙인다. message history를 재구성하는 framework는 둘 다 누락할 수 있다. - Strict JSON 지원 방식이 제각각이다. Qwen3.8 Flash는 schema의 type은 지켰지만 8회 중 5회에서 잘못된 정수를 썼다. line item이
-561994로 나온 경우도 있었다. Qwen, GLM, Hy3, DeepSeek에는 prompt에 key를 명시하고json_object를 사용한다. Claude에서는 tool call을 사용한다. - Thinking이 답변의 정직성을 바꾼다. DeepSeek V4.1 Flash는 thinking이 켜진 상태에서 5개 중 4개 답을 지어냈지만, 끄면 하나도 지어내지 않았다.
- Model id가 바뀐다.
deepseek-v4-flash는 9월 10일부터 V4.1 Flash를 제공한다(가격). Claude Haiku 4.5는 10월 15일부터 종료될 수 있다(지원 종료).seed-2-0-mini-260428처럼 날짜가 포함된 snapshot이 있으면 고정해서 사용해야 한다. - Open weights의 타사 호스팅 품질은 일정하지 않다. DeepSeek, GLM, Qwen, Hy3는 여러 provider가 서로 다른 quantization과 cache 동작으로 제공한다. 9월에는 한 reseller가 유료 요청을 더 저렴한 모델로 라우팅한 사실도 드러났다(Hacker News). 사용 중인 provider의 응답을 벤더 공식 API와 비교해야 한다.
속도는 모델 크기보다 기본 thinking 설정에 더 크게 좌우된다. 2026-09-17에 각 모델의 기본값으로 400단어 설명을 streaming해 3회씩 실행했다.
| 모델, 기본 설정 | 첫 answer token | 총시간 | 초당 output token |
|---|---|---|---|
| Claude Sonnet 5 | 2.2 s | 10.5 s | 70 |
| Gemini 3.8 Flash | 10.7 s | 14.3 s | 114 |
| GPT-5.6 Luna | 24.9 s | 26.1 s | 89 |
| GPT-5.6 Terra | 33.3 s | 34.2 s | 63 |
| GLM 5.3 Flash | 36.7 s | 39.3 s | 128 |
| DeepSeek V4.1 Flash | 40.4 s | 40.6 s | 158 |
| Seed 2.0 Mini | 61.3 s | 61.5 s | 81 |
| Hy3 | 123.0 s | 134.5 s | 35 |
| Qwen3.8 Flash | 159.9 s | 165.8 s | 72 |
초당 token 수는 전체 호출에서 reasoning과 answer를 모두 포함한다. Sonnet 5의 adaptive thinking은 글쓰기 작업에서 thinking token을 전혀 사용하지 않고 바로 답변을 시작했다. Qwen3.8 Flash는 같은 작업에 reasoning token 중앙값 10,697을 사용했다. 따라서 폐쇄형 작업을 저렴하게 처리하는 모델도 개방형 prompt에는 몇 분이 걸릴 수 있다.
OpenAI-compatible 요청에서는 필드 하나로 설정하며 thinking 사용량은 usage로 반환된다.
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
r = client.chat.completions.create(
model="gemini-3.8-flash", # or glm-5.3-flash, gpt-5.6-terra, ...
reasoning_effort="low",
max_tokens=32768,
messages=[{"role": "user", "content": "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer."}],
)
u = r.usage
print(r.choices[0].message.content, u.completion_tokens, u.completion_tokens_details.reasoning_tokens)
Claude Sonnet 5는 같은 요청을 Messages API에 보내면서 output_config: {"effort": "low"}를 사용한다.
Synthorai의 처리 방식
위의 모든 모델은 동일한 endpoint에서 model id 하나로 호출할 수 있다. OpenAI-compatible 및 Anthropic-compatible 방식을 모두 지원한다. 모델 비교 페이지에서는 모델 2개의 가격, cache, 입력 형식, context, 벤더 벤치마크를 나란히 볼 수 있다. 9개 모델의 최신 가격은 모델 가격 비교에 정리되어 있다.
FAQ
Claude Sonnet 5는 Flash 모델인가? Anthropic은 Flash라고 부르지 않는다. 하지만 Claude Haiku 4.5는 2025년 10월 모델이고 2026년 10월 15일부터 종료될 수 있으므로, Claude 현 세대에서 가장 작은 모델은 Claude Sonnet 5다. Sonnet 5의 가격은 $2 / $10으로 Haiku의 $1 / $5보다 비싸지만 자체 테스트의 정답당 비용은 2.9배 낮았다.
Gemini Flash API는 무료인가? Gemini 3.8 Flash는 Google AI Studio에서 free tier를 제공한다. 다만 Google은 free-tier content를 제품 개선에 사용한다(가격). EEA, Switzerland, UK 사용자에게 제공하는 앱에는 paid service만 사용할 수 있다(약관). 유료 tier는 2026년 12월 31일까지 $0.75 / $3.75이며, 이후에는 $1.50 / $7.50이다.
Gemini Flash와 Flash-Lite 중 무엇을 써야 하나? 모든 요청이 단일 단계 extraction인 경우가 아니라면 Gemini 3.8 Flash가 낫다. Artificial Analysis 지수는 41.2로 Gemini 3.5 Flash-Lite의 23보다 높다. 자체 테스트의 정답당 비용은 3.9배 낮았고, Flash-Lite가 답한 가상 질문 3개를 포함해 5개 모두 답변을 거부했다. Flash-Lite의 가격은 $0.30 / $2.50이며 약 4초 안에 답한다.
GPT-5.6 Luna와 GPT-5.6 Terra 중 무엇을 써야 하나?
대량 처리에는 GPT-5.6 Luna, 어려운 reasoning에는 GPT-5.6 Terra가 적합하다. Luna는 $0.20 / $1.20이며 기본값에서 33개 중 31개를 맞혔다. 정답당 비용은 $0.00030이다. Terra는 $2 / $12이며 low에서 33개를 모두 맞혔고 정답당 비용은 $0.00199다. 9개 중 지수도 가장 높다. 기본값에서는 둘 다 답을 지어냈다. Luna는 5개 중 4개, Terra는 2개였다.
코딩에 가장 좋은 Flash 모델은? Arena WebDev에서는 Qwen3.8 Flash, DeepSeek V4.1 Flash, GLM 5.3 Flash가 각각 1635, 1614, 1607로 선두다. LiveBench의 agentic coding 부문에서는 DeepSeek가 77.3으로 가장 높다. Vals의 Vibe Code Bench에서는 DeepSeek와 Claude Sonnet 5가 각각 84.7, 81.3으로 앞선다.
관련 글: DeepSeek V4.1 Flash API 비용, GLM 5.3 API 비용, Gemini 3.7 Flash API 비용, provider별 prompt caching 비교, 용도별 최적 LLM.