Gemini 3.7 Flash API 비용 측정: 3.6보다 작업당 2.5-8배 저렴
목차
Gemini 3.7 Flash로 같은 작업을 처리하면 Gemini 3.6 Flash보다 비용이 2.5배에서 8배 적게 든다. 이 중 광고에 나온 가격 인하 효과는 절반뿐이다. 출시 기념 요금은 입력 100만 token당 $0.75, 출력 100만 token당 $3.75로 3.6의 50%다. 실제 측정에서도 동일한 6.9K-token prompt의 비용이 정확히 절반이었다($0.00529 vs $0.01057). 나머지 절반은 잘 드러나지 않는다. 측정한 동일 작업 4개에서 gemini-3.7-flash가 사용한 thinking token은 3.6보다 26%에서 77% 적었다. 출시 이틀째에 가격 조건, thinking 설정(한 단계가 사라졌다), Google 문서가 경고한 호환성 문제와 충분히 강조하지 않은 문제, cache, context, tokenizer 연속성을 점검했다.
TL;DR
- 출시 기념 요금 $0.75/$3.75는 2026년 12월 31일까지 적용되고 이후 $1.50/$7.50로 오른다. 실제 측정에서도 같은 prompt의 비용은 3.6의 정확히 절반이었다.
- 기본 thinking 사용량은 3.6보다 26-77% 줄었다(5단계 작업에서 144 vs 384 token). 작업당 비용은 단순히 2배가 아니라 2.5-8배 낮아진다.
- 비활성화 설정은 사라졌다. 어떤 방식으로 off를 지정해도 400(“Thinking level is unsupported”)이 반환되며, 이제
low가 최솟값이다. - 2-turn tool loop에서 3.7은 tool 결과를 처리하는 turn의 검토량을 절반으로 줄였다(32 vs 61 token). 답할 수 없는 질문을 거절하는 데는 두 모델 모두 500 token가량을 썼다.
Gemini 3.7 Flash의 실제 비용은 얼마인가?
2026년 12월 31일까지 요금은 3.6의 절반이며, 측정한 모든 작업에서 사용한 token도 3.6의 절반 미만이었다. Google이 발표한 출시 요금은 입력 100만 token당 $0.75, 출력 100만 token당 $3.75다. 2027년 1월 1일부터는 3.6과 동일한 $1.50/$7.50로 돌아간다. Cache read는 100만 token당 $0.075로, 출시 기념 입력 요금의 10%다. 실제 계측 결과도 요금표와 일치했다. 동일한 6.9K-token prompt의 비용은 3.7에서 $0.0052875, 3.6에서 $0.0105675로 정확히 절반이었다.
더 큰 차이는 모델이 쓰지 않게 된 token에서 나온다. 동일한 작업에 salt를 넣어 각각 세 번 실행한 뒤, reasoning token 중앙값과 그에 따른 출력 비용을 비교했다.
| 작업 | 3.7 reasoning token | 3.6 reasoning token | 3.7 출력 비용 | 3.6 출력 비용 | 작업 비용 비율 |
|---|---|---|---|---|---|
| 단순 조회 | 73 | 98 | $0.0003 | $0.0008 | 2.7배 저렴 |
| 2-hop 문장제 | 62 | 266 | $0.0002 | $0.0020 | 8.4배 저렴 |
| 5단계 산술 | 144 | 384 | $0.0006 | $0.0029 | 5.3배 저렴 |
| JSON 추출 | 251 | 340 | $0.0011 | $0.0027 | 2.5배 저렴 |
Google은 출시 발표에서 3.7이 “더 성실하게 생각한다”고 설명했다. 우리가 측정한 작업에서는 더 많은 token이 아니라 더 적은 token으로 처리한다는 뜻이었다. 두 모델 모두 모든 정확도 항목에서 3/3을 유지했다. 절반으로 낮아진 요금에 절반 이하로 줄어든 thinking 사용량까지 곱하면, cache를 적용하기 전에도 실제 작업당 비용이 61-88% 감소한다. 단, 이 계산에는 날짜 조건이 있다. 예산은 1월 1일 요금 복귀를 기준으로 잡아야 한다. Sonnet 5의 출시 기념 요금과 같은 방식이다.
이 추세가 적용되지 않는 작업이 하나 있다. 예산에 잘 반영되지 않는 거절 응답이다. 조작한 항목 5개(회사, 연구소, 도시 헌장, 합금, 상)에 관해 질문하자 두 모델 모두 5개 전부 답변을 거절했다. 또한 두 모델 모두 우리가 측정한 다른 어떤 작업보다 이 과정에서 더 많은 thinking을 사용했다. reasoning token 중앙값은 3.7이 511, 3.6이 494였다. “이에 관한 기록이 없다”고 답하는 데 5단계 산술 계산보다 3.5배 많은 thinking이 들었다. 데이터 누락이 자주 발생하는 검색 증강 pipeline은 검색 실패 때마다 이 비용을 지불하며, 이 경우에는 3.7의 효율 개선이 사라진다. 출시 첫 주에 제기된 우려를 검증할 기준도 얻었다. 리뷰에서는 3.7의 hallucination 비율이 더 높다고 지적했지만, 조작된 항목을 묻는 질문에서는 3.6과 동일하게 5개 중 5개 모두 단정하지 않았다.
3.7에서 유지되는 thinking 설정은 무엇인가?
문서에 나온 그대로 low, medium(기본값), high의 3단계만 지원하며 off는 없다. 문서에는 3.6에서 사용하던 우회 설정이 더 이상 작동하지 않는다는 점이 명시되어 있지 않다. reasoning_effort: "none", "minimal", thinking_budget: 0, thinking: {"type": "disabled"}, enable_thinking: false 등 모든 off 표기를 전송했지만, upstream에서 동일한 400 오류가 반환됐다. 메시지는 “Thinking level is unsupported: THINKING_LEVEL_MINIMAL”이었다. 서로 독립적인 두 번째 요청 경로에서는 “Reasoning is mandatory for this endpoint and cannot be disabled”라는 더 직접적인 메시지로 거부했다. 특정 client의 변환 계층이 아니라 모델 자체의 동작이다. 같은 batch에서 측정한 3.6-flash는 여전히 none과 minimal에서 사용량을 0으로 만든다. 이제 Flash 계열도 pro tier의 정책을 따른다. thinking은 끌 수 없으며, 이를 끌 수 있는 마지막 Flash는 3.6이다.
5단계 작업에서 동작하는 설정을 비교했다. 각 설정을 세 번 실행했고, 모두 3/3으로 정답이었다.
| 설정 | 3.7 reasoning token | 3.6 reasoning token |
|---|---|---|
| low | 133 | 138 |
| medium (기본값) | 147 | 284 |
| high | 291 | 409 |
실무에서 확인할 점은 두 가지다. 먼저 기본값이 medium이라는 설명은 측정 결과와 일치했다. 설정하지 않은 실행에서는 154 token을 사용해, 명시적으로 medium을 지정했을 때의 147과 차이가 없었다. 또한 thinking_budget은 실제로 deprecated됐다. 16부터 1,024까지 0이 아닌 모든 값을 전송했지만 요청은 받아들여졌고 135-138 token으로 동일했다. 아무 효과가 없는 설정이다. 반면 3.6은 작은 budget을 off로, 큰 budget을 상한으로 계속 처리한다. 3.6 integration에서 budget으로 비용을 제어했다면 3.7에서는 level 하나를 선택해야 한다. 설정 수단은 이것뿐이다. 여러 vendor의 설정이 실제로 어떤 영향을 주는지는 thinking 설정 비교표에서 확인할 수 있다.
Agent 작업은 단계당 비용이 얼마나 드는가?
Tool 선택 동작은 3.6과 같다. 저렴해진 부분은 단계 사이의 검토 과정이다. 함수 2개를 사용하는 2-turn loop를 모델마다 세 번 실행했다. 첫 번째 함수는 incident를 조회하고, 두 번째 함수는 incident에 나온 service를 재시작한다.
| Loop 단계 | 3.7 reasoning / 출력 token | 3.6 reasoning / 출력 token |
|---|---|---|
| Turn 1: tool 선택 | 85 / 110 | 85 / 110 |
| Turn 2: tool 결과에 따라 실행 | 32 / 58 | 61 / 87 |
두 모델 모두 첫 단계에서 get_incident, 다음 단계에서 restart_service를 선택했고 결과는 3/3이었다. prompt token 수도 같았다. 차이는 두 번째 turn에서 발생한다. 3.7은 다음 call을 결정하기 전에 3.6의 절반 정도만 thinking에 쓴다. Agent가 반복하는 단계가 바로 이 부분이다. 이 중앙값을 기준으로 20-step loop의 출력 비용은 3.7이 약 $0.0043, 3.6이 $0.0131이다. 이 차이는 요율이 아니라 token 사용량에서 나오므로 1월 요금 복귀 후에도 비율이 유지된다. Google이 agent benchmark 상승을 비용 절감과 연결하는 이유다. hop마다 검토 token이 줄고, 이 차이가 여러 hop에 걸쳐 누적된다.
경쟁 모델과의 순위는 benchmark에 따라 달라지므로 coding agent를 전환하기 전에 확인해야 한다. 독립 비교 자료에 따르면 3.7 Flash는 FrontierCode에서 Sonnet 5보다 앞서고(43.6% vs Sonnet 5의 42.7%), AutomationBench에서는 Sonnet 5의 약 3배에 근접한다. 반면 같은 비교 자료와 출시 첫 주 보도에 따르면 Terminal-bench에서는 GPT-5.6 Terra가, desktop 작업 시험에서는 Sonnet 5가 앞선다. 최저 비용에서는 3.7의 우위가 분명하다.
3.6에서 업그레이드하면 무엇이 깨지는가?
명확하게 400을 반환하는 항목이 2개 있으며, 문서에서 설명하는 것보다 조용히 실패하는 항목도 여럿이다. Google의 migration 안내는 temperature, top_p, top_k, candidate_count, prefill된 model turn을 제거하라고 한다. 실제 측정 결과는 다음과 같다.
| 변경 사항 | 문서 설명 | 실제 동작 |
|---|---|---|
| Prefill된 assistant turn | 제거 필수 | 400: “Requests ending with a model turn are not supported”(3.6도 거부한다. 이제 문서에 명시됐을 뿐이다) |
n > 1 | 제거 필수 | 측정한 인터페이스에서 400 |
temperature / top_p / top_k | 제거 필수 | 3.7과 3.6 모두에서 아무 경고 없이 허용 |
64K 출력 한도를 넘는 max_tokens | 64K 제한 | 테스트한 두 요청 경로 모두 200,000까지 200으로 허용. 실제 생성 시 한도가 조용히 적용됨 |
thinking_budget | level로 대체 | 허용되지만 효과 없음(어떤 값에서도 135-token으로 일정) |
검증 방식이 일관되지 않다는 점에 주의해야 한다. thinking 설정은 엄격하게 검증해 지원하지 않는 level을 보내면 해당 값을 명시한 400을 반환한다. 반면 sampling parameter와 출력 상한은 어떤 값을 보내도 그대로 받아들인다. Client library가 기본적으로 temperature를 설정해도 지금은 문제가 없다. Guided output을 위해 assistant turn을 prefill한다면 업그레이드 전부터 이미 동작하지 않았다.
Cache, context, tokenizer는 그대로 유지되는가?
한 가지 지연 문제를 제외하면 그대로 유지된다. Implicit cache는 3.6과 같은 형태로 hit했다. 동일한 prompt를 두 번째로 호출했을 때 6,905 token 중 4,076 token이 cache 처리되어 call 비용이 52% 줄었다. Cache read 요금은 출시 기념 입력 요금의 10%다. 다만 cache 생성 지연은 길어졌다. 3.6은 초기 call 후 4초 만에 hit했지만, 3.7은 4초 후에는 hit하지 않았고 30초 후에야 hit했다. 중복 요청이 짧은 간격으로 몰리면 cache가 준비되기 전에 처리된다. 그 외 write 측 비용 구조는 변하지 않았다.
Context는 한 번의 call에서 입력 708,912 token을 받아들였고 needle 질문에도 정확히 답했다. 1M 지원 설명과 일치하며, 요금표에는 long-context 별도 구간도 없다. Text tokenizer는 4세대에 걸쳐 byte 단위로 동일했다. gemini-3.1-pro-preview, 3.5-flash, 3.6, 3.7 모두 영어, 중국어, code가 섞인 동일 corpus를 50 token으로 계산했다. 기존 token budget을 그대로 옮길 수 있다. Image 입력도 Gemini 계열 전체에서 측정한 것처럼 크기와 관계없이 계속 1,089 token으로 고정 과금된다. 두 세대 모두 reasoning text는 반환하지 않는다. 모든 call에서 reasoning_content가 비어 있었다. 두 모델 모두 비용을 지불한 thinking 내용은 볼 수 없으며, 출시 첫 주 커뮤니티에서도 이 문제가 계속 지적됐다. Structured output도 정상 동작한다. Strict json_schema는 3/3 실행에서 모두 정확하고 유효한 JSON을 반환했다. reasoning_effort: "low"를 지정하자 추출 작업의 thinking은 0이 됐다. thinking 설정 비교에서 모든 모델에 공통으로 나타난 단일 단계의 안전 구간과 같다.
FAQ
Gemini 3.7 Flash API의 가격은 얼마인가?
2026년 12월 31일까지 출시 기념 요금은 입력 100만 token당 $0.75, 출력 100만 token당 $3.75다. 2027년 1월 1일부터는 Gemini 3.6 Flash와 같은 $1.50/$7.50로 돌아간다. Cache read는 100만 token당 $0.075다. 동일한 prompt를 실제 측정한 결과, 3.7의 비용은 3.6의 정확히 절반이었다.
Gemini 3.7 Flash에서 thinking을 끌 수 있는가?
불가능하다. 어떤 방식으로 off를 지정해도 400(“Thinking level is unsupported”)이 반환된다. 설정은 low, medium(기본값), high이며, low에서도 5단계 작업에 reasoning token 133개를 사용했다. Gemini 3.6 Flash는 reasoning_effort: "none"이 작동하는 가장 최신 Flash 모델이며, 가격은 3.7의 출시 기념 요금 종료 후와 같다.
요청당 비용도 Gemini 3.7 Flash가 3.6보다 실제로 저렴한가?
광고에 나온 50%보다 더 저렴하다. 같은 작업에서 thinking도 26-77% 적게 사용하므로, 측정한 작업당 비용은 61-88% 감소했다(2-hop 문장제는 $0.0020에서 $0.0002로 감소). 12월 31일 이후에는 요금 차이가 사라져 동일해지고 thinking 절감 효과만 남는다.
Gemini 3.6 Flash용 code가 3.7에서도 동작하는가?
대부분 동작한다. 문서의 제거 목록과 달리 sampling parameter(temperature, top_p, top_k)는 여전히 허용되고, 지나치게 큰 max_tokens는 별도 오류 없이 상한이 적용된다. 명확하게 깨지는 부분은 2개다. Prefill된 assistant turn은 400을 반환하며, 3.6에서도 이미 같은 동작이었다. 모든 thinking off 설정도 이제 400을 반환하므로, 비용 제어 방식을 thinking_budget에서 3단계 level로 바꿔야 한다.
2026-08-15에 출시 이틀째인 모델을 Synthorai gateway에서 측정했다. Dial과 off 설정 matrix(7개 effort 값, 5개 budget, 2개 off parameter, n=3)를 실행했으며, 모든 비교에서 gemini-3.6-flash도 같은 batch로 다시 측정했다. 4개 작업의 reasoning 비용, strict-JSON structured output, deprecated parameter, 출력 상한과 708K-context 허용 여부, 두 가지 대기 시간의 implicit-cache 쌍, Gemini 4세대의 고정 corpus tokenizer 비교, 2-turn function-calling loop(모델당 n=3), 조작된 항목 5개에 대한 거절 동작을 점검했다. 작업별 금액은 각 모델의 현재 출력 요금에 실제 completion token 수를 적용해 계산했다. 과도하게 큰 max_tokens 허용과 off 설정 부재는 서로 독립적인 두 번째 요청 경로에서도 교차 확인했다. 출시 기념 요금과 날짜는 Google이 공개한 조건이다. Rollout이 진행되면서 동작이 바뀔 수 있다.