번역용 LLM 비교: 9개 모델, 9개 언어, 비용 차이 400배
목차
번역에 가장 좋은 모델은 하나가 아니다. 평가한 9개 언어 중 7개에서는 gpt-5.6-sol이 앞섰다. 한국어에서는 claude-fable-5가 근소하게 우세했고, gemini-3.7-flash는 동률이었다. 이탈리아어에서는 gemini-3.7-flash가 측정 비용은 같으면서 더 좋은 결과를 냈다. 같은 100만 자를 번역해도 어떤 API를 선택하느냐에 따라 비용은 $0.26-$104로 벌어졌다. 9개 모델로 9개 언어에서 번역문 4,210개를 생성하고, 블라인드 쌍대 비교 판정 8,455건을 수행했다. 이 글은 그 결과를 정리한 매트릭스다.
TL;DR
- 기본 선택은 gpt-5.6-sol이다. 블라인드 판정 8,455건에서 9개 언어 중 7개를 지켰다. 한국어는 claude-fable-5가 52%로 앞섰고, 이탈리아어는 gemini-3.7-flash가 52%로 앞섰다.
- 콘텐츠별로 보면 문학 번역은 gemini-3.7-flash가 기준 모델 대비 60%로 가장 좋았다. UI 문자열은 9개 모델이 모두 동률이었고 placeholder 손상도 0건이라 가장 싼 모델이 유리하다. $4 미만에서는 qwen3.8-max가 가장 좋다.
- 100만 자당 비용은 deepseek-v4-flash의 $0.26부터 gemini-3.1-pro의 $104까지다. $104의 대부분은 모델이 비활성화를 거부한 reasoning token 1.17M에서 나왔다.
- 심사 모델들은 human post-edit보다 frontier 모델을 83-100%의 비율로 선호했다.
번역 품질은 어떻게 테스트했나?
병렬 말뭉치, 프로덕션 수준의 prompt 하나, 블라인드 심사 패널을 사용했다. 원시 판정 결과를 포함한 모든 자료는 공개 벤치마크 저장소에 있다.
말뭉치. 6개 도메인의 영어 segment 52개를 모든 모델로 9개 언어에 번역했다. 뉴스, 소셜, 발화, 문학의 4개 도메인은 연례 기계번역 공동 과제인 WMT의 평가 세트 WMT24++ (Apache-2.0)에서 가져왔으며, 도메인별로 seed를 고정해 8개 segment를 샘플링했다. 모든 WMT24++ segment에는 human post-edit reference가 있다. 전문 번역가가 번역한 뒤 다른 언어 전문가가 검토하고 교정한 결과물이다. 또한 실제 제공 locale인 zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it의 정확한 지역 변형을 모두 포함한다. 나머지 2개 도메인은 직접 구성했다. 하나는 최근 60일 안에 게시한 글에서 가져온 기술 문서 문단 10개다. 어떤 모델의 학습 데이터에도 들어갈 수 없어 contamination control 역할도 한다. 다른 하나는 localization에서 자주 문제가 되는 요소를 반영해 만든 UI 문자열 10개다. 문맥 없는 “Archive”, {placeholder} 보존, 복수형 등을 포함한다. 샘플링 seed와 segment id를 공개했으므로 특정 결과에 유리하게 말뭉치를 골랐다는 의혹도 검증할 수 있다.
심사. 각 후보 번역문은 고정 기준 모델 gpt-5.6-sol이 같은 segment를 번역한 결과와 블라인드로 비교했다. gpt-5.6-sol은 현재 이 블로그 번역에 사용하는 모델이다. 3개 심사 모델군인 claude-sonnet-5, gpt-5.6-luna, gemini-3.1-pro가 독립적으로 점수를 매겼다. 평가 기준은 업계 표준 번역 오류 분류 체계인 MQM에서 가져왔다. 정확성 오류 하나가 아무리 매끄러운 문장보다 중요하도록 우선순위를 정했다.
1. Accuracy mistranslation, omission, addition, hallucination
2. Terminology domain terms as a native engineer would keep them
3. Fluency grammar, natural reading
4. Style register appropriate to the text type
5. Locale numbers, dates, units, punctuation width
6. Markup inline code, placeholders, links preserved exactly
심각도를 구분한 설계는 WMT가 2024년부터 사람 평가에 사용한 프로토콜인 오류 구간 주석의 취지를 따랐으며, 여기서는 LLM 쌍대 비교 심사에 맞게 조정했다. 말뭉치와 reference는 WMT24++ 논문에서 가져왔다. 각 쌍은 제시 순서를 바꿔 두 번 심사했다. 같은 심사 모델이 순서에 따라 모순된 판정을 내리면 동률로 처리했다. 심사 모델별 결과는 동일한 가중치로 평균을 냈으며, 하나의 투표로 합산하지 않았다. 모델군 편향을 확인할 수 있도록 심사 모델별 수치도 공개했다. 별도 실험에서는 frontier급 모델 3개인 gpt-5.6-sol, claude-fable-5, gemini-3.1-pro를 WMT24++의 human reference와 비교했다. Placeholder 보존 여부는 심사 모델이 아니라 script로 평가했다.
언어별 번역 성능이 가장 좋은 모델은?
결론부터 말하면 gpt-5.6-sol은 이 표의 기준 모델일 뿐 아니라 실제 측정 결과에서도 가장 좋았다. 아래 모든 후보를 이 모델과 비교했으며, 50%를 넘긴 언어가 2개 이상인 후보는 없었다. 별도의 human-reference 실험에서도 sol의 번역문은 WMT24++의 전문 post-edit보다 86-100%의 판정에서 선호됐다. 이 실험에 포함된 3개 frontier 모델 중 가장 좋은 결과다. 표의 수치는 동률을 제외하고 3개 심사 모델의 평균을 낸 sol 대비 승률이다. 50%면 동급이다.
| 기준 모델 대비 | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| 언어별 선택 | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
네 가지 결과가 눈에 띈다. 기준 모델은 9개 언어 중 7개에서 확실히 우세했다. 이는 자체 번역 pipeline에 사용할 모델을 고른 이전 블라인드 평가가 맞았음을 사후에 확인해 준다. 한국어는 경쟁이 치열했다. fable-5가 52%로 근소하게 앞섰고, 3.7-flash는 동률이었다. 한국어가 주력 시장이라면 모델 순위가 실제로 달라진다. 중국계 open-weight 모델은 자국어에서도 밀렸다. 중국어 간체에서 Qwen은 26%, GLM은 9%였다. GLM-5.2의 부진은 일반적인 성능 문제가 아니라 과제에 한정된 문제다. 불과 며칠 전 진행한 structured output 연구에서는 같은 모델이 schema keyword 6개를 모두 지켰다. 번역이 강점이 아닐 뿐이다.
어떤 콘텐츠가 여전히 번역하기 어려운가?
콘텐츠 유형별 추천 모델과 가장 강한 대안을 정리했다. 괄호 안은 기준 모델 대비 대안의 승률이고, 전체 중앙값은 8개 후보의 중앙값이다.
| 도메인 | 추천 모델 | 가장 강한 대안 | 전체 중앙값 |
|---|---|---|---|
| 문학 | gemini-3.7-flash (기준 모델 대비 60%) | gpt-5.6-sol | 8% |
| 뉴스 | gpt-5.6-sol | gemini-3.1-pro (48%) | 28% |
| 발화 | gpt-5.6-sol | gemini-3.7-flash (43%) | 25% |
| 소셜 | gpt-5.6-sol | qwen3.8-max (27%) | 12% |
| 기술 문서 | gpt-5.6-sol | fable-5 / 3.7-flash (30%) | 15% |
| UI | 가장 저렴한 모델 (deepseek-v4-flash) | 모든 모델, 대부분 동률 (최고 77%) | 61% |
한 가지 control은 따로 짚어야 한다. 기술 문서 항목은 어떤 모델도 학습할 수 없었던 문단으로 구성했으며, 여기서 Gemini 모델의 하락 폭이 가장 컸다. gemini-3.1-pro는 공개된 WMT 도메인에서 평균 33%를 기록했지만 새 문단에서는 10%였다. 이 격차는 benchmark familiarity로 설명할 수 있지만, 기준 모델이 프로덕션에서 번역하던 기술 문체에 유리했을 가능성도 있다. 따라서 결론을 내리기보다 관찰 결과로만 남긴다.
콘텐츠별 추천은 명확하다. 뉴스, 소셜, 발화, 기술 문서는 기준 모델이 가장 좋다. 특히 소셜 콘텐츠에서 격차가 컸다. 속어와 불완전한 문장, 암시된 문맥 때문에 모든 후보가 고전했고, 8개 중 3개는 10% 미만이었다. 문학 번역만 결과가 달랐다. gemini-3.7-flash가 60%로 기준 모델을 확실히 이겼다. 소설과 비슷한 콘텐츠라면 더 저렴하면서 더 좋은 선택이다. UI 문자열은 판단 기준 자체가 반대다. 버튼 문구처럼 10단어 안팎의 짧은 텍스트는 평가할 차이가 적어 대부분 동률이었다. 9개 모델 모두 {seconds}, %d, {workspace_name}를 빠짐없이 보존했다. 모델별 27개 중 손상은 0건이었다. 품질 차이가 없으면 가격으로 결정하면 된다. UI 문자열은 사용 가능한 모델 중 가장 저렴한 것으로 번역하면 된다. 전형적인 localization 버그인 placeholder 손상은 2026년 기준으로 모델 수준에서 해결된 것으로 보인다.
같은 번역의 모델별 비용은?
100만 출력 자당 $0.26-$104.37였다. 9개 언어의 총지출을 전체 출력량으로 나눈 값이며, 격차는 400배다. 가장 비싼 모델이 가장 좋은 모델도 아니다.
| 모델 | 출력 100만 자당 비용 | 소모한 reasoning token | 승률 범위 |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol (기준 모델) | $13.70 | 0 | 해당 없음 |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
$104는 품질 프리미엄이 아니라 thinking 비용이다. 번역에는 reasoning이 필요하지 않았고, thinking을 0으로 고정할 수 있는 모델은 모두 문제없이 실행됐다. 현재 Gemini 세대는 어떤 비활성화 설정도 거부한다. 그 결과 gemini-3.1-pro는 번역 468개에서 reasoning token 1.17M을 소모했다. 기준 모델보다 7.6배 비싸면서 9개 언어 모두에서 졌다. flash 계열 모델도 token 505K을 추가로 소모해 비용이 기준 모델보다 높아졌다.
가성비 선택도 명확하다. frontier에 가까운 품질이 필요하면 gemini-3.7-flash가 가장 강한 후보다. 9개 언어 중 7개에서 기준 모델 대비 35-52%를 기록했다. 50%가 동급이며, 약점은 중국어 간체 26%와 포르투갈어 8%다. 도메인 기준으로 유일하게 확실한 승리도 거뒀다. 문학에서 60%였다. 측정 비용은 기준 모델보다 6% 이내로 비슷했다. mandatory reasoning 비용이 flash의 가격 이점을 없앴기 때문이다. 비용이 가장 중요하면 deepseek-v4-flash가 기준 모델보다 53배 저렴하고 placeholder도 하나도 손상하지 않았다. 대신 실제 품질을 포기해야 한다. 일본어 승률 0%는 반올림 오차가 아니라 명확한 하한선이다. 내부 콘텐츠라면 감수할 수 있지만 고객에게 노출되는 콘텐츠에는 적합하지 않다.
결국 어떤 모델을 선택해야 하나?
전체 결과는 아래 의사결정 표로 정리할 수 있다.
| 최적화 대상 | 선택 | 근거 |
|---|---|---|
| 여러 언어에서 가장 좋은 평균 품질 | gpt-5.6-sol | 모든 후보를 상대로 9개 언어 중 7개에서 우세 |
| 한국어 | claude-fable-5, 비용을 줄이려면 3.7-flash | 기준 모델 대비 52%, 후보가 이긴 유일한 언어. flash는 동률 (50%) |
| 이탈리아어 | gemini-3.7-flash | 기준 모델과 같은 가격에 기준 모델 대비 52% |
| 문학 또는 소설형 콘텐츠 | gemini-3.7-flash | 기준 모델 대비 60%, 확실히 이긴 유일한 도메인 |
| 뉴스, 소셜, 발화, 기술 문서 | 기준 모델 | 이 도메인들에서 48%를 넘긴 후보가 없음 |
| UI 문자열 | deepseek-v4-flash | 모델 간 판정이 동률이고 모든 모델에서 placeholder가 안전하므로 $0.26 모델이 가격에서 승리 |
| 100만 자당 $4 미만의 저비용 다국어 번역 | qwen3.8-max | $4 미만 모델 중 9개 언어 모두에서 승률이 가장 높음 |
| 비용을 최소화해야 하는 내부 콘텐츠 | deepseek-v4-flash | 100만 자당 $0.26로 기준 모델보다 53배 저렴. CJK 품질 차이는 감수해야 함 |
| 번역에 사용하면 안 되는 모델 | gemini-3.1-pro, glm-5.2 | 비활성화할 수 없는 thinking으로 비용이 7.6배 증가. 특정 과제에서 품질 급락 |
이제 LLM이 사람 번역가보다 나은가?
3개 frontier 모델 모두 9개 언어에서 WMT24++의 human post-edit reference보다 83-100%의 판정에서 더 선호됐다. 예외는 중국어 간체의 claude-fable-5로 44%였다. 이 수치는 두 가지로 해석해야 한다. 강한 해석은 WMT24++ 저자들이 다룬 55개 언어 모두에서 LLM이 현재 최고의 기계번역 시스템이라고 결론 내렸고, 이번 패널도 같은 결과를 냈다는 것이다. 신중한 해석은 LLM 심사 모델과 LLM 번역 모델이 문체 선호를 공유할 수 있다는 것이다. 유창하게 다듬어진 기계 번역문은 다른 모델이 정확히 선호하는 문체일 수 있다. reference도 문학적 완성본이 아니라 post-edit다. 이 수치로 안전하게 말할 수 있는 범위는 frontier 기계번역이 우리가 구성할 수 있는 어떤 자동화 패널에서도 전문 번역가의 reference 품질과 구분되지 않는다는 점이다. 따라서 더 흥미로운 문제는 가격이며, 그 차이는 자릿수가 달라질 정도로 크다.
LLM 심사 모델은 실제로 얼마나 불안정한가?
아무런 보정 없이 한 번만 심사하는 방식은 쓸 수 없을 만큼 불안정하지만, 보정 비용은 낮다. 같은 쌍의 순서를 바꿔 두 번 제시했을 때 승리와 패배가 완전히 뒤집힌 비율은 claude-sonnet-5가 9%, gemini-3.1-pro가 13%, gpt-5.6-luna가 19%였다. 이 프로토콜에서는 이런 모순을 모두 동률로 처리했다. 따라서 position bias가 누적되지 않고 상쇄된다. 합산 수치와 함께 심사 모델별 승률도 공개해 특정 모델군 하나가 결론을 좌우하는지 확인할 수 있다. 세 모델군은 일부 구간에서 격차의 크기를 다르게 평가했다. sonnet-5는 같은 Claude 계열 모델을 가장 엄격하게 평가했다. 하지만 9개 언어 모두에서 우열의 방향은 일치했다. 결론은 이 일관성에 기반한다.
FAQ
번역에는 어떤 LLM을 써야 하나?
다국어 번역의 기본 선택은 gpt-5.6-sol이다. 블라인드 판정 8,455건에서 모든 후보를 상대로 9개 언어 중 7개를 지켰다. 같은 가격에 frontier에 가까운 품질이 필요하면 한국어에서 동률이고 이탈리아어에서 우세한 gemini-3.7-flash가 적합하다. 비용이 가장 중요한 대량 내부 번역은 100만 자당 $0.26인 deepseek-v4-flash를 선택할 수 있다. 단, CJK 언어에서는 실제 품질 차이를 감수해야 한다.
LLM이 사람 번역가보다 나은가?
이번 실험의 9개 언어에서 자동 심사 모델은 frontier LLM 번역문을 human post-edit reference보다 83-100%의 비율로 선호했다. WMT24++의 자체 결과와도 일치한다. 이 주장은 reference 수준의 post-edit와 machine judge에 한정된다. 편집 의도가 반영된 문학 번역은 포함하지 않으며, LLM 심사 모델이 LLM 번역 모델과 문체 선호를 공유할 가능성도 있다.
번역에 reasoning 모델을 사용해야 하나?
아니다. 이번 데이터에서 thinking은 번역 품질에 도움이 되지 않았다. 비활성화할 수 없는 모델은 비용만 늘었다. gemini-3.1-pro는 짧은 번역 468개에서 reasoning token 1.17M을 소모했다. 기준 모델보다 비용은 7.6배 높으면서 모든 언어에서 졌다. 번역 workload에서는 reasoning_effort를 none 또는 해당 모델의 비활성화 값으로 고정해야 한다.
2026-08-26부터 2026-08-29까지 Synthorai gateway를 통해 측정했다. 9개 모델, 9개 언어, 6개 도메인의 segment 52개, 번역 4,210개, MQM 기반 평가 기준과 순서 교체 방식을 적용한 3개 심사 모델군의 블라인드 쌍대 비교 판정 8,455건이다. 말뭉치, 코드, 모든 원시 판정은 공개 저장소에 있다. 절대 수치는 단일 batch에서 나온 결과이므로 특정 항목에 의존하기 전에 다시 측정해야 한다.
같은 시리즈의 관련 글: 언어별 가장 저렴한 LLM, 13개 모델의 thinking 제어 방식, structured output 측정 결과, Gemini 3.7 Flash 비용.