🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.
음성-텍스트 변환 API 14종 비교: 분당 $0.002부터 $0.016까지

음성-텍스트 변환 API 14종 비교: 분당 $0.002부터 $0.016까지

목차
  1. 2026년 음성-텍스트 변환 API 비용은 얼마인가?
  2. Token 과금 비용을 분당 요금으로 환산하면 얼마인가?
  3. 중국 ASR 모델군은 무엇이며, 왜 대부분의 비교에서 빠지는가?
  4. 워크로드에 맞는 모델은 어떻게 고르는가?
  5. 자주 묻는 질문

음성-텍스트 변환 API의 정가 기준 비용은 분당 $0.002에서 $0.016까지다. 같은 작업처럼 보여도 가격 차이는 8배에 달하며, 대부분의 비교 글에서는 최저가 모델군을 다루지 않는다. 이 게이트웨이에서는 OpenAI의 token 과금 방식 gpt-4o 제품군부터 해외 비교에서 자주 빠지는 중국 ASR 모델군(ByteDance, Alibaba)까지 총 14개 음성 변환 모델을 제공한다. 이 글에서는 과금 방식별 차이, 각 모델의 분당 요금, 브랜드가 아닌 사용 시나리오를 기준으로 모델을 고르는 방법을 정리한다.

TL;DR

  • 14개 모델의 분당 정가는 $0.002(seed-asr, paraformer, fun-asr-realtime)부터 $0.016(Google Chirp)까지로, 최대 8배 차이가 난다.
  • OpenAI의 gpt-4o 음성 변환 모델은 분이 아니라 token 단위로 과금된다. 테스트한 오디오를 기준으로 환산하면 mini는 약 $0.0031/min, full은 약 $0.0062/min이었다.
  • 가장 저렴한 모델군은 중국 ASR이다. ByteDance seed-asr와 Alibaba의 paraformer, fun-asr, qwen3 제품군은 모두 $0.002-$0.0021/min이며 streaming 모델도 제공한다.
  • 깨끗한 음성에서는 정확도가 변별 요소가 아니었다. 7개 모델을 테스트한 결과, 해당 언어를 지원하는 모든 모델이 영어, 스페인어, 프랑스어에서 약 0%의 오류율을 기록했다.

2026년 음성-텍스트 변환 API 비용은 얼마인가?

정확히 답하려면 표로 봐야 한다. 요금 자체만큼 과금 방식도 중요하기 때문이다. 분당 과금 모델은 내용과 상관없이 오디오 길이에 따라 비용이 결정된다. token 과금 모델은 오디오를 resampling한 뒤 입력 및 출력 token을 기준으로 과금하므로, 실제 분당 비용은 발화 밀도에 따라 조금씩 달라진다.

모델제공사과금 방식정가Streaming
seed-asr-bigmodelByteDance분당$0.002/min미지원
paraformer-realtime-v2Alibaba분당$0.002/min지원
qwen3-asr-flash-realtimeAlibaba분당$0.002/min지원
fun-asr-realtimeAlibaba분당$0.002/min지원
fun-asrAlibaba분당$0.0021/min미지원
fun-asr-flashAlibaba분당$0.0021/min미지원
fun-asr-mtlAlibaba분당$0.0021/min미지원
qwen3-asr-flashAlibaba분당$0.0021/min미지원
gpt-4o-mini-transcribeOpenAItoken당실측 약 $0.0031/mintoken 단위
whisper-1OpenAI분당$0.006/min미지원
gpt-4o-transcribeOpenAItoken당실측 약 $0.0062/mintoken 단위
gpt-4o-transcribe-diarizeOpenAItoken당token 요금token 단위
chirp-2Google분당$0.016/min미지원
chirp-3Google분당$0.016/min미지원

각 모델 페이지에는 현재 정가가 반영되어 있다. gpt-4o 모델 2개의 약 ≈$/min 수치는 7개 모델 음성 변환 비교에서 다국어 테스트 오디오를 게이트웨이로 처리했을 때 실제로 청구된 금액이다. 위 batch 모델은 API key 하나로 동일한 OpenAI 호환 /v1/audio/transcriptions endpoint에서 호출할 수 있다. diarize 모델도 이 endpoint에서 동작하는 것을 확인했다. -realtime 모델은 별도 interface를 사용하는 streaming 모델이며, 자세한 내용은 각 모델 페이지에서 확인할 수 있다.

Token 과금 비용을 분당 요금으로 환산하면 얼마인가?

Token 과금 방식의 음성 변환 비용은 파일 크기가 아니라 발화 내용에 따라 달라지며, 실제로는 전체 가격대의 중간쯤에 위치한다. gpt-4o 음성 변환 모델은 tokenization 전에 오디오를 resampling한다. 따라서 같은 내용이라면 용량이 큰 320 kbps MP3와 가벼운 16 kHz WAV의 비용은 거의 같다. 파일을 압축하면 저장 공간은 줄어들지만 음성 변환 비용은 줄지 않는다. 일반적인 발화 속도의 음성을 측정한 결과, gpt-4o-mini-transcribe는 약 $0.0031/min, gpt-4o-transcribe는 약 $0.0062/min이었다. 발화 밀도가 높거나 무음 구간이 많으면 비용은 조금씩 달라진다. 오디오 1시간당 비용의 상한을 확정해야 한다면 분당 과금 모델이 적합하다. Token 과금 모델로는 예상치만 산정할 수 있다.

중국 ASR 모델군은 무엇이며, 왜 대부분의 비교에서 빠지는가?

표에서 가장 저렴하면서 streaming 모델이 가장 많은 구간은 중국 ASR이지만, 영어권의 비교 글에서는 대부분 테스트 대상에 포함되지 않는다. ByteDance의 seed-asr-bigmodel은 $0.002/min으로 전체 최저가다. Alibaba는 세 가지 제품군을 제공한다. paraformer는 streaming 중심이며, fun-asr는 batch, flash, 다국어 mtl, realtime 모델로 구성된다. qwen3-asr는 flash와 flash-realtime 모델을 제공한다. 모두 $0.002-$0.0021/min이다. whisper-1 요금의 3분의 1, Chirp 요금의 8분의 1 수준이다.

실측 결과에서 확인한 두 가지 제약도 고려해야 한다. 첫째, seed-asr는 오디오 언어를 미리 지정해야 한다. 언어를 알고 있다면 가장 유리하지만, 테스트한 모든 언어를 자동 감지한 모델 중 최저가는 $0.0021인 qwen3-asr-flash였다. 둘째, 저렴하다고 느린 것은 아니다. qwen3-asr-flash는 테스트 clip을 약 3초 만에 처리했으며, OpenAI 모델과 비슷한 수준이었다. 중국어 비중이 높은 워크로드라면 이 모델군은 더 저렴할 뿐 아니라 해당 언어에 특화된 선택지이기도 하다.

워크로드에 맞는 모델은 어떻게 고르는가?

먼저 과금 방식과 streaming 필요 여부를 기준으로 고르면 된다. 깨끗한 음성에서는 정확도로 이 모델들을 구분하기 어렵다. 시나리오별 추천 모델은 다음과 같다.

시나리오추천이유
언어를 아는 batch 음성 변환seed-asr-bigmodel최저가인 $0.002/min, 언어 지정 필요
언어가 섞여 있거나 알 수 없는 batch 처리qwen3-asr-flash자동 감지 모델 중 최저가, 지연 시간 약 3초
실시간 자막 또는 받아쓰기paraformer-realtime-v2 또는 qwen3-asr-flash-realtime최저가인 $0.002에서 streaming 지원
OpenAI 방식의 부분 텍스트 streaminggpt-4o-mini-transcribetoken 단위 출력, 약 $0.0031/min
화자 구분 필요gpt-4o-transcribe-diarize이 목록에서 화자 분리를 지원하는 유일한 모델
whisper를 그대로 교체whisper-1$0.006/min의 호환성 기준 모델

작업 목적이 음성 변환이 아니라 양방향 음성 대화라면 제품 유형과 비용 구조가 다르다. 음성 간 변환 비용은 GPT Realtime 요금 비교에서 확인할 수 있다.

자주 묻는 질문

Whisper API 비용은 얼마인가?

whisper-1의 정가는 오디오 분당 $0.006이며, 내용과 관계없이 길이만으로 과금된다. 1시간짜리 파일은 형식이나 bitrate에 관계없이 $0.36이다. 같은 내용을 반복 처리해도 할인되지 않는다. 동일한 clip을 5번 다시 전송했지만 매번 같은 금액이 청구됐다. 현재는 표에 있는 모델의 절반이 whisper-1보다 저렴하다. 중국 ASR 모델군은 $0.002-$0.0021/min으로 whisper 요금의 3분의 1 수준이며, gpt-4o-mini-transcribe의 실측 비용은 약 절반이었다.

더 비싼 음성-텍스트 변환 모델이 더 정확한가?

깨끗한 음성에서는 그렇지 않다. 7개 모델을 테스트한 결과, 해당 언어를 지원하는 모든 모델이 영어, 스페인어, 프랑스어에서 약 0%의 오류율을 기록했다. 실질적인 차이는 비용, streaming, 지원 언어, 화자 분리 같은 기능에서 발생한다. 억양, 소음, code-switching이 포함된 어려운 오디오는 직접 sample을 테스트해야 한다. 음성 변환 비교에서는 테스트 중 어떤 지점부터 문제가 나타났는지 확인할 수 있다. 이번 테스트에서는 중국어와 힌디어에서 먼저 차이가 드러났다.

어떤 음성-텍스트 변환 API가 streaming을 지원하는가?

두 가지 방식이 있다. gpt-4o 음성 변환 모델은 OpenAI API 형식에서 텍스트를 token 단위로 streaming한다. Alibaba realtime 제품군(paraformer-realtime-v2, qwen3-asr-flash-realtime, fun-asr-realtime)은 $0.002/min부터 시작하는 분당 요금으로 streaming을 제공한다. whisper-1, seed-asr, Chirp 모델은 완성된 변환 결과만 반환한다.

14개 모델 모두 통합 과금 방식의 동일한 gateway endpoint에서 실행된다. 각 모델의 현재 정가는 실시간 모델 페이지에서 확인할 수 있다. 지연 시간과 정확도를 포함한 7개 모델의 실측 비교는 음성 변환 비용 비교에 정리되어 있다.

← 블로그로 돌아가기