🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.
음성 텍스트 변환 API 비용: 같은 오디오로 7개 모델 비교

음성 텍스트 변환 API 비용: 같은 오디오로 7개 모델 비교

목차
  1. 이 테스트가 측정하는 것과 측정하지 않는 것
  2. Multimodal이 아닌 전용 ASR
  3. 음성 텍스트 변환 과금 방식
  4. 비용
  5. 정확도와 언어 지원 범위
  6. Streaming 출력
  7. Caching
  8. 먼저 확인할 항목과 직접 테스트할 항목
  9. 결론
  10. 출처

이제 Synthorai에서 오디오를 텍스트로 변환할 수 있다. 하나의 OpenAI 호환 endpoint 뒤에서 7개 전용 음성 텍스트 변환 모델을 제공한다.

이 하나의 endpoint가 상당한 통합 작업을 대신한다. 각 모델의 native API는 공통점이 거의 없다. whisper-1은 multipart 파일을 업로드하면 {text}를 반환한다. gpt-4o-transcribe도 같은 업로드 방식을 쓰지만 token 사용량이 추가된다. ByteDance의 seed-asr는 BytePlus AUC protocol을 사용하고, Alibaba의 qwen3-asr-flash는 자체 protocol을 쓴다. Google의 chirp 모델은 OAuth로 접근하는 Cloud Speech-to-Text recognizer다.

Endpoint도, 인증도, 응답 형식도 달라서 모델마다 별도 통합이 필요하다. 게이트웨이를 사용하면 OpenAI 호환 호출 하나로 끝난다. gpt-4o-mini-transcribeseed-asr-bigmodel이나 chirp-3로 바꿔도 나머지 코드는 그대로다.

TL;DR

  • 7개 전용 모델의 음성 텍스트 변환 비용은 최대 8배 차이가 난다. 오디오 1분당 seed-asr-bigmodel은 $0.0020, chirp 모델은 $0.0164다. 측정일은 2026-06-25다.
  • seed-asr는 언어를 자동 감지하지 못한다. language를 지정하지 않으면 영어와 중국어 외의 오디오에 HTTP 200을 반환하면서 텍스트는 비어 있거나 로마자로 잘못 표기되며, 비용도 그대로 청구된다.
  • qwen3-asr-flash는 분당 $0.0021로, 테스트한 모든 언어를 자동 감지하는 모델 중 가장 저렴하다.
  • token 단위 streaming은 gpt-4o 음성 텍스트 변환 모델만 지원한다. 분당 과금 모델은 모두 batch 전용이다.
  • 모든 모델이 깨끗한 영어, 스페인어, 프랑스어 음성에서 약 0%의 오류율을 기록했다. 정확도는 모델 선택 기준이 아니다.

OpenAI 호환 음성 텍스트 변환 endpoint를 사용하므로, 이미 Whisper를 쓰고 있다면 그대로 교체할 수 있다.

curl https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 \
  -F model=gpt-4o-mini-transcribe
from openai import OpenAI

client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")

with open("meeting.mp3", "rb") as f:
    result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)

print(result.text)

변환된 텍스트는 text에 담기고, 청구 비용은 x-total-cost-usd 응답 header에서 확인할 수 있다.

같은 간단한 테스트를 7개 모델에 모두 적용했다. 아래 수치는 모두 이 테스트의 조건을 전제로 한다.


이 테스트가 측정하는 것과 측정하지 않는 것

세계에서 가장 많이 쓰이는 5개 언어별로 일반적인 text-to-speech 음성을 사용해 일상적인 글을 생성했다. 고유명사는 넣지 않았고, 아침이나 날씨, 시장에 다녀오는 이야기처럼 평범한 내용으로 구성했다. 각 clip을 7개 모델로 변환했다. Clip 길이는 약 12초에서 15초이며, 긴 침묵 없이 일반적인 속도로 말한 약 40단어 분량이다. 오디오는 16 kHz mono 16-bit PCM WAV로 encoding했다. Bitrate는 256 kbps이며 1분당 약 2 MB다. 원문 text를 정답으로 사용했고, 재생 시간도 정확히 측정했다.

의도적으로 쉬운 조건이다. Accent나 noise, 전문 용어가 없는 script 기반의 단일 화자 오디오다. 따라서 오디오 난이도와 무관한 항목을 측정하기에 적합하다. 비용과 latency, 지원 언어, streaming 가능 여부를 측정하며, 이 항목들은 조건이 달라도 안정적으로 유지된다.

품질 benchmark는 아니다. Accent, 배경 noise, 분야별 용어, 화자 간 발화 중첩이 있고 재생 시간이 1시간인 실제 녹음에서는 깨끗한 음성에서 드러나지 않던 모델 간 차이가 나타난다. 이 테스트로 그런 차이를 예측할 수는 없다. 정확도 수치는 최소 성능 확인용이지 순위가 아니다. 비용과 언어 지원 범위, streaming 결과는 신뢰할 수 있는 기준값으로 보면 된다.

Multimodal이 아닌 전용 ASR

여기서 다루는 7개 모델은 모두 전용 음성 텍스트 변환 시스템이다. OpenAI의 whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe, ByteDance의 seed-asr-bigmodel, Alibaba의 qwen3-asr-flash, Google의 chirp-2chirp-3다.

게이트웨이에서는 음성 텍스트 변환 endpoint를 Gemini 같은 범용 multimodal 모델로 연결할 수도 있다. 이런 모델은 오디오를 이해하는 과정에서 텍스트도 생성한다. 이번 비교에서는 제외했으며, 음성 텍스트 변환 용도로도 권장하지 않는다. Google도 자사 제품군을 같은 방식으로 구분한다. Gemini 오디오 가이드에서는 Gemini를 오디오 설명, 요약, 질의응답에 사용하는 방법을 안내한 뒤, 텍스트 변환 자체에는 다른 제품을 사용하라고 명시한다. “실시간 음성 텍스트 변환을 지원하는 전용 speech-to-text 모델이 필요하다면 Google Cloud Speech-to-Text API를 사용해야 한다”는 설명이며, 여기서 말하는 모델이 Chirp다. Multimodal 모델도 텍스트를 생성할 수 있지만, 발화 내용을 그대로 옮기기보다는 오디오를 이해하도록 만들어졌다. 호출 방식도 음성 텍스트 변환 API가 아니라 chat 형식의 generateContent다. 발화를 그대로 옮기는 용도에는 전용 모델이 적합하며, 두 종류의 모델을 모두 제공하는 vendor도 같은 입장이다.

오디오를 보내는 방식은 3가지다.

  • 파일 입력, batch 출력: 녹음 파일 전체를 업로드하고, 전체 변환 결과를 한 번의 응답으로 받는다. 모든 모델이 지원한다.
  • 파일 입력, text streaming 출력: 같은 방식으로 파일을 업로드하지만, 생성되는 텍스트를 SSE로 순차 수신한다. 일부 모델만 지원하며 나머지는 batch 전용이다.
  • 오디오 stream 입력, text stream 출력: live mic나 통화를 실시간으로 인식한다. 현재 개발 중이며 아직 사용할 수 없다. 아래에서는 앞의 두 방식만 다룬다.

음성 텍스트 변환 과금 방식

과금 방식은 2가지다. 오디오 분당 과금whisper-1, seed-asr, qwen3-asr-flash, Chirp 모델에 적용된다. 녹음 내용과 관계없이 실제 재생 시간만큼 비용을 낸다. Token당 과금gpt-4o 모델에 적용된다. 오디오가 일정한 비율로 token화되며, input token과 변환된 text의 output token에 대해 비용을 낸다. 따라서 발화가 빽빽한 오디오보다 침묵이 많은 오디오가 저렴하다.

Token당 과금에는 주의할 점이 있다. 공개된 input 요율은 text 기준이지만 오디오는 더 비싸게 청구된다. 예를 들어 gpt-4o-mini-transcribe의 표기된 input 가격은 $1.25/M이지만 오디오는 $3/M으로 과금된다. Text 요율로 계산하면 실제 비용보다 낮게 추정된다. 게이트웨이는 실제 청구액을 x-total-cost-usd header로 반환하므로 가격표를 보고 추측하지 말고 이 값을 확인해야 한다.

비용

이 테스트에서 가장 명확하게 측정되면서 모델별 차이도 가장 큰 항목이다. 아래는 청구 header를 기준으로 계산한 분당 비용이다. 게이트웨이에서 제공하는 모든 모델의 현재 가격은 모델 페이지에서 확인할 수 있다.

모델비용 / 분LatencyStreaming
seed-asr-bigmodel$0.0020≈10s미지원
qwen3-asr-flash$0.0021≈3s미지원
gpt-4o-mini-transcribe$0.0031≈3stoken 단위
whisper-1$0.0060≈4s미지원
gpt-4o-transcribe$0.0062≈2stoken 단위
chirp-2$0.0164≈3s미지원
chirp-3$0.0164≈4s미지원

분당 $0.0020인 seed-asr부터 $0.0164인 Chirp 모델까지 약 8배 차이가 난다. 가장 저렴한 seed-asr는 오디오 언어를 직접 지정해야 한다. 자세한 내용은 아래에서 설명한다. 언어를 미리 알고 있다면 가장 저렴한 선택이다. 여러 언어가 섞였거나 언어를 알 수 없는 오디오에 별도 설정 없이 사용할 수 있는 가장 저렴한 모델은 $0.0021인 qwen3-asr-flash다. Chirp 모델은 다른 모델보다 훨씬 비싸다. Chirp를 사용한다면 chirp-3를 선택하는 편이 낫다. chirp-2와 가격과 속도는 같지만, 정확도 표에서 보듯 중국어 음성 텍스트 변환 성능이 훨씬 좋다.

실제 파일에서 비용이 달라지는 방식은 과금 구조에 따라 다르다. 분당 과금 모델인 whisper-1, seed-asr, qwen3-asr-flash, Chirp는 재생 시간만으로 과금되므로 이 요율을 그대로 적용할 수 있다. 형식이나 내용에 관계없이 10분짜리 오디오는 분당 요율의 10배가 든다.

Token당 과금 모델인 gpt-4o 계열은 파일 크기가 아닌 재생 시간에 따라 input 비용이 증가한다. Provider가 token화 전에 오디오를 resampling하기 때문이다. 같은 내용을 담은 320 kbps MP3와 이 테스트에서 사용한 가벼운 16 kHz WAV는 token 비용이 거의 같다. 파일 압축은 저장 공간을 줄여 주지만 음성 텍스트 변환 비용은 줄이지 못한다. Token당 비용에 영향을 주는 것은 실제 발화량이다. 테스트 clip에는 긴 침묵이 없고 보통 속도의 발화가 들어 있으므로, 발화 밀도가 더 높거나 낮은 오디오는 output token 비용이 약간 늘거나 줄 수 있다. 어떤 경우든 x-total-cost-usd header가 실제 비용이다.

정확도와 언어 지원 범위

영어, 스페인어, 프랑스어에서는 해당 언어를 지원하는 모든 모델이 약 0%의 오류율을 기록했다. 최소 기준은 모두 통과했다. 이처럼 쉬운 테스트에서도 중국어와 힌디어에서는 차이가 나타나기 시작한다. 다만 아래 결과는 어떤 모델이 더 낫다는 결론이 아니라, 자체 테스트에서 어떤 언어를 더 집중적으로 확인해야 하는지 보여 주는 참고 자료다.

모델중국어 (CER)힌디어 (WER)지원 범위
seed-asr-bigmodel0%9%5개 언어 모두 지원, language 명시 필요
qwen3-asr-flash0%15%5개 언어 모두 지원
gpt-4o-mini-transcribe0%4%5개 언어 모두 지원
whisper-10%22%5개 언어 모두 지원
gpt-4o-transcribe0%13%5개 언어 모두 지원
chirp-216%15%5개 언어 모두 지원
chirp-32%15%5개 언어 모두 지원

여기서 중요한 사실은 언어 지원 범위가 아니라 감지 여부다. language parameter를 전달하면 seed-asr는 5개 언어를 모두 변환했으며, 후속 테스트에서도 일본어, 독일어, 이탈리아어, 한국어를 처리했다. 하지만 언어를 자체적으로 감지하지는 못한다. language를 지정하지 않으면 영어와 중국어 외의 언어는 빈 문자열이나 로마자로 표기된 무의미한 text로 반환된다. 상태 code는 200이며 오류도 발생하지 않는다. 나머지 6개 모델은 언어를 자동 감지한다. 실제로 중요한 결과는 이 조용한 실패 방식이다. 명확하게 오류를 내는 모델은 번거롭지만, 아무 표시 없이 실패하는 모델은 production incident를 일으킨다.

힌디어에서 나타난 차이와 중국어에서의 오류는 더 어려운 언어를 신뢰하기 전에 해당 모델을 직접 테스트할 필요가 있음을 보여 준다. 특히 chirp-2의 중국어 CER은 16%였고, chirp-3에서는 이 문제가 개선됐다. 그렇다고 어느 모델이 다른 모델보다 낫다는 뜻은 아니다. 절대 수치는 합성 음성과 평가 방식의 영향을 크게 받으며 실행할 때마다 달라진다. 깨끗한 주요 언어 음성에서는 정확도로 모델 간 차이를 구분하기 어렵다. 따라서 이 테스트만으로 정확도 기준의 모델 선택을 권할 수 없다.

Streaming 출력

변환 결과를 streaming할 수 있는지는 품질이 아니라 기능 차이다. 이 기능을 기준으로 모델군이 나뉜다. 분당 과금 모델인 whisper-1, seed-asr, qwen3-asr-flash, 두 Chirp 모델은 batch 전용이다. 이 모델에 streaming을 요청하면 게이트웨이는 400을 반환한다. gpt-4o 모델은 token 단위로 streaming한다. gpt-4o-transcribe는 약 1초 만에 첫 단어를 반환한 뒤 나머지를 계속 채운다. 실시간처럼 보이는 UI에 필요한 동작이다. 비용은 batch와 같다. Streaming하려면 stream=true를 추가한다.

curl -N https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...

Caching

이 모델들에는 사실상 caching이 없다. 분당 과금 모델은 재생 시간을 기준으로 비용이 발생하므로 같은 오디오를 반복해도 할인되지 않는다. 같은 clip을 whisper-1에 5번 전송했고, 매번 동일하게 $0.015478이 청구됐다. Token 기준으로 과금되는 gpt-4o 모델에는 cache 요율이 없으며, 반복 실행에서도 일반적인 실행 간 편차만 나타났다. 따라서 분당 요율을 기준으로 비용을 계획해야 한다. 같은 파일을 다시 보내도 저렴해지지 않는다.

먼저 확인할 항목과 직접 테스트할 항목

이 테스트만으로 실제 녹음에서 어떤 모델이 가장 정확한지는 알 수 없다. 다만 자체 평가를 시작하기 전에 무엇을 기준으로 후보를 걸러야 하는지는 알 수 있다.

  • 언어. 필요한 모든 언어를 모델이 지원하는지, 언어를 자체 감지하는지 확인해야 한다. seed-asr는 테스트한 모든 언어를 처리했지만 language parameter를 명시해야 했다. 지정하지 않으면 영어와 중국어 외의 오디오에서 아무 오류 없이 실패한다. 나머지 6개 모델은 자동 감지하므로 언어가 섞였거나 알려지지 않은 오디오에 더 안전한 기본값이다.
  • Streaming. 실시간 변환 결과가 필요하다면 gpt-4o 모델만 token 단위 streaming을 지원한다. 분당 과금 모델은 batch 전용이다.
  • 비용. 모델별로 약 8배 차이가 난다. 모든 언어를 지원하는 가장 저렴한 모델은 $0.0021인 qwen3-asr-flash다. Chirp가 가장 비싸며, 더 저렴한 모델 대신 Chirp를 선택할 이유가 있다면 chirp-3뿐이다. Caching으로 비용을 줄일 수도 없으므로 실제 지불액은 분당 요율 그대로다.
  • 모델 유형. 범용 multimodal 모델이 아니라 전용 음성 텍스트 변환 모델을 사용해야 한다. 발화를 그대로 옮기는 작업에는 전용 모델이 적합하며, 두 유형을 모두 제공하는 vendor도 이를 권장한다.

이 기준을 통과한 모델이 몇 개 남으면, 각 모델이 accent와 noise, 고유한 vocabulary가 포함된 실제 오디오에서 얼마나 정확한지를 직접 확인해야 한다. 깨끗한 음성 benchmark로는 실제 녹음에 후보 모델을 적용하는 평가를 대신할 수 없다.

결론

주요 언어의 깨끗한 script 기반 음성에서는 7개 모델의 정확도가 거의 같았다. 이것이 이 테스트의 가장 유용한 결론이다. 정확도는 모델을 선택할 기준이 아니다. 명확하게 확인할 수 있고 실제 차이가 큰 기준은 비용과 기본 기능이다. 비용은 약 8배 차이가 나고, 한 모델은 2개 언어만 자동으로 처리하며, 분당 과금 모델은 streaming할 수 없다. 이 기준으로 후보를 좁히되 하나의 우승 모델을 정하지는 말아야 한다. 남은 2개나 3개 모델을 실제 오디오로 테스트하면 된다. 범용 multimodal 모델 대신 전용 음성 텍스트 변환 모델을 사용해야 한다. 두 유형을 모두 만드는 vendor도 이를 권장한다.


출처

비용과 latency는 2026-06-25에 Synthorai에서 7개 전용 음성 텍스트 변환 모델과 5개 언어, 영어, 중국어, 힌디어, 스페인어, 프랑스어를 대상으로 측정했다. 비용은 x-total-cost-usd header, latency는 SSE timing을 기준으로 했다. seed-asr의 언어별 결과는 2026-07-04에 language parameter를 지정해 다시 측정한 값이다. 오디오는 text-to-speech로 생성했으며 의도적으로 쉬운 조건이었다. 따라서 정확도 수치는 품질 benchmark가 아니라 최소 성능 확인용이다. Accent와 noise가 포함된 실제 음성에서는 모델 간 차이가 다르게 나타날 수 있다. Latency는 실행할 때마다 달라진다. 표기 가격은 해당 날짜 기준으로 이 platform에 적용된 요율이다. 가격에 의존하기 전에 현재 요율을 확인해야 한다.

← 블로그로 돌아가기