語音轉文字 API 成本:用同一組音訊實測 7 個模型
Synthorai 現已支援語音轉文字,透過單一 OpenAI 相容端點提供 7 個專用模型。
這個端點封裝了大量整合工作,因為這些模型原生介面幾乎完全不同。whisper-1 接收 multipart 檔案上傳,並回傳 {text}。gpt-4o-transcribe 採用相同的上傳方式,但多了 token 用量資訊。ByteDance 的 seed-asr 使用 BytePlus AUC 協定,Alibaba 的 qwen3-asr-flash 有自己的協定,Google 的 chirp 模型則是透過 OAuth 存取 Cloud Speech-to-Text 辨識器。
不同端點、不同驗證方式、不同回應格式,每個模型都得另外整合一次。透過閘道,只需要呼叫同一個 OpenAI 相容端點:把 gpt-4o-mini-transcribe 換成 seed-asr-bigmodel 或 chirp-3,其他程式碼完全不用改。
TL;DR
- 7 個專用模型的語音轉文字成本相差 8 倍:
seed-asr-bigmodel每音訊分鐘 $0.0020,chirp模型則為 $0.0164(測量日期為 2026-06-25)。 seed-asr不支援語言自動偵測:未設定language時,英文與中文以外的音訊會回傳 HTTP 200,但文字內容為空白或羅馬拼音亂碼,而且仍會計費。qwen3-asr-flash每分鐘 $0.0021,是測試中能自動偵測所有語言的最便宜模型。- 只有
gpt-4o語音轉文字模型能逐 token 串流輸出;按分鐘計費的模型都只支援批次處理。 - 所有模型在清晰的英文、西班牙文與法文語音上,錯誤率都約為 0%:準確度不是選型時的主要差異。
這裡呼叫的是 OpenAI 相容的語音轉文字端點。如果你已經在使用 Whisper,可以直接替換:
curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 \
-F model=gpt-4o-mini-transcribe
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
with open("meeting.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)
print(result.text)
轉錄結果會放在 text,實際計費金額則位於回應標頭 x-total-cost-usd。
我們用同一套簡單測試跑過全部 7 個模型。以下所有數據,都必須放在這套測試的條件下解讀。
這項測試涵蓋什麼,又不涵蓋什麼
我們用全球使用人口最多的 5 種語言,各自透過標準文字轉語音聲線產生沒有專有名詞的日常短文,內容包括早晨、天氣和去市場等,再交給全部 7 個模型進行語音轉文字。每段音訊約 12 到 15 秒,以正常語速朗讀約 40 個字詞,沒有長時間停頓。音訊格式為 16 kHz、單聲道、16-bit PCM WAV(256 kbps,每分鐘約 2 MB)。原始文字就是標準答案,音訊長度則採用精確值。
這是刻意設計得很簡單的測試:音訊清晰、內容照稿朗讀、只有單一說話者,也沒有口音、雜音或術語。這種條件適合衡量不受音訊難度影響的項目,包括成本、延遲、模型是否支援特定語言,以及能否串流輸出。這些結果相對穩定。
這不是品質評測。真實錄音會有口音、背景雜音、領域詞彙、多人同時說話,長度也可能超過一小時。這些條件會讓模型呈現出清晰語音測試看不出的差異,而本文結果無法預測那些差異。準確度數字只能視為基本門檻檢查,不能用來排名;成本、語言涵蓋範圍與串流能力,才是可以直接採用的基準。
專用 ASR,不是多模態模型
本文測試的 7 個模型都是專用語音轉文字系統:OpenAI 的 whisper-1、gpt-4o-transcribe 和 gpt-4o-mini-transcribe;ByteDance 的 seed-asr-bigmodel;Alibaba 的 qwen3-asr-flash;以及 Google 的 chirp-2 和 chirp-3。
閘道也能讓語音轉文字端點使用 Gemini 之類的通用多模態模型。這類模型理解音訊時,也能順便產生逐字稿。但我們沒有納入測試,也不建議用它們處理語音轉文字。Google 對自家產品的建議也相同:Gemini 音訊指南將 Gemini 定位為描述、摘要音訊或回答音訊相關問題的工具;若需要逐字稿,則建議改用其他服務:「若需要支援即時語音轉文字的專用語音轉文字模型,應使用 Google Cloud Speech-to-Text API」(也就是 Chirp 模型)。多模態模型雖然能輸出逐字稿,但它的設計目標是理解音訊,而不是精確記錄每一句話。此外,它使用聊天形式的 generateContent 呼叫,而不是語音轉文字 API。要逐字轉錄語音,專用模型才是適合的工具,同時提供兩類模型的供應商也持相同看法。
音訊有 3 種傳送方式:
- 上傳檔案,批次回傳:上傳完整錄音,在單一回應中取得完整逐字稿。所有模型都支援。
- 上傳檔案,串流回傳文字:同樣上傳完整錄音,但逐字稿會在產生時透過 SSE 串流回傳。部分模型支援,其他模型只能批次處理。
- 串流輸入音訊,串流輸出文字:即時辨識麥克風或通話音訊。這項功能仍在開發中,尚未提供,因此下文只涵蓋前兩種模式。
語音轉文字如何計費
計費方式分成兩種。按音訊分鐘計費(whisper-1、seed-asr、qwen3-asr-flash、Chirp 模型):費用只看錄音的實際時長,與內容無關。按 token 計費(gpt-4o 模型):音訊會以固定速率 token 化,費用包含音訊輸入 token 與逐字稿輸出 token,因此靜音比密集語音便宜。
按 token 計費有一個容易誤判的地方:標示的輸入費率是文字費率,但音訊的計費單價更高(gpt-4o-mini-transcribe 標示的輸入費率為 $1.25/M,音訊實際按 $3/M 計費)。如果拿文字費率估算,結果會低估。閘道會在 x-total-cost-usd 標頭回傳實際費用,應直接讀取這個值,不要根據定價頁自行推算。
成本
成本是這項測試最能明確量化的項目,也是差異最大的項目。以下是根據計費標頭算出的每分鐘成本(閘道內所有模型目前的牌價可查閱即時更新的模型頁面):
| 模型 | 成本/分鐘 | 延遲 | 串流 |
|---|---|---|---|
seed-asr-bigmodel | $0.0020 | ≈10s | 否 |
qwen3-asr-flash | $0.0021 | ≈3s | 否 |
gpt-4o-mini-transcribe | $0.0031 | ≈3s | 逐 token |
whisper-1 | $0.0060 | ≈4s | 否 |
gpt-4o-transcribe | $0.0062 | ≈2s | 逐 token |
chirp-2 | $0.0164 | ≈3s | 否 |
chirp-3 | $0.0164 | ≈4s | 否 |
成本差距約為 8 倍,從 seed-asr 的每分鐘 $0.0020,到 Chirp 模型的 $0.0164。最便宜的 seed-asr 必須明確指定音訊語言(下文會詳述),因此適合事先知道語言的情境。若音訊語言混雜或未知,最便宜又不需手動指定語言的選擇是每分鐘 $0.0021 的 qwen3-asr-flash。Chirp 模型的價格明顯最高。如果一定要使用 Chirp,應直接選 chirp-3:價格和速度與 chirp-2 相同,但從準確度表可以看出,它的中文語音轉文字表現好得多。
這些數字在你自己的檔案上會如何變動,取決於計費方式。按分鐘計費的模型(whisper-1、seed-asr、qwen3-asr-flash、Chirp)只看音訊長度,因此費率可以直接套用:無論格式或內容為何,10 分鐘音訊的費用就是每分鐘價格的 10 倍。
按 token 計費的模型(gpt-4o 各列)輸入成本會隨音訊長度增加,而不是隨檔案大小增加,因為供應商會先重新取樣,再進行 token 化。同一段內容,無論是體積較大的 320 kbps MP3,還是測試使用的精簡 16 kHz WAV,token 化後的成本都差不多。因此壓縮檔案只能節省儲存空間,無法降低語音轉文字費用。真正會影響按 token 計費金額的是實際語音量:我們的音訊採正常語速,且沒有無聲片段;語音比這更密集或更稀疏時,輸出 token 的費用會略高或略低。無論哪種情況,x-total-cost-usd 標頭都是實際費用的依據。
準確度與語言涵蓋範圍
對英文、西班牙文和法文而言,所有支援該語言的模型,錯誤率都約為 0%。這只是基本門檻,而所有模型都通過。即使測試條件如此簡單,中文和印地文仍開始出現差異。不過,這些結果只能用來決定自己的測試應優先涵蓋哪些語言,不能直接判定模型優劣:
| 模型 | 中文(CER) | 印地文(WER) | 涵蓋範圍 |
|---|---|---|---|
seed-asr-bigmodel | 0% | 9% | 全部 5 種(必須明確設定 language) |
qwen3-asr-flash | 0% | 15% | 全部 5 種 |
gpt-4o-mini-transcribe | 0% | 4% | 全部 5 種 |
whisper-1 | 0% | 22% | 全部 5 種 |
gpt-4o-transcribe | 0% | 13% | 全部 5 種 |
chirp-2 | 16% | 15% | 全部 5 種 |
chirp-3 | 2% | 15% | 全部 5 種 |
真正需要注意的不是語言涵蓋範圍,而是語言偵測。只要傳入 language 參數,seed-asr 就能處理全部 5 種語言;後續測試的日文、德文、義大利文和韓文也都能處理。但它無法自行偵測語言:若未設定 language,英文或中文以外的音訊會回傳空字串或羅馬拼音亂碼,HTTP 狀態仍是 200,也不會出現錯誤。其他 6 個模型都會自動偵測。這種無聲失敗才是關鍵發現:模型如果明確報錯,只是造成麻煩;悄悄失敗則會演變成正式環境事故。
印地文結果的落差,以及中文上的失誤(chirp-2 為 16%,chirp-3 已修正),代表在信任這些模型前,應先用難度更高的語言測試,而不是直接判定哪個模型比較好。合成語音和評分方式會放大絕對數值,而且每次執行也會有所波動。比較合理的結論是:對主要語言的清晰語音而言,這些模型的準確度差異不大,因此本測試無法依此推薦特定模型。
串流輸出
模型能否串流輸出逐字稿屬於功能差異,不代表品質高低,而這項功能把 7 個模型分成兩組。按分鐘計費的模型(whisper-1、seed-asr、qwen3-asr-flash 和兩個 Chirp)只能批次處理;要求它們串流時,閘道會回傳 400。gpt-4o 模型則會逐 token 串流:gpt-4o-transcribe 大約 1 秒就會回傳第一批文字,再逐步補上後續內容,適合需要即時感的 UI。費用與批次模式相同。若要啟用串流,加入 stream=true:
curl -N https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...
快取
這些模型實際上都沒有快取機制。按分鐘計費的模型依音訊長度收費,重複傳送也沒有折扣:我們將同一段音訊傳給 whisper-1 5 次,每次都支付完全相同的 $0.015478。按 token 計費的 gpt-4o 模型沒有列出快取費率,重複測試也只出現一般的執行間波動。因此規劃成本時應直接採用每分鐘費率;重送相同檔案不會更便宜。
先篩選哪些條件,哪些項目需要自行測試
這項測試無法判斷哪個模型處理你的錄音最準確。但在自行評估前,可以先依以下條件篩選:
- 語言。 確認模型支援所有需要的語言,也要確認它能否自行偵測語言。
seed-asr能處理我們測試的每一種語言,但必須明確傳入language參數;若未傳入,英文與中文以外的音訊會悄悄失敗。其他 6 個模型都會自動偵測,對混合語言或未知語言的音訊而言,是更安全的預設選擇。 - 串流。 如果需要即時逐字稿,只有
gpt-4o模型能逐 token 串流;按分鐘計費的模型都只能批次處理。 - 成本。 價格差距約為 8 倍。能涵蓋所有語言的最便宜模型是每分鐘 $0.0021 的
qwen3-asr-flash;Chirp 最貴,而在較便宜的模型之外選用 Chirp,唯一有理由考慮的是chirp-3。沒有快取可降低費用,因此每分鐘費率就是實際成本。 - 模型類型。 應使用專用語音轉文字模型,而不是通用多模態模型。逐字轉錄應交給專門工具處理,同時提供兩類模型的供應商也持相同看法。
幾個模型通過上述條件後,剩下的問題就是:面對你自己的音訊、口音、雜音和詞彙,各模型的準確度如何。這只能自行測試。再多的清晰語音評測,都無法取代用真實錄音測試篩選後的模型。
結論
對主要語言的清晰照稿語音而言,7 個模型的準確度大致相同。這正是本次測試最有價值的結論:準確度不是選型時的主要差異。真正能明確量化,而且確實存在差異的基準,是約 8 倍的成本落差、其中一個模型只會自動處理兩種語言,以及按分鐘計費的模型無法串流。先用這些條件縮小範圍,不要急著選出單一勝者,再拿最後留下的 2、3 個模型測試自己的音訊。逐字轉錄應使用專用語音轉文字模型,而不是通用多模態模型;同時開發兩類模型的供應商也給出相同建議。
資料來源
- OpenAI:語音轉文字指南
- OpenAI:API 定價
- Google:Gemini API 音訊理解(專用語音轉文字請使用 Cloud Speech-to-Text)
- Google Cloud:Chirp 3 語音轉文字模型
- BytePlus:Seed-ASR(ByteDance)概覽
成本與延遲是在 2026-06-25 於 Synthorai 上測得,測試涵蓋 7 個專用語音轉文字模型,以及 5 種語言(英文、中文、印地文、西班牙文、法文),數據來自 x-total-cost-usd 標頭與 SSE 計時。seed-asr 的語言資料列是在 2026-07-04 設定 language 參數後重新測量。音訊由文字轉語音產生,難度刻意降低,因此準確度數字只能視為基本門檻檢查,不能當作品質評測;帶有口音與雜音的真實語音,會以不同方式拉開模型差異。每次執行的延遲都可能不同。表列價格為該日期平台上的費率。實際採用前,請再次確認最新定價。