語音轉文字 API:14 個模型,每分鐘 $0.002 到 $0.016
語音轉文字 API 的牌價介於每分鐘 $0.002 到 $0.016。看似相同的工作,價差卻達 8 倍,而且多數比較並未涵蓋最低價的級距。我們在單一閘道後方提供 14 個轉錄模型,從按 token 計費的 OpenAI gpt-4o 系列,到國際評測經常略過的中國 ASR 模型(ByteDance、Alibaba)都有。本文整理這個市場:不同計費方式代表什麼、各模型每分鐘的牌價,以及如何依使用情境而非品牌選擇模型。
TL;DR
- 這 14 個模型的每分鐘牌價從 $0.002(seed-asr、paraformer、fun-asr-realtime)到 $0.016(Google Chirp),價差達 8 倍。
- OpenAI 的 gpt-4o 轉錄模型按 token 而非分鐘計費;以我們實測的音訊換算,mini 約為 $0.0031/min,完整模型約為 $0.0062/min。
- 最便宜的是中國 ASR:ByteDance seed-asr,以及 Alibaba 的 paraformer、fun-asr、qwen3 系列,牌價皆為 $0.002-$0.0021/min,並提供串流版本。
- 對清晰語音來說,準確度不是區分模型的關鍵;在我們針對 7 個模型的測試中,只要模型支援該語言,英文、西班牙文與法文的錯誤率皆約為 0%。
2026 年的語音轉文字 API 要多少錢?
要準確回答這個問題,必須直接看表格,因為計費方式與費率同樣重要。按分鐘計費的模型只看音訊長度,不受內容影響;按 token 計費的模型則會重新取樣音訊,並按輸入與輸出 token 收費。換算成每分鐘實際成本後,會隨語音密度略有變動:
| 模型 | 供應商 | 計費方式 | 牌價 | 串流 |
|---|---|---|---|---|
| seed-asr-bigmodel | ByteDance | 每分鐘 | $0.002/min | 否 |
| paraformer-realtime-v2 | Alibaba | 每分鐘 | $0.002/min | 是 |
| qwen3-asr-flash-realtime | Alibaba | 每分鐘 | $0.002/min | 是 |
| fun-asr-realtime | Alibaba | 每分鐘 | $0.002/min | 是 |
| fun-asr | Alibaba | 每分鐘 | $0.0021/min | 否 |
| fun-asr-flash | Alibaba | 每分鐘 | $0.0021/min | 否 |
| fun-asr-mtl | Alibaba | 每分鐘 | $0.0021/min | 否 |
| qwen3-asr-flash | Alibaba | 每分鐘 | $0.0021/min | 否 |
| gpt-4o-mini-transcribe | OpenAI | 每 token | 實測約 ≈$0.0031/min | 逐 token |
| whisper-1 | OpenAI | 每分鐘 | $0.006/min | 否 |
| gpt-4o-transcribe | OpenAI | 每 token | 實測約 ≈$0.0062/min | 逐 token |
| gpt-4o-transcribe-diarize | OpenAI | 每 token | token 費率 | 逐 token |
| chirp-2 | 每分鐘 | $0.016/min | 否 | |
| chirp-3 | 每分鐘 | $0.016/min | 否 |
各模型頁面會即時顯示牌價。表中 gpt-4o 模型的兩個 ≈$/min 數字,來自我們透過閘道實際處理多語言測試音訊的帳單,詳見七模型轉錄實測。上表的批次模型都能使用同一把 API key,透過相同且相容 OpenAI 的 /v1/audio/transcriptions 端點呼叫;我們也已確認這包含說話者分離模型。名稱帶有 -realtime 的版本是串流模型,使用各自的介面,詳情記載於各模型頁面。
按 token 計費如何換算成每分鐘成本?
按 token 計費的轉錄成本取決於語音內容,而非檔案大小;實際價格通常落在中間區段。gpt-4o 轉錄模型會先重新取樣音訊再進行 token 化,因此內容相同的高位元率 320 kbps MP3 與精簡的 16 kHz WAV,成本大致相同。壓縮檔案能節省儲存空間,卻不會降低轉錄費用。以正常語速測量,gpt-4o-mini-transcribe 約為 $0.0031/min,gpt-4o-transcribe 約為 $0.0062/min;語音較密集或較稀疏時,價格會略為上下浮動。若預算需要為每小時音訊設定明確上限,按分鐘計費的模型可以直接給出上限;按 token 計費則只能提供預估。
什麼是中國 ASR 級距?為什麼多數比較沒有列入?
表中最便宜、串流選項也最豐富的一組是中國 ASR,但多數英文評測從未實際測試。ByteDance 的 seed-asr-bigmodel 以 $0.002/min 成為全表最低價。Alibaba 則提供三個系列:以串流為主的 paraformer、提供批次、flash、多語言 mtl 與 realtime 版本的 fun-asr,以及提供 flash 與 flash-realtime 版本的 qwen3-asr。所有模型的價格都介於 $0.002-$0.0021/min,相當於 whisper-1 的三分之一、Chirp 的八分之一。
我們的實測也發現兩項限制。首先,seed-asr 必須事先指定音訊語言。已知語言時它最有價格優勢;若需要自動偵測語言,牌價 $0.0021 的 qwen3-asr-flash 是最便宜的選擇,而且能自動辨識我們測試的所有語言。其次,便宜不代表速度慢:qwen3-asr-flash 處理測試片段約需 3 秒,與 OpenAI 模型相近。對以中文語音為主的工作負載而言,這個級距不只價格更低,也是更貼近主要使用情境的選擇。
該如何為工作負載選擇模型?
先依計費方式與串流需求篩選;對清晰語音而言,準確度不足以區分這些模型。各情境的建議如下:
| 情境 | 建議 | 原因 |
|---|---|---|
| 批次轉錄、語言已知 | seed-asr-bigmodel | 最低價 $0.002/min;必須指定語言 |
| 批次處理、語言混合或未知 | qwen3-asr-flash | 最便宜的自動語言偵測,延遲約 3 秒 |
| 即時字幕/語音輸入 | paraformer-realtime-v2 或 qwen3-asr-flash-realtime | 以最低價 $0.002 提供串流 |
| 使用 OpenAI 介面逐步串流文字 | gpt-4o-mini-transcribe | 逐 token 輸出,約 ≈$0.0031/min |
| 需要說話者標籤 | gpt-4o-transcribe-diarize | 此系列中唯一支援說話者分離的模型 |
| 直接替換 whisper | whisper-1 | 相容性基準,價格為 $0.006/min |
若需求是雙向語音對話,而非單純轉錄,使用的是另一類產品,成本結構也不同。語音對語音的費用請參閱我們的 GPT Realtime 定價實測。
常見問題
Whisper API 要多少錢?
whisper-1 的牌價是每分鐘音訊 $0.006,只依音訊長度計費;無論格式或位元率,一小時的檔案都是 $0.36。重複處理沒有折扣:我們將同一段音訊送出 5 次,每次費用都相同。現在表中已有一半模型比它便宜:中國 ASR 的價格為 $0.002-$0.0021/min,只有 whisper 的三分之一;gpt-4o-mini-transcribe 的實測費用則約為一半。
價格較高的語音轉文字模型會更準確嗎?
處理清晰語音時不會。在我們針對 7 個模型的測試中,只要模型支援該語言,英文、西班牙文與法文的錯誤率都約為 0%。真正影響選擇的是成本、串流能力、語言支援範圍,以及說話者分離等功能。遇到口音、雜訊、語碼轉換等高難度音訊時,應使用自己的樣本測試;轉錄實測也列出模型最先出現問題的語言,在我們的測試中是中文與印地文。
哪些語音轉文字 API 支援串流?
目前有兩種形式。gpt-4o 轉錄模型透過 OpenAI API 介面逐 token 串流輸出文字。Alibaba 的 realtime 系列(paraformer-realtime-v2、qwen3-asr-flash-realtime、fun-asr-realtime)則按分鐘計費,價格從 $0.002/min 起。whisper-1、seed-asr 與 Chirp 模型只會回傳完整轉錄結果。
這 14 個模型都能透過同一個閘道端點呼叫,並採用統一計費。每個模型的最新牌價都列在即時更新的模型頁面;包含延遲與準確度資料的 7 模型實測,則收錄於轉錄成本研究。