🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
語音轉文字 API:14 個模型,每分鐘 $0.002 到 $0.016

語音轉文字 API:14 個模型,每分鐘 $0.002 到 $0.016

目錄
  1. 2026 年的語音轉文字 API 要多少錢?
  2. 按 token 計費如何換算成每分鐘成本?
  3. 什麼是中國 ASR 級距?為什麼多數比較沒有列入?
  4. 該如何為工作負載選擇模型?
  5. 常見問題

語音轉文字 API 的牌價介於每分鐘 $0.002 到 $0.016。看似相同的工作,價差卻達 8 倍,而且多數比較並未涵蓋最低價的級距。我們在單一閘道後方提供 14 個轉錄模型,從按 token 計費的 OpenAI gpt-4o 系列,到國際評測經常略過的中國 ASR 模型(ByteDance、Alibaba)都有。本文整理這個市場:不同計費方式代表什麼、各模型每分鐘的牌價,以及如何依使用情境而非品牌選擇模型。

TL;DR

  • 這 14 個模型的每分鐘牌價從 $0.002(seed-asr、paraformer、fun-asr-realtime)到 $0.016(Google Chirp),價差達 8 倍。
  • OpenAI 的 gpt-4o 轉錄模型按 token 而非分鐘計費;以我們實測的音訊換算,mini 約為 $0.0031/min,完整模型約為 $0.0062/min。
  • 最便宜的是中國 ASR:ByteDance seed-asr,以及 Alibaba 的 paraformer、fun-asr、qwen3 系列,牌價皆為 $0.002-$0.0021/min,並提供串流版本。
  • 對清晰語音來說,準確度不是區分模型的關鍵;在我們針對 7 個模型的測試中,只要模型支援該語言,英文、西班牙文與法文的錯誤率皆約為 0%。

2026 年的語音轉文字 API 要多少錢?

要準確回答這個問題,必須直接看表格,因為計費方式與費率同樣重要。按分鐘計費的模型只看音訊長度,不受內容影響;按 token 計費的模型則會重新取樣音訊,並按輸入與輸出 token 收費。換算成每分鐘實際成本後,會隨語音密度略有變動:

模型供應商計費方式牌價串流
seed-asr-bigmodelByteDance每分鐘$0.002/min
paraformer-realtime-v2Alibaba每分鐘$0.002/min
qwen3-asr-flash-realtimeAlibaba每分鐘$0.002/min
fun-asr-realtimeAlibaba每分鐘$0.002/min
fun-asrAlibaba每分鐘$0.0021/min
fun-asr-flashAlibaba每分鐘$0.0021/min
fun-asr-mtlAlibaba每分鐘$0.0021/min
qwen3-asr-flashAlibaba每分鐘$0.0021/min
gpt-4o-mini-transcribeOpenAI每 token實測約 ≈$0.0031/min逐 token
whisper-1OpenAI每分鐘$0.006/min
gpt-4o-transcribeOpenAI每 token實測約 ≈$0.0062/min逐 token
gpt-4o-transcribe-diarizeOpenAI每 tokentoken 費率逐 token
chirp-2Google每分鐘$0.016/min
chirp-3Google每分鐘$0.016/min

各模型頁面會即時顯示牌價。表中 gpt-4o 模型的兩個 ≈$/min 數字,來自我們透過閘道實際處理多語言測試音訊的帳單,詳見七模型轉錄實測。上表的批次模型都能使用同一把 API key,透過相同且相容 OpenAI 的 /v1/audio/transcriptions 端點呼叫;我們也已確認這包含說話者分離模型。名稱帶有 -realtime 的版本是串流模型,使用各自的介面,詳情記載於各模型頁面。

按 token 計費如何換算成每分鐘成本?

按 token 計費的轉錄成本取決於語音內容,而非檔案大小;實際價格通常落在中間區段。gpt-4o 轉錄模型會先重新取樣音訊再進行 token 化,因此內容相同的高位元率 320 kbps MP3 與精簡的 16 kHz WAV,成本大致相同。壓縮檔案能節省儲存空間,卻不會降低轉錄費用。以正常語速測量,gpt-4o-mini-transcribe 約為 $0.0031/min,gpt-4o-transcribe 約為 $0.0062/min;語音較密集或較稀疏時,價格會略為上下浮動。若預算需要為每小時音訊設定明確上限,按分鐘計費的模型可以直接給出上限;按 token 計費則只能提供預估。

什麼是中國 ASR 級距?為什麼多數比較沒有列入?

表中最便宜、串流選項也最豐富的一組是中國 ASR,但多數英文評測從未實際測試。ByteDance 的 seed-asr-bigmodel 以 $0.002/min 成為全表最低價。Alibaba 則提供三個系列:以串流為主的 paraformer、提供批次、flash、多語言 mtl 與 realtime 版本的 fun-asr,以及提供 flash 與 flash-realtime 版本的 qwen3-asr。所有模型的價格都介於 $0.002-$0.0021/min,相當於 whisper-1 的三分之一、Chirp 的八分之一。

我們的實測也發現兩項限制。首先,seed-asr 必須事先指定音訊語言。已知語言時它最有價格優勢;若需要自動偵測語言,牌價 $0.0021 的 qwen3-asr-flash 是最便宜的選擇,而且能自動辨識我們測試的所有語言。其次,便宜不代表速度慢:qwen3-asr-flash 處理測試片段約需 3 秒,與 OpenAI 模型相近。對以中文語音為主的工作負載而言,這個級距不只價格更低,也是更貼近主要使用情境的選擇。

該如何為工作負載選擇模型?

先依計費方式與串流需求篩選;對清晰語音而言,準確度不足以區分這些模型。各情境的建議如下:

情境建議原因
批次轉錄、語言已知seed-asr-bigmodel最低價 $0.002/min;必須指定語言
批次處理、語言混合或未知qwen3-asr-flash最便宜的自動語言偵測,延遲約 3 秒
即時字幕/語音輸入paraformer-realtime-v2qwen3-asr-flash-realtime以最低價 $0.002 提供串流
使用 OpenAI 介面逐步串流文字gpt-4o-mini-transcribe逐 token 輸出,約 ≈$0.0031/min
需要說話者標籤gpt-4o-transcribe-diarize此系列中唯一支援說話者分離的模型
直接替換 whisperwhisper-1相容性基準,價格為 $0.006/min

若需求是雙向語音對話,而非單純轉錄,使用的是另一類產品,成本結構也不同。語音對語音的費用請參閱我們的 GPT Realtime 定價實測

常見問題

Whisper API 要多少錢?

whisper-1 的牌價是每分鐘音訊 $0.006,只依音訊長度計費;無論格式或位元率,一小時的檔案都是 $0.36。重複處理沒有折扣:我們將同一段音訊送出 5 次,每次費用都相同。現在表中已有一半模型比它便宜:中國 ASR 的價格為 $0.002-$0.0021/min,只有 whisper 的三分之一;gpt-4o-mini-transcribe 的實測費用則約為一半。

價格較高的語音轉文字模型會更準確嗎?

處理清晰語音時不會。在我們針對 7 個模型的測試中,只要模型支援該語言,英文、西班牙文與法文的錯誤率都約為 0%。真正影響選擇的是成本、串流能力、語言支援範圍,以及說話者分離等功能。遇到口音、雜訊、語碼轉換等高難度音訊時,應使用自己的樣本測試;轉錄實測也列出模型最先出現問題的語言,在我們的測試中是中文與印地文。

哪些語音轉文字 API 支援串流?

目前有兩種形式。gpt-4o 轉錄模型透過 OpenAI API 介面逐 token 串流輸出文字。Alibaba 的 realtime 系列(paraformer-realtime-v2、qwen3-asr-flash-realtime、fun-asr-realtime)則按分鐘計費,價格從 $0.002/min 起。whisper-1、seed-asr 與 Chirp 模型只會回傳完整轉錄結果。

這 14 個模型都能透過同一個閘道端點呼叫,並採用統一計費。每個模型的最新牌價都列在即時更新的模型頁面;包含延遲與準確度資料的 7 模型實測,則收錄於轉錄成本研究

← 返回部落格