語音代理 API 成本:10 分鐘通話要 $0.04 至 $0.57
目錄
一通 10 分鐘的語音代理對話,API 費用介於 $0.04 到 $0.57。價差幾乎完全取決於兩項選擇:自行串接整套架構,還是採用語音對語音 API;以及使用哪一級的文字轉語音服務。我們透過同一個閘道,在同一批測試中量測所有環節:3 個語音轉文字模型,以音訊分鐘計費;6 個文字轉語音模型,按實際合成的音訊分鐘計算;3 個 LLM(2 個 flash 級、1 個前沿級)各跑一段 8 輪對話;另有一個即時 GPT Realtime 工作階段,逐 lane 計費。本文會把這些環節組合起來,算出各種架構每分鐘的價格。
TL;DR
- 串接架構(STT + LLM + TTS)每個對話分鐘要 $0.0037 至 $0.025;gpt-realtime-2.1 實測為 $0.057,而 mini 版 為 $0.016,落在串接架構的區間內。
- 採用 flash 級大腦時,發聲成本高於大腦;主流組合相差 12 倍。換成前沿級大腦後,成本結構會反轉。
- Realtime 的溢價買的是延遲:實測語音進、語音出為 1.7-2.1 秒,串接架構則為 4.9-7.7 秒。
- TTS 按字元計費,因此所有實測模型產生一分鐘中文語音的成本,都比英文低 3 至 7 倍。
語音代理如何運作?為什麼有兩種架構?
語音代理是一個迴圈:把使用者說的話轉成回覆,再透過耳機或喇叭播給使用者聽。市面上的設計可分為兩種。串接架構會依序連接 3 個專用 API:先由語音活動偵測器判斷使用者是否說完;語音轉文字服務將話語轉錄成文字;LLM 根據逐字稿與對話紀錄撰寫回覆;最後由文字轉語音服務合成音訊。每個環節都是獨立計量的服務,因此串接架構價格低,也容易替換元件。STT、大腦與語音都能分別選擇,費用則拆成 3 筆小額帳單。
語音對語音(realtime)架構則以單一模型取代上述 3 個環節,透過 WebSocket 直接接收與產生音訊。(Synthorai 原生支援此架構:閘道在 /v1/realtime 提供 WebSocket,現有 OpenAI Realtime SDK 只要改指向我們的端點即可直接使用;詳見 即時 API 文件。本文所有 realtime 工作階段都透過這個連線執行。)主要流程不會進行轉錄,因此模型接收到的是語氣與時間節奏,而不是逐字稿。對話紀錄會以音訊權杖保留在伺服器端,並於每次回覆時重新送給模型。這項設計能提供串接架構先天無法做到的兩件事:低於 2 秒的語音進、語音出延遲,以及自然插話,讓使用者能在句子中途打斷,而模型也能聽見打斷的時點。計費方式也不同:不再是 3 個固定計量項目,而是分別支付音訊輸入與音訊輸出費率,也就是各個「lane」,再加上會隨對話紀錄累積的費用,因此必須依賴快取控制成本。
本文接下來會針對這兩種架構計價:先分別計算串接架構的各個環節,再逐 lane 計算 realtime 迴圈。
語音代理每分鐘要多少錢?
我們計價的 6 種組合,每個對話分鐘介於 $0.0037 到 $0.057,價差達 15 倍。下文必須區分兩個單位:對話分鐘是通話實際經過的一分鐘;音訊分鐘則是其中一方實際說話的一分鐘,也是 STT 與 TTS 的計費單位。所有測試採用相同情境:使用者與代理各占一半說話時間,每分鐘進行 4 次來回,內容為簡短的客服式話語。串接架構各環節依實測音訊長度與權杖數計費;realtime 數據則來自一個即時執行的 8 輪工作階段:
| 組合 | 聆聽 | 發聲 | 大腦 | $/對話分鐘 | 10 分鐘通話 |
|---|---|---|---|---|---|
| 串接,低成本(qwen3-asr-flash + deepseek-v4-flash-0731 + google-tts-standard) | $0.0010 | $0.0020 | $0.0006 | $0.0037 | $0.04 |
| 串接,主流(gpt-4o-mini-transcribe + deepseek + tts-1) | $0.0015 | $0.0076 | $0.0006 | $0.0097 | $0.10 |
| 語音對語音,gpt-realtime-2.1-mini | — | — | — | $0.0159 | $0.16 |
| 串接,SOTA 大腦(gpt-4o-mini-transcribe + gpt-5.6 + tts-1) | $0.0015 | $0.0076 | $0.0110 | $0.0200 | $0.20 |
| 串接,高階(whisper-1 + gemini-3.7-flash + google-tts-chirp3-hd) | $0.0030 | $0.0172 | $0.0050 | $0.0252 | $0.25 |
| 語音對語音,gpt-realtime-2.1 | — | — | — | $0.0573 | $0.57 |
比起區間兩端,中間兩個位置更值得注意。旗艦 realtime API 的成本,即使和高階串接架構相比也高出 2.3 倍。這筆溢價買的不是相同品質,而是串接架構做不到的能力:本次工作階段實測約 2 秒的語音進、語音出延遲、原生插話,以及不經文字轉換而得以保留的語氣與節奏(韻律)。mini 版則落在主流與高階串接架構之間。因此,「串接或 realtime」只有在旗艦級才是真正的價格比較;到了 mini 級,重點是延遲與控制能力,而不是價格。
另外也要確認比較是否公平,因為其他 3 種串接架構都用 flash 級大腦,對手卻是 OpenAI 的旗艦語音模型。SOTA 大腦這一列,改用同一家供應商的前沿文字模型 gpt-5.6,每百萬輸入與輸出權杖分別為 $5 和 $30。即使如此,串接架構仍只要每個對話分鐘 $0.0200,比旗艦 realtime 低 2.9 倍。即便採用前沿級價格,一次文字對話所需的高價權杖仍比音訊 lane 少兩個數量級。要達到相同品質,每分鐘的大腦成本會增加 $0.010,但仍不足以彌合架構間的價差。
串接架構中,哪個環節占最多成本?
只要大腦採用 flash 級模型,答案就是發聲。在主流組合中,每個對話分鐘的 TTS 成本為 $0.0076,LLM 則只有 $0.0006,相差 12 倍;即使在低成本組合中,發聲成本也是大腦的 3 倍。若把大腦升級成 gpt-5.6,成本結構就會反轉:每次對話交換要 $0.00274,大腦成為最大支出,每分鐘 $0.0110,是 tts-1 發聲環節的 1.4 倍。使用 flash 大腦時,語音代理的主要成本在發聲;使用前沿級大腦時,主要成本則轉到大腦。語音轉文字位於兩者之間,每個對話分鐘為 $0.0010 至 $0.0030(14 個模型的每分鐘費率實測;本批次重新驗證:qwen3-asr-flash 每音訊分鐘 $0.00198、gpt-4o-mini-transcribe 為 $0.00294、whisper-1 為 $0.006)。
在啟用推理之前,大腦幾乎不花錢。我們的 8 輪客服對話在 deepseek-v4-flash-0731 上進入穩定狀態後,每輪約有 310 個輸入權杖與 71 個輸出權杖,每次交換成本為 $0.00016。gemini-3.7-flash 執行相同對話時,每次交換要 $0.00126,貴了 8 倍。從權杖拆分就能看出原因:模型每輪花費 89 至 361 個推理權杖,只為斟酌兩句話的回覆。Gemini 3.7 Flash 無法關閉 thinking,因此以它建構的語音代理,每次交換都得支付推理稅;對於確實能關閉推理的模型,語音回合正好是可安全停用推理的單步任務。
文字轉語音每音訊分鐘要多少錢?
每個合成分鐘為 $0.004 至 $0.034,價差達 8.4 倍,單看每字元價格無法發現。以下所有模型都按輸入字元計費,因此我們分別合成固定的英文與中文段落,量測回傳音訊長度,再計算每音訊分鐘的費用:
| 模型 | 定價 | 英文 $/音訊分鐘 | 中文 $/音訊分鐘 | 中文相對英文 |
|---|---|---|---|---|
| google-tts-standard | 每百萬字元 $4 | $0.0041 | $0.0007 | 0.18x |
| qwen3-tts-instruct-flash | 每百萬字元 $11.5 | $0.0098 | $0.0033 | 0.34x |
| tts-1 | 每百萬字元 $15 | $0.0151 | $0.0043 | 0.28x |
| google-tts-neural2 | 每百萬字元 $16 | $0.0162 | $0.0030 | 0.18x |
| tts-1-hd | 每百萬字元 $30 | $0.0303 | $0.0085 | 0.28x |
| google-tts-chirp3-hd | 每百萬字元 $30 | $0.0344 | $0.0052 | 0.15x |
語速是隱藏變因。tts-1-hd 與 chirp3-hd 的定價都是 $30,但 chirp3-hd 念完英文測試段落所需的音訊秒數較少,語速更快,因此每音訊分鐘的成本反而高出 13%;表格另一端的 google-tts-standard,合成一分鐘音訊的成本不到其他所有實測模型的一半。定價表可以排出模型的相對價格,實際成本則必須看每音訊分鐘費率。
中文欄位的差距比我們預期更大:一分鐘中文口語所需的計費字元,比英文少 3 至 7 倍,因為每個中文字元承載的語音資訊更多。在按字元計費的模式下,中文語音代理的發聲成本比相同代理的英文版低 66% 至 85%;再加上文字端的不同語言權杖價差,總成本差距會進一步擴大。
Realtime API 何時值得這個價格?
當 2 秒的語音進、語音出迴圈與原生插話能力能創造足夠價值時,就值得採用。若只看價格,旗艦版比我們建立的每一種串接架構都貴。本批次精準重現官方的兩項音訊換算:30.0 秒輸入音訊計為 300 個權杖(每 100 ms 1 個權杖),3.7 秒輸出音訊計為 74 個權杖(每 50 ms 1 個權杖),與我們 7 月的研究量測結果相同。按照 gpt-realtime-2.1 的定價,光是聆聽每分鐘就要 $0.0192,發聲則要 $0.0768;這還不含每輪重複計費的對話紀錄,長時間工作階段會因此累積更多成本。
實際累積幅度沒有表面上那麼誇張,原因在於快取。在我們的 8 輪工作階段中,每次回覆的輸入從 72 個權杖增加到 643 個;到了第 8 輪,其中 512 個已快取,每百萬個只要 $0.40。整個工作階段有 76% 的輸入權杖按快取費率計費。1.31 分鐘的完整交換實測總成本為 $0.0752,相當於每個對話分鐘 $0.0573。這筆帳單的 lane 占比值得拆開看一次:66% 是音訊輸出、17% 是新的音訊輸入、16% 是文字。模型還會替每個回覆輸出一份文字版本,並按每百萬文字輸出權杖 $24 計費。換句話說,「語音對語音」帳單中約有六分之一,實際上是文字模型的費用。把相同的實測權杖分布套用到 mini 版費率後,結果為 $0.0159。這個數字更值得注意:mini 版比高階串接架構便宜,同時保留串接架構先天無法比擬的延遲與插話能力。
Realtime 還有一項營運成本,而非按權杖計費的成本:工作階段會在 60 分鐘時強制停止,也無法攜帶音訊紀錄續接。任何超過這個界線的對話都必須從冷快取重新開始。7 月的研究有更完整的機制說明。
語音對語音比串接架構快多少?
在上述計價組合中,快 2.3 至 4.5 倍,而且串接架構選用的元件越高階,差距越大。以下圖表採用和成本表相同的 6 種組合,每根長條的單位也相同:一個對話回合。測試使用實際常見的內容長度,輸入 5 秒話語,輸出兩句回覆;串接架構的長條則加總各環節 3 次執行的中位數:
具體數字如下:串接架構每個回合合計為 4.9 秒(低成本)、5.6 秒(主流)、5.7 秒(SOTA 大腦)與 7.7 秒(高階)。兩個語音對語音級別都維持在相同區間:gpt-realtime-2.1-mini 在 4 個即時回合中為 1.6-2.1 秒,gpt-realtime-2.1 在 8 個回合中則為 1.7-2.1 秒。
將圖表和成本表一起看,取捨就很清楚。串接架構的成本與延遲走勢相反:低成本組合同時也是最快的串接架構;高階組合的價格是低成本版的 6.8 倍,卻慢了 2.8 秒,因為高價元件,例如會推理的大腦與 HD 語音,同時也是較慢的元件。語音對語音這一側則不分級別,兩個模型都維持在 2 秒區間。因此,mini 版不只比其中兩種串接架構便宜,也比全部 4 種串接架構快。
這些數據還能得出 3 個結論。第一,LLM 是所有串接架構的延遲瓶頸,而強制推理會讓延遲接近翻倍:gemini-3.7-flash 為了產生兩句回覆,要花 4.5 秒推理;deepseek 為 2.6 秒,gpt-5.6 則為 2.7 秒。同一筆讓權杖成本增加 8 倍的推理稅,也讓高階組合成為最慢的一組。第二,即使每個環節都挑選實測最快的元件(gpt-4o-mini-transcribe、deepseek、google-tts-standard),最低仍要 4.1 秒。在加入語音活動偵測器等待說話結束的時間與音訊播放之前,就已超過 realtime 區間的兩倍。第三,串接架構的數據是依序執行,並等完整回覆結束後量測的總時間。正式環境若把 LLM 串流輸出接進支援串流的 TTS,就能重疊兩個最耗時的環節,大幅縮小差距。但這種重疊需要自行建置與調校;realtime API 則是在第一次開啟 WebSocket 工作階段時,就能直接得到 2 秒的延遲。
串接架構的一個回合,時間究竟花在哪裡?大多花在 3 次請求本身,而不是請求中的內容。單純網路耗時占比很低:到 API 邊緣節點的暖 HTTPS 往返約為 0.09 秒,因此 3 個依序執行的環節,每個回合約有 0.3 秒是純網路耗時;若是冷連線,還要再加 0.2 秒的 TLS 握手。主要成本是每個請求固定的派送時間。我們以近乎空白的 payload 重新執行最快組合的各環節,隔離出這項成本:LLM 只回覆 1 個權杖仍要 2.5 秒;半秒的音訊片段仍要 1.6 秒才能轉錄;合成兩個字詞也要 0.4 秒。這些最低值合計 4.4 秒,而完整內容的實測為 4.1 秒,兩者在量測誤差範圍內相同。也就是說,串接架構幾乎所有時間都花在單次請求的固定負擔;實際內容增加後,例如回覆從 1 個權杖變成 70 個,或音訊片段長 10 倍,幾乎不增加額外時間。實務上有兩層含義:縮短串接架構的回覆不會讓它更快;但只要能移除請求或讓請求重疊,例如讓各環節彼此串流、使用持續連線,就能直接處理真正的成本。Realtime API 是這套邏輯的極致形式:全程維持同一條 socket,因此每個回合都不必重新付出完整的請求週期。
常見問題
執行語音代理最便宜的方法是什麼?
採用低成本串接架構:用 qwen3-asr-flash 聆聽、deepseek-v4-flash-0731 當大腦、google-tts-standard 發聲。每個對話分鐘為 $0.0037,10 分鐘通話約 $0.04。它比旗艦語音對語音方案便宜 15 倍,代價則是較高的語音進、語音出延遲,以及缺乏自然的插話處理。
GPT Realtime 比串接架構貴嗎?
旗艦版比較貴:gpt-realtime-2.1 實測每個對話分鐘為 $0.0573,是高階串接架構的 2.3 倍,也是低成本版的 15 倍。gpt-realtime-2.1-mini 則不然:使用相同權杖分布時,每個對話分鐘為 $0.0159,落在主流與高階串接架構之間。因此在 mini 級,選擇重點是延遲與控制能力,而不是價格。
語音代理的哪個部分最貴?
在我們計價的所有 flash 大腦串接架構中,文字轉語音最貴:每個對話分鐘為 $0.002 至 $0.017,flash LLM 則為 $0.0006 至 $0.005;主流組合相差 12 倍。前沿級大腦會讓結果反轉:gpt-5.6 每分鐘為 $0.0110,高於 tts-1 的 $0.0076。在 TTS 內部,不同模型的每音訊分鐘成本相差 8.4 倍,是本次量測中影響最大的單一選項。
對話語言會影響成本嗎?
發聲環節的差異非常大:由於按字元計費,所有 6 個實測 TTS 模型產生一分鐘中文語音的成本,都比英文低 3 至 7 倍,因為每個中文字元承載的語音資訊更多。我們重新驗證的 3 個模型中,語音轉文字費率在兩種語言之間沒有差異;文字端的成本差異則取決於各語言 tokenizer 的權杖差距。
於 2026-08-17 透過 Synthorai 閘道完成量測,所有環節皆在同一批次執行:6 個 TTS 模型分別合成固定的英文與中文段落,從回傳檔案讀取音訊長度,每個模型執行 2 次;3 個 STT 模型使用標準測試音訊,並從計費標頭取得每分鐘成本;3 個 LLM 大腦(2 個 flash 級、1 個前沿級)執行一段預先編寫的 8 輪客服對話,記錄每輪用量;逐環節延遲探測則將 5 秒話語送入 STT、穩定狀態的對話回合送入 LLM、兩句回覆送入 TTS,各執行 3 次並量測完整回覆時間;同時以相同環節執行最小 payload 下限測試,包括 1 個權杖的回覆、半秒音訊片段與兩個字詞的合成,各執行 3 次,並量測到 API 邊緣節點的暖連線與冷連線往返時間;另執行即時 GPT Realtime 工作階段,使用 5 秒話語,旗艦版跑 8 輪、mini 版跑 4 輪,根據 response.done 用量事件逐 lane 計費。mini 版成本是將旗艦版工作階段的實測權杖分布套用至 mini 定價後推算,mini 延遲區間則來自其自身工作階段的量測。串接架構的組合成本假設雙方各占一半說話時間,每分鐘 4 次交換;費率採量測當下模型目錄中的定價。seed-tts-2.0 已完成上架,但因尚無穩定量測結果而未納入。價格與語速都可能變動,決定架構前應重新量測。