新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

TTS-1 HD

TTS-1 HD 是 OpenAI 針對品質最佳化的文字轉語音模型,是它與 tts-1 組成的這一對中保真度較高的一半。

輸入
文字 $30/M
輸出
音訊
上下文
4K

價格在同類中的位置

價格在 7 個同類模型中的位置

輸入$30/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

這條線顯示該模型的價格,在 Synthorai 上同類模型裡處於什麼位置。兩端標出了最便宜和最貴的那個。這裡是基礎價,批次、區域與快取寫入的折扣見價格頁。

規格與限制

語音合成

合成語言 大致沿用 Whisper 模型的語言支援:南非荷蘭語、阿拉伯語、亞美尼亞語、亞塞拜然語、白俄羅斯語、波士尼亞語、保加利亞語、加泰隆尼亞語、中文、克羅埃西亞語、捷克語、丹麥語、荷蘭語、英語、愛沙尼亞語、芬蘭語、法語、加利西亞語、德語、希臘語、希伯來語、印地語、匈牙利語、冰島語、印尼語、義大利語、日語、坎那達語、哈薩克語、韓語、拉脫維亞語、立陶宛語、馬其頓語、馬來語、馬拉地語、毛利語、尼泊爾語、挪威語、波斯語、波蘭語、葡萄牙語、羅馬尼亞語、俄語、塞爾維亞語、斯洛伐克語、斯洛維尼亞語、西班牙語、史瓦希里語、瑞典語、他加祿語、坦米爾語、泰語、土耳其語、烏克蘭語、烏爾都語、越南語與威爾斯語,儘管音色目前針對英語最佳化
語音 alloy、ash、coral、echo、fable、onyx、nova、sage 與 shimmer,比完整的 13 種 TTS 音色清單少,且音色目前針對英語最佳化。
輸入上限 4,096 字元 各廠商公布該上限所用的單位不同:對非拉丁文字而言,位元組上限不等於字元上限。
串流合成 支援
SSML 文件未說明
聲音控制 該模型不支援
計費單位 按輸入字元計費
端點與格式
  • 僅支援語音生成端點(v1/audio/speech),Chat Completions、Responses、Realtime、Batch 與微調都列為不支援
  • 輸入文字上限 4096 個字元
  • 輸出 mp3(預設)、opus、aac、flac、wav 或 pcm(原始 24 kHz 16-bit 有號小端序取樣)
  • 透過分塊傳輸編碼進行即時播放

模型

模態 文字 → 音訊
  • 針對品質最佳化的文字轉語音模型:與 tts-1 使用相同的 Speech 端點,調校方向是高品質而非低延遲場景。
  • 在 gpt-4o-mini-tts 上用來控制口音、情緒、語調與語氣的 instructions 參數,在 tts-1 或 tts-1-hd 上無效。

依據 OpenAI 官方文件 ↗

30 秒用上 TTS-1 HD

OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

關於 TTS-1 HD

  • 模型頁面把它框定為把文字轉換成聽起來自然的口語,面向高品質的文字轉語音場景,而指南把這項取捨說得很直接:tts-1 提供更低的延遲,但品質低於 tts-1-hd。
  • 多出來的品質就是全部的差別,價格也照此設定為每百萬字元 $30,是 tts-1 費率的兩倍,這使它成為旁白、發布用音訊,以及任何聽眾會反覆聆聽的內容的選擇,而不是用於互動式的一問一答語音。
  • 其餘一切都與它的同門共享。
  • 它只服務 Audio API 的 speech 端點,輸入文字、回傳音訊,音色同樣是那九種(alloy、ash、coral、echo、fable、onyx、nova、sage 與 shimmer),輸出格式同樣是 MP3、Opus、AAC、FLAC、WAV 與 24 kHz PCM,語速同樣是以 1.0 為預設、在 0.25 到 4.0 之間,並且同樣支援分塊傳輸串流,讓播放可以提早開始。
  • 同樣的兩項限制也適用:用來調整語氣與表達方式的 instructions 參數在文件中被記載為在 tts-1 或 tts-1-hd 上不起作用,而 sse 串流格式不受支援,因此只剩下原始音訊串流這一種選擇。
  • 語言覆蓋遵循 Whisper 的清單,而音色仍然是針對英語最佳化的,OpenAI 也要求明確揭露該語音由 AI 生成。
  • Synthorai 透過同一個 OpenAI 相容的 /v1/audio/speech 端點提供 TTS-1 HD。

常見問題

TTS-1 HD API 可以免費試用嗎?

可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。足以在新增付款方式之前,用真實工作負載試試 TTS-1 HD。

TTS-1 HD 最擅長什麼?

針對品質而非延遲最佳化、每百萬字元 $30,是 tts-1 費率的兩倍、適合旁白與對外發布的音訊,而非互動式語音。完整能力請見「關於」一節,內容取自廠商官方發布說明。

TTS-1 HD 的價格是多少?

在 Synthorai 上,TTS-1 HD 輸入 $30/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。

TTS-1 HD 支援提示詞快取(prompt caching)嗎?

TTS-1 HD 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →

如何開通 TTS-1 HD?

把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "tts-1-hd" 即可。一組 API key 通用閘道上的所有模型。

相關模型

對比

本頁每個值都轉錄自廠商自己的文件(連結見上),並帶有核對日期。價格在全目錄範圍內比較;各廠商定義不同的規格值,只說明差異而不作圖表對比。此處沒有任何由我們測量的資料,也不做評分。

取得 API 金鑰 算算你的成本 →