新帳號 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

TTS-1 vs TTS-1 HD

vs

什麼情況選哪一個

同樣的 4096 字元上限、同樣支援串流、同樣的音色集合,也同樣都沒有音色控制;tts-1-hd 每百萬字元 $30 對 $15,正好 2 倍,換來更高品質的合成。已公布的規格裡沒有別的差異。做草稿和走量選 tts-1,音訊要交付給使用者時選 tts-1-hd。

定價

TTS-1 TTS-1 HD Δ
每 1M 字元 $15 $30 0.5×

費率取自網站建置時的即時目錄;各模型頁面都列有最新的價目。

兩者的相對位置:每 1M 字元的價格,涵蓋同一計費單位下全部 7 個文字轉語音模型(對數尺度)

功能

TTS-1 TTS-1 HD
串流 是 是
SSML undocumented undocumented
計費單位 character character

規格

TTS-1 TTS-1 HD
輸入模態 文字 文字
輸出模態 音訊 音訊
發布日期 2023-11-06 2023-11-06
請求限制 4096 characters 4096 characters
聲音 alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English. alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
語言 Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
聲音控制 none none
限制

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

規格摘錄自各供應商的文件;供應商沒有公布的項目就直接略過,不自行推測。 完整來源: TTS-1 · TTS-1 HD

改一行程式碼就能在兩者之間切換

下面每個頁籤都列了這兩個模型 ID,要改的只有醒目標示的那兩行。端點、金鑰和請求格式都不變。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="tts-1",
    # model="tts-1-hd",  # 取消這一行的註解,並把上一行註解掉
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

取得 API 金鑰 →

常見問題

TTS-1 和 TTS-1 HD 哪個比較便宜?

以「每 1M 字元」來看,TTS-1 比較便宜($15 對 $30,相差 2.0×)。其他項目的結果可能相反,完整價目請看上表;實際成本要看你的用量組合。

可以只串接一次,就對 TTS-1 和 TTS-1 HD 做 A/B 測試嗎?

可以。兩個模型都走同一個 OpenAI 相容端點,用的也是同一把 API 金鑰,切換時只要改一行裡的模型名稱字串。你可以把一部分流量分別導到兩邊,再直接比較帳單。

文字轉語音是如何計費的?

依輸入文字的字元數計費,每次請求的字元上限列在規格表裡。兩個模型都一樣,稿子太長就得拆成多次請求。

相關比較