TTS-1 是 OpenAI 針對速度最佳化的文字轉語音模型。
- 輸入
- 文字 $15/M
- 輸出
- 音訊
- 上下文
- 4K
價格在同類中的位置
價格在 7 個同類模型中的位置
輸入$15/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30
這條線顯示該模型的價格,在 Synthorai 上同類模型裡處於什麼位置。兩端標出了最便宜和最貴的那個。這裡是基礎價,批次、區域與快取寫入的折扣見價格頁。
規格與限制
語音合成
| 合成語言 | 大致沿用 Whisper 模型的語言支援:南非荷蘭語、阿拉伯語、亞美尼亞語、亞塞拜然語、白俄羅斯語、波士尼亞語、保加利亞語、加泰隆尼亞語、中文、克羅埃西亞語、捷克語、丹麥語、荷蘭語、英語、愛沙尼亞語、芬蘭語、法語、加利西亞語、德語、希臘語、希伯來語、印地語、匈牙利語、冰島語、印尼語、義大利語、日語、坎那達語、哈薩克語、韓語、拉脫維亞語、立陶宛語、馬其頓語、馬來語、馬拉地語、毛利語、尼泊爾語、挪威語、波斯語、波蘭語、葡萄牙語、羅馬尼亞語、俄語、塞爾維亞語、斯洛伐克語、斯洛維尼亞語、西班牙語、史瓦希里語、瑞典語、他加祿語、坦米爾語、泰語、土耳其語、烏克蘭語、烏爾都語、越南語與威爾斯語,儘管音色目前針對英語最佳化 |
|---|---|
| 語音 | alloy、ash、coral、echo、fable、onyx、nova、sage 與 shimmer,比完整的 13 種 TTS 音色清單少,且音色目前針對英語最佳化。 |
| 輸入上限 | 4,096 字元 各廠商公布該上限所用的單位不同:對非拉丁文字而言,位元組上限不等於字元上限。 |
| 串流合成 | 支援 |
| SSML | 文件未說明 |
| 聲音控制 | 該模型不支援 |
| 計費單位 | 按輸入字元計費 |
| 端點與格式 |
|
模型
| 模態 | 文字 → 音訊 |
|---|
- 針對速度最佳化的文字轉語音模型:OpenAI 記載 tts-1 是相對 tts-1-hd 延遲更低、品質較低的選項。
- 在 gpt-4o-mini-tts 上用來控制口音、情緒、語調與語氣的 instructions 參數,在 tts-1 或 tts-1-hd 上無效。
30 秒用上 TTS-1
OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="tts-1",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "tts-1",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "tts-1",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("tts-1")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));關於 TTS-1
- 它的模型頁面把它描述為把文字轉換成聽起來自然的口語,並針對即時文字轉語音場景調校,而文字轉語音指南把家族的分界說得很直白:tts-1 提供更低的延遲,但品質低於 tts-1-hd。
- 它是一款單一用途模型,只在 Audio API 的 speech 端點上提供,不在任何其他路由上,輸入文字、回傳音訊,價格為每百萬字元 $15。
- 它可用的音色有九種,少於 Speech 端點總共提供的十三種:alloy、ash、coral、echo、fable、onyx、nova、sage 與 shimmer。
- 輸出預設為 MP3,也可以是 Opus、AAC、FLAC、WAV 或原始 24 kHz PCM,而 OpenAI 建議想要最快回應時使用 WAV 或 PCM;語速可在 0.25 到 4.0 之間調整,預設為 1.0,音訊可以用分塊傳輸編碼串流,讓播放在完整檔案生成之前就開始。
- 有兩項限制把這一代與較新的一代區分開來,也會讓照抄的程式碼出錯:用來調整口音、情緒與表達方式的 instructions 參數在 tts-1 或 tts-1-hd 上都不起作用,而 sse 串流格式在這裡也不受支援。
- 語言覆蓋大致遵循 Whisper 的五十多種語言清單,不過音色本身是針對英語最佳化的,而 OpenAI 的使用政策要求告知終端使用者該語音由 AI 生成。
- Synthorai 透過其 OpenAI 相容的 /v1/audio/speech 端點提供 TTS-1,因此既有的語音用戶端無需修改即可運作。
常見問題
TTS-1 API 可以免費試用嗎?
可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。足以在新增付款方式之前,用真實工作負載試試 TTS-1。
TTS-1 最擅長什麼?
針對速度與即時文字轉語音場景最佳化、延遲低於 tts-1-hd,品質也更低、沒有 instructions 參數,也沒有 sse 流格式。完整能力請見「關於」一節,內容取自廠商官方發布說明。
TTS-1 的價格是多少?
在 Synthorai 上,TTS-1 輸入 $15/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。
TTS-1 支援提示詞快取(prompt caching)嗎?
TTS-1 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →
如何開通 TTS-1?
把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "tts-1" 即可。一組 API key 通用閘道上的所有模型。
相關模型
對比
本頁每個值都轉錄自廠商自己的文件(連結見上),並帶有核對日期。價格在全目錄範圍內比較;各廠商定義不同的規格值,只說明差異而不作圖表對比。此處沒有任何由我們測量的資料,也不做評分。