Google TTS Standard
廠商牌價,無平台加價,按用量計費。 以下為官方 list 價。已登入的使用者可在 /console/pricing 查看含工作空間折扣的實際價格。
30 秒用上 Google TTS Standard
OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-standard",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-standard",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-standard",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-standard",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-standard")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));規格與限制
音訊
- 語言
- 所有 Cloud TTS 音色類型中語言區域跨度最廣的等級。Standard 音色 id 已公布於 af-ZA、ar-XA、bg-BG、bn-IN、ca-ES、cmn-CN、cmn-TW、cs-CZ、da-DK、de-DE、el-GR、en-AU、en-GB、en-IN、en-US、es-ES、es-US、et-EE、eu-ES、fi-FI、fil-PH、fr-CA、fr-FR、gl-ES、gu-IN、he-IL、hi-IN、hu-HU、id-ID、is-IS、it-IT、ja-JP、kn-IN、ko-KR、lt-LT、lv-LV、ml-IN、mr-IN、ms-MY、nb-NO、nl-BE、nl-NL、pa-IN、pl-PL、pt-BR、pt-PT、ro-RO、ru-RU、sk-SK、sr-RS、sv-SE、ta-IN、te-IN、th-TH、tr-TR、uk-UA、ur-IN、vi-VN 與 yue-HK。
- 音訊限制
-
- 每次 synthesize 請求的內容上限為 5,000 位元組(在部分語言區域中,單一字元佔多個位元組)。
- 輸出 LINEAR16(附 WAV 檔頭回傳)、32 kbps 的 MP3、OGG_OPUS,或 G.711 MULAW 與 ALAW
- 可選的 sampleRateHertz 會重新取樣,若該取樣率不受該編碼支援則請求失敗。
- 不在串流合成上提供
- Long Audio Synthesis(Preview)以非同步方式支援最多 100 萬位元組的輸入。
- 按字元計費,含空格與換行,且除 <mark> 以外的所有 SSML 標籤都計入
- 對 Standard 與 WaveNet 而言,多位元組字元只收費一次。
即時語音
- 語音
- 音色 id 採用語言區域加字母的形式(en-US-Standard-A、cmn-CN-Standard-A)。Google 的對照表把 Standard 列為成本效益高、已正式發布、可透過 SSML 控制,且不具備串流能力;文件把這些音色歸因於送過 vocoder 的參數式文字轉語音。
- 工作階段能力
-
- AudioConfig 控制項:speakingRate 0.25 到 2.0(原生為 1.0)
- pitch -20.0 到 20.0 個半音
- volumeGainDb -96.0 到 16.0
- effectsProfileId 裝置設定檔,涵蓋穿戴裝置、手機、耳機、小型與中型藍牙喇叭、大型家庭娛樂、大型車載與電話語音播放
- SSML 標籤包括 speak、break、say-as、sub、mark、prosody、emphasis、phoneme、voice 與 lang
模型
- 模態
- 文字 → 音訊
- Google Cloud Text-to-Speech 的 Standard 音色等級,在定價頁上與 WaveNet、Studio 一同歸在 Legacy TTS models 之下。
- 每字元 US$0.000004(每 100 萬字元 US$4),每月前 400 萬字元免費,是定價表所公布的最大免費額度。
關於 Google TTS Standard
Google TTS Standard 開放的是 Google Cloud Text-to-Speech 的 Standard 音色等級,也就是 Google 自家對照表僅以「成本效益高」標註的那個等級。
- 它的音色是目錄中最舊的技術,文件也直說了:參數式文字轉語音是把輸出送過稱為 vocoder 的訊號處理演算法來產生音訊,而許多 Standard 音色用的正是該技術的一種變體,這也是它們聽起來比生成式等級更平板的老實原因。
- 定價頁把 Standard 與 WaveNet、Studio 一起歸在 Legacy TTS models 之下,每字元 US$0.000004,標示為每 100 萬字元 US$4,每月前 400 萬字元免費,是定價表所公布的最大免費額度。
- Standard 在表現力上讓出的,它用覆蓋面補了回來。
- 音色 id 採用語言區域加字母的形式,例如 en-US-Standard-A 或 cmn-CN-Standard-A,而支援音色表把 Standard 列在整個產品中最廣的語言區域範圍上,從 af-ZA 與 eu-ES,經 hi-IN、ja-JP 與 ur-IN,一路到 yue-HK,遠遠超出較新等級所及之處。
- 可控性靠的是 SSML,標籤包括 speak、break、prosody、emphasis、say-as、sub 與 phoneme,而 AudioConfig 區塊另外提供 0.25 到 2.0 的 speakingRate、上下各 20 個半音的 pitch、-96 到 16 的 volumeGainDb、可選的輸出取樣率,以及為穿戴裝置、手機、耳機、藍牙喇叭、車載音響與 IVR 調校的 effectsProfileId 裝置設定檔。
- 輸出為帶 WAV 檔頭的 LINEAR16、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 與 ALAW。
- 有兩項限制要緊:單次請求最多承載 5,000 位元組的內容;而 Standard 不在串流合成上提供,因此長文字意味著走非同步的 Long Audio Synthesis 路徑,或自行分塊。
- 計費計算每一個字元,含空格、換行與除 mark 以外的 SSML 標籤,不過對 Standard 而言多位元組字元只計一次。
- Synthorai 透過 OpenAI 相容的 /v1/audio/speech 端點提供它。
常見問題
Google TTS Standard API 可以免費試用嗎?
可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。以輸入 $4/M 計算,光是這筆額度就足以對 Google TTS Standard 發出約 61 次 ~4K token 的請求。
Google TTS Standard 最擅長什麼?
Google 標為成本效益高的那個等級、所有 cloud tts 音色類型中語言區域最廣、參數式音色,搭配 ssml 與裝置設定檔。完整能力請見「關於」一節,內容取自廠商官方發布說明。
Google TTS Standard 的價格是多少?
在 Synthorai 上,Google TTS Standard 輸入 $4/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。
Google TTS Standard 支援提示詞快取(prompt caching)嗎?
Google TTS Standard 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →
如何開通 Google TTS Standard?
把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "google-tts-standard" 即可。一組 API key 通用閘道上的所有模型。