🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Google TTS Standard

Google 语音合成SSML
输入$4/M
上下文4K
对比 GPT-4o便宜约 20%

厂商牌价,无平台加价,按量付费。 以下为官方 list 价。登录客户可在 /console/pricing 查看含工作空间折扣的实际价格。

30 秒用上 Google TTS Standard

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-standard",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

规格与限制

音频

语言
所有 Cloud TTS 音色类型中语言区域跨度最广的一档。Standard 音色 id 已发布于 af-ZA、ar-XA、bg-BG、bn-IN、ca-ES、cmn-CN、cmn-TW、cs-CZ、da-DK、de-DE、el-GR、en-AU、en-GB、en-IN、en-US、es-ES、es-US、et-EE、eu-ES、fi-FI、fil-PH、fr-CA、fr-FR、gl-ES、gu-IN、he-IL、hi-IN、hu-HU、id-ID、is-IS、it-IT、ja-JP、kn-IN、ko-KR、lt-LT、lv-LV、ml-IN、mr-IN、ms-MY、nb-NO、nl-BE、nl-NL、pa-IN、pl-PL、pt-BR、pt-PT、ro-RO、ru-RU、sk-SK、sr-RS、sv-SE、ta-IN、te-IN、th-TH、tr-TR、uk-UA、ur-IN、vi-VN 和 yue-HK。
音频限制
  • 单次 synthesize 请求的内容上限为 5,000 字节总量(在部分语言区域中,一个字符会占多个字节)
  • 输出 LINEAR16(返回时带 WAV 头)、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 与 ALAW
  • 可选的 sampleRateHertz 会做重采样,若该采样率对所选编码不受支持,请求会失败
  • 不提供流式合成
  • Long Audio Synthesis(Preview)以异步方式支持最多 100 万字节的输入
  • 按字符计费,空格和换行都计入,除 <mark> 外的所有 SSML 标签也计入
  • 对 Standard 和 WaveNet 而言,多字节字符只计一次

实时语音

语音
音色 id 采用语言区域加字母的形式(en-US-Standard-A、cmn-CN-Standard-A)。Google 的对比表把 Standard 列为成本高效、正式发布、可通过 SSML 控制、不具备流式能力;文档将这些音色归因于经声码器处理的参数式文本转语音。
会话能力
  • AudioConfig 控制项:speakingRate 0.25 到 2.0(原生为 1.0)
  • pitch -20.0 到 20.0 半音
  • volumeGainDb -96.0 到 16.0
  • effectsProfileId 设备配置,覆盖可穿戴设备、手机、耳机、中小型蓝牙音箱、大型家庭影音、大型车载音响和电话线路播放
  • SSML 标签包括 speak、break、say-as、sub、mark、prosody、emphasis、phoneme、voice 和 lang

模型

模态
文本 → 音频
  • Google Cloud Text-to-Speech 的 Standard 音色档,在定价页上与 WaveNet、Studio 一同归入 Legacy TTS models。
  • 每字符 US$0.000004(每 100 万字符 US$4),每月前 400 万字符免费,是定价表公布的最大免费额度。

依据 Google 官方文档 ↗

关于 Google TTS Standard

被 Google 标注为成本高效的那一档
Cloud tts 中语言区域跨度最广的音色类型
参数式音色,配 ssml 与设备配置

Google TTS Standard 提供 Google Cloud Text-to-Speech 的 Standard 音色档,也就是 Google 自家对比表中仅以「成本高效」一词标注的那一档。

  • 它的音色是整个目录中最老的技术,文档对此直言不讳:参数式文本转语音通过把输出送入被称为声码器的信号处理算法来生成音频,而许多 Standard 音色使用的正是该技术的一个变体,这也是它们听上去比生成式档位更平淡的真实原因。
  • 定价页把 Standard 与 WaveNet、Studio 一起归入 Legacy TTS models,每字符 US$0.000004,折算为每 100 万字符 US$4,每月前 400 万字符免费,这是定价表公布的最大免费额度。
  • Standard 在表现力上让出的,在覆盖面上补了回来。
  • 音色 id 采用语言区域加字母的形式,例如 en-US-Standard-A 或 cmn-CN-Standard-A;在支持音色表里,Standard 的语言区域跨度是全产品最广的,从 af-ZA、eu-ES 经 hi-IN、ja-JP、ur-IN 一直延伸到 yue-HK,远超更新档位所及之处。
  • 可控性来自 SSML,标签包括 speak、break、prosody、emphasis、say-as、sub 和 phoneme,AudioConfig 块另外提供 0.25 到 2.0 的 speakingRate、上下各 20 个半音的 pitch、-96 到 16 的 volumeGainDb、可选的输出采样率,以及为可穿戴设备、手机、耳机、蓝牙音箱、车载音响和 IVR 调校的 effectsProfileId 设备配置。
  • 输出为带 WAV 头的 LINEAR16、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 与 ALAW。
  • 有两项约束需要注意:单次请求最多承载 5,000 字节内容;Standard 不提供流式合成,因此长文本只能走异步的 Long Audio Synthesis 路径,或者自己分块。
  • 计费统计每一个字符,包括空格、换行,以及除 mark 之外的全部 SSML 标签,不过对 Standard 而言多字节字符只计一次。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供该模型。

常见问题

Google TTS Standard API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。按输入 $4/M 计算,仅这笔额度就足够对 Google TTS Standard 发起约 61 次 ~4K token 的请求。

Google TTS Standard 最擅长什么?

被 Google 标注为成本高效的那一档、cloud tts 中语言区域跨度最广的音色类型、参数式音色,配 ssml 与设备配置。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Google TTS Standard 的价格是多少?

在 Synthorai 上,Google TTS Standard 输入 $4/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

Google TTS Standard 支持提示词缓存(prompt caching)吗?

Google TTS Standard 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 Google TTS Standard?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "google-tts-standard" 即可。一把 API key 通用网关上的全部模型。

相关模型

免费获取 API key 算算你的成本 →