新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Google TTS Standard

Google TTS Standard 提供 Google Cloud Text-to-Speech 的 Standard 音色档,也就是 Google 自家对比表中仅以「成本高效」一词标注的那一档。

输入
文本 $4/M
输出
音频
上下文
4K

价格在同类中的位置

价格在 7 个同类模型中的位置

输入$4/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

这条线显示该模型的价格,在 Synthorai 上同类模型里处于什么位置。两端标出了最便宜和最贵的那个。这里是基础价,批量、区域和缓存写入的折扣见价格页。

规格与限制

语音合成

合成语言 所有 Cloud TTS 音色类型中语言区域跨度最广的一档。Standard 音色 id 已发布于 af-ZA、ar-XA、bg-BG、bn-IN、ca-ES、cmn-CN、cmn-TW、cs-CZ、da-DK、de-DE、el-GR、en-AU、en-GB、en-IN、en-US、es-ES、es-US、et-EE、eu-ES、fi-FI、fil-PH、fr-CA、fr-FR、gl-ES、gu-IN、he-IL、hi-IN、hu-HU、id-ID、is-IS、it-IT、ja-JP、kn-IN、ko-KR、lt-LT、lv-LV、ml-IN、mr-IN、ms-MY、nb-NO、nl-BE、nl-NL、pa-IN、pl-PL、pt-BR、pt-PT、ro-RO、ru-RU、sk-SK、sr-RS、sv-SE、ta-IN、te-IN、th-TH、tr-TR、uk-UA、ur-IN、vi-VN 和 yue-HK。
语音 音色 id 采用语言区域加字母的形式(en-US-Standard-A、cmn-CN-Standard-A)。Google 的对比表把 Standard 列为成本高效、正式发布、可通过 SSML 控制、不具备流式能力;文档将这些音色归因于经声码器处理的参数式文本转语音。
输入上限 5,000 字节 各厂商公布该上限所用的单位不同:对非拉丁文本而言,字节上限不等于字符上限。
流式合成 不支持
SSML 支持
声音控制 数值参数
可接受的控制项
  • AudioConfig 控制项:speakingRate 0.25 到 2.0(原生为 1.0)
  • pitch -20.0 到 20.0 半音
  • volumeGainDb -96.0 到 16.0
  • effectsProfileId 设备配置,覆盖可穿戴设备、手机、耳机、中小型蓝牙音箱、大型家庭影音、大型车载音响和电话线路播放
  • SSML 标签包括 speak、break、say-as、sub、mark、prosody、emphasis、phoneme、voice 和 lang
计费单位 按输入字符计费 多字节字符按一个字符计费。
端点与格式
  • 单次 synthesize 请求的内容上限为 5,000 字节总量(在部分语言区域中,一个字符会占多个字节)
  • 输出 LINEAR16(返回时带 WAV 头)、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 与 ALAW
  • 可选的 sampleRateHertz 会做重采样,若该采样率对所选编码不受支持,请求会失败
  • 不提供流式合成
  • Long Audio Synthesis(Preview)以异步方式支持最多 100 万字节的输入
  • 按字符计费,空格和换行都计入,除 <mark> 外的所有 SSML 标签也计入
  • 对 Standard 和 WaveNet 而言,多字节字符只计一次

模型

模态 文本 → 音频
  • Google Cloud Text-to-Speech 的 Standard 音色档,在定价页上与 WaveNet、Studio 一同归入 Legacy TTS models。
  • 每字符 US$0.000004(每 100 万字符 US$4),每月前 400 万字符免费,是定价表公布的最大免费额度。

依据 Google 官方文档 ↗

30 秒用上 Google TTS Standard

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-standard",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

关于 Google TTS Standard

  • 它的音色是整个目录中最老的技术,文档对此直言不讳:参数式文本转语音通过把输出送入被称为声码器的信号处理算法来生成音频,而许多 Standard 音色使用的正是该技术的一个变体,这也是它们听上去比生成式档位更平淡的真实原因。
  • 定价页把 Standard 与 WaveNet、Studio 一起归入 Legacy TTS models,每字符 US$0.000004,折算为每 100 万字符 US$4,每月前 400 万字符免费,这是定价表公布的最大免费额度。
  • Standard 在表现力上让出的,在覆盖面上补了回来。
  • 音色 id 采用语言区域加字母的形式,例如 en-US-Standard-A 或 cmn-CN-Standard-A;在支持音色表里,Standard 的语言区域跨度是全产品最广的,从 af-ZA、eu-ES 经 hi-IN、ja-JP、ur-IN 一直延伸到 yue-HK,远超更新档位所及之处。
  • 可控性来自 SSML,标签包括 speak、break、prosody、emphasis、say-as、sub 和 phoneme,AudioConfig 块另外提供 0.25 到 2.0 的 speakingRate、上下各 20 个半音的 pitch、-96 到 16 的 volumeGainDb、可选的输出采样率,以及为可穿戴设备、手机、耳机、蓝牙音箱、车载音响和 IVR 调校的 effectsProfileId 设备配置。
  • 输出为带 WAV 头的 LINEAR16、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 与 ALAW。
  • 有两项约束需要注意:单次请求最多承载 5,000 字节内容;Standard 不提供流式合成,因此长文本只能走异步的 Long Audio Synthesis 路径,或者自己分块。
  • 计费统计每一个字符,包括空格、换行,以及除 mark 之外的全部 SSML 标签,不过对 Standard 而言多字节字符只计一次。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供该模型。

常见问题

Google TTS Standard API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。足够在添加付款方式之前,用真实工作负载试一试 Google TTS Standard。

Google TTS Standard 最擅长什么?

被 Google 标注为成本高效的那一档、cloud tts 中语言区域跨度最广的音色类型、参数式音色,配 ssml 与设备配置。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Google TTS Standard 的价格是多少?

在 Synthorai 上,Google TTS Standard 输入 $4/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

Google TTS Standard 支持提示词缓存(prompt caching)吗?

Google TTS Standard 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 Google TTS Standard?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "google-tts-standard" 即可。一把 API key 通用网关上的全部模型。

相关模型

对比

本页每个值都转录自厂商自己的文档(链接见上),并带有核对日期。价格在全目录范围内比较;各厂商定义不同的规格值,只说明差异而不作图表对比。此处没有任何由我们测量的数据,也不做评分。

获取 API 密钥 算算你的成本 →