🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Google TTS Neural2

Google 语音合成SSML
输入$16/M
上下文4K

厂商牌价,无平台加价,按量付费。 以下为官方 list 价。登录客户可在 /console/pricing 查看含工作空间折扣的实际价格。

30 秒用上 Google TTS Neural2

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-neural2",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

规格与限制

音频

语言
语言区域清单比 Standard 短得多。Neural2 音色 id 已发布于 da-DK、de-DE、en-AU、en-GB、en-IN、en-US、es-ES、es-US、fr-CA、fr-FR、hi-IN、it-IT、ja-JP、ko-KR、pt-BR、th-TH 和 vi-VN。Google 指出 Neural2 音色在全球端点和单区域端点上均可用。
音频限制
  • 单次 synthesize 请求的内容上限为 5,000 字节总量
  • 输出 LINEAR16(带 WAV 头)、32 kbps MP3、OGG_OPUS,或 G.711 MULAW 与 ALAW
  • 可选的 sampleRateHertz 会做重采样,若该采样率对所选编码不受支持,请求会失败
  • 不提供流式合成
  • 按字符计费,空格和换行都计入,除 <mark> 外的所有 SSML 标签也计入
  • 多字节字符只计一次的说明仅适用于 Standard 和 WaveNet

实时语音

语音
音色 id 采用语言区域加字母的形式(en-US-Neural2-F、ja-JP-Neural2-B)。Google 的对比表把 Neural2 列为通用型、正式发布、可通过 SSML 控制、不具备流式能力;文档还说明这些音色基于与打造 Custom Voice 相同的技术,让任何人无需训练自己的音色就能用上 Custom Voice 技术。
会话能力
  • AudioConfig 控制项:speakingRate 0.25 到 2.0(原生为 1.0)
  • pitch -20.0 到 20.0 半音
  • volumeGainDb -96.0 到 16.0
  • effectsProfileId 设备配置,覆盖可穿戴设备、手机、耳机、中小型蓝牙音箱、大型家庭影音、大型车载音响和电话线路播放
  • SSML 标签包括 speak、break、say-as、sub、mark、prosody、emphasis、phoneme、voice 和 lang

模型

模态
文本 → 音频
  • Google Cloud Text-to-Speech 的 Neural2 音色档,在定价页上仍归于 Legacy TTS models。
  • 每字符 US$0.000016(每 100 万字符 US$16),每月前 100 万字符免费,而 Standard 是 400 万。

依据 Google 官方文档 ↗

关于 Google TTS Neural2

无需训练定制音色就能用上 custom voice 技术
语言区域清单远短于 standard
通用型且可用 ssml 控制,但没有流式

Google TTS Neural2 提供 Google Cloud Text-to-Speech 的 Neural2 音色档,而 Google 对它的描述在音色来源上罕见地具体:Neural2 音色基于与打造 Custom Voice 相同的技术,这一档位存在的意义,就是让任何人都能用上 Custom Voice 技术,而不必训练自己的定制音色。

  • 对比表称它为通用型,标注为正式发布,可控性列为 SSML,与 Standard 和 WaveNet 是同一套配置。
  • 真正让这一档位表明身份的是价格:每字符 US$0.000016,折算为每 100 万字符 US$16,每月前 100 万字符免费,而不是 Standard 的 400 万;定价页仍把它归在 Legacy TTS models 之下。
  • 为这份质量付出的代价是覆盖面。
  • Standard 的语言区域从南非荷兰语一路铺到粤语,Neural2 的音色 id 则只出现在一份短得多的清单上:da-DK、de-DE、en-AU、en-GB、en-IN、en-US、es-ES、es-US、fr-CA、fr-FR、hi-IN、it-IT、ja-JP、ko-KR、pt-BR、th-TH 和 vi-VN,命名沿用熟悉的语言区域加字母形式,例如 en-US-Neural2-F。
  • Google 指出 Neural2 在全球端点和单区域端点上均可用。
  • 运行层面的一切都与经典 API 的其余部分共用:SSML 输入、0.25 到 2.0 的 speakingRate、以半音计上下各 20 的 pitch、-96 到 16 的 volumeGainDb、可选的合成采样率、从可穿戴设备到电话线路的设备配置,以及 LINEAR16、MP3、OGG_OPUS、MULAW 或 ALAW 输出。
  • 单次请求 5,000 字节的内容上限同样适用;并且和 Standard 一样,Neural2 不提供流式合成,这正是它相对 Chirp 3: HD 让出的那项具体能力。
  • 计费统计字符数,包括空格以及除 mark 之外的 SSML 标签。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供该模型。

常见问题

Google TTS Neural2 API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。按输入 $16/M 计算,仅这笔额度就足够对 Google TTS Neural2 发起约 15 次 ~4K token 的请求。

Google TTS Neural2 最擅长什么?

无需训练定制音色就能用上 custom voice 技术、语言区域清单远短于 standard、通用型且可用 ssml 控制,但没有流式。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Google TTS Neural2 的价格是多少?

在 Synthorai 上,Google TTS Neural2 输入 $16/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

Google TTS Neural2 支持提示词缓存(prompt caching)吗?

Google TTS Neural2 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 Google TTS Neural2?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "google-tts-neural2" 即可。一把 API key 通用网关上的全部模型。

相关模型

免费获取 API key 算算你的成本 →