🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Google TTS Neural2

Google 음성 합성SSML
입력$16/M
컨텍스트4K

공급사 정가. 플랫폼 마진 없음, 종량제. 아래는 공식 정가입니다. 로그인한 고객은 /console/pricing 에서 워크스페이스 할인이 반영된 실제 가격을 볼 수 있습니다.

30초 만에 Google TTS Neural2 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-neural2",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

스펙 및 제한

오디오

언어
Standard보다 훨씬 짧은 로케일 목록. Neural2 보이스 id는 da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH, vi-VN에 대해 공개되어 있습니다. Google은 Neural2 보이스가 글로벌 엔드포인트와 단일 리전 엔드포인트에서 제공된다고 밝힙니다.
오디오 제한
synthesize 요청당 총 5,000바이트 콘텐츠 상한. 출력은 LINEAR16(WAV 헤더 포함), 32 kbps MP3, OGG_OPUS, 또는 G.711 MULAW와 ALAW이며, 선택적 sampleRateHertz는 리샘플링하고 해당 인코딩에서 지원되지 않는 레이트면 요청이 실패합니다. 스트리밍 합성으로는 제공되지 않습니다. 과금은 공백과 줄바꿈을 포함한 문자 단위이며 <mark>을 제외한 모든 SSML 태그가 계산되고, 멀티바이트 문자를 한 번만 센다는 설명은 Standard와 WaveNet에만 해당합니다.

실시간

보이스
보이스 id는 로케일에 문자를 붙인 패턴을 따릅니다(en-US-Neural2-F, ja-JP-Neural2-B). Google 비교표는 Neural2를 범용, 정식 제공, SSML로 제어 가능, 스트리밍 불가로 표기하고, 문서는 이 보이스들이 Custom Voice를 만드는 데 쓰이는 것과 동일한 기술에 기반하며 누구든 자신의 커스텀 보이스를 학습시키지 않고도 Custom Voice 기술을 쓸 수 있게 해 준다고 밝힙니다.
세션
  • AudioConfig 제어: speakingRate 0.25에서 2.0까지(원음은 1.0)
  • pitch -20.0에서 20.0 세미톤
  • volumeGainDb -96.0에서 16.0
  • effectsProfileId 기기 프로필은 웨어러블, 핸드셋, 헤드폰, 소형 및 중형 블루투스 스피커, 대형 홈 엔터테인먼트, 대형 차량용, 텔레포니 재생용
  • SSML 태그로는 speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice, lang 등

모델

모달리티
텍스트 → 오디오

Google Cloud Text-to-Speech의 Neural2 보이스 티어로, 가격 페이지에서는 여전히 Legacy TTS 모델로 묶여 있습니다. 문자당 US$0.000016(100만 문자당 US$16)이며 매월 첫 100만 문자가 무료로, Standard의 400만 문자와 대비됩니다.

출처: Google 공식 문서 ↗

Google TTS Neural2 소개

커스텀 보이스를 학습시키지 않고 쓰는 Custom Voice 기술
Standard보다 훨씬 짧은 로케일 목록
범용에 SSML 제어 가능, 다만 스트리밍은 없음

Google TTS Neural2는 Google Cloud Text-to-Speech의 Neural2 보이스 티어를 노출하며, 이 보이스들이 어디에서 왔는지에 대한 Google의 설명은 유난히 구체적입니다.

  • Neural2 보이스는 Custom Voice를 만드는 데 쓰이는 것과 동일한 기술에 기반하며, 이 티어는 누구든 자신의 커스텀 보이스를 학습시키지 않고도 Custom Voice 기술을 쓸 수 있도록 존재합니다.
  • 비교표는 이를 범용이라 부르고 정식 제공으로 표시하며, 제어 수단은 SSML로 Standard 및 WaveNet과 같은 프로필입니다.
  • 이 티어의 정체가 드러나는 곳은 가격입니다.
  • 문자당 US$0.000016, 즉 100만 문자당 US$16이며, 매월 무료 제공은 Standard의 400만 문자가 아니라 첫 100만 문자이고, 가격 페이지는 여전히 이를 Legacy TTS 모델로 묶습니다.
  • 그 품질의 대가는 도달 범위입니다.
  • Standard가 아프리칸스어부터 광둥어까지 로케일을 아우르는 반면, Neural2 보이스 id는 훨씬 짧은 목록인 da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH, vi-VN에 대해 en-US-Neural2-F처럼 익숙한 로케일에 문자를 붙인 형태로 등장합니다.
  • Google은 Neural2가 글로벌 엔드포인트와 단일 리전 엔드포인트에서 제공된다고 밝힙니다.
  • 운용에 관한 것은 클래식 API의 나머지와 모두 공유합니다.
  • SSML 입력, 0.25에서 2.0까지의 speakingRate, 양방향으로 20포인트 범위에 걸친 세미톤 단위 pitch, -96에서 16까지의 volumeGainDb, 선택적 합성 샘플 레이트, 웨어러블부터 텔레포니까지의 기기 프로필, 그리고 LINEAR16, MP3, OGG_OPUS, MULAW, ALAW 출력입니다.
  • 요청당 5,000바이트 콘텐츠 상한도 동일하게 적용되며, Standard와 마찬가지로 Neural2 역시 스트리밍 합성으로 제공되지 않는데 이것이 Chirp 3: HD와 견주었을 때 포기하게 되는 구체적인 능력입니다.
  • 과금은 공백과 mark를 제외한 SSML 태그를 포함해 문자 수로 이루어집니다.
  • Synthorai는 OpenAI 호환 /v1/audio/speech 엔드포인트로 이 모델을 서빙합니다.

자주 묻는 질문

Google TTS Neural2 API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $16/M 기준으로, 이 크레딧만으로도 Google TTS Neural2에 약 4K 토큰 규모의 요청을 대략 15회 보낼 수 있습니다.

Google TTS Neural2는 무엇에 가장 강한가요?

커스텀 보이스를 학습시키지 않고 쓰는 Custom Voice 기술, Standard보다 훨씬 짧은 로케일 목록, 범용에 SSML 제어 가능, 다만 스트리밍은 없음. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Google TTS Neural2의 가격은 얼마인가요?

Synthorai에서 Google TTS Neural2는 입력 토큰 100만 개당 $16, 출력 토큰 100만 개당 $0입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

Google TTS Neural2는 프롬프트 캐싱을 지원하나요?

Google TTS Neural2는 현재 Synthorai에서 캐시 읽기 할인이 없습니다. 게이트웨이의 다른 모델에는 프롬프트 캐싱이 여전히 적용됩니다. 캐싱을 지원하는 대안은 가격표에서 확인하세요. 공급사별 캐싱 비교 →

Google TTS Neural2는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="google-tts-neural2"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

무료 API 키 받기 내 비용 비교하기 →