🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Google TTS Standard

Google 음성 합성SSML
입력$4/M
컨텍스트4K
GPT-4o 대비약 20% 저렴

공급사 정가. 플랫폼 마진 없음, 종량제. 아래는 공식 정가입니다. 로그인한 고객은 /console/pricing 에서 워크스페이스 할인이 반영된 실제 가격을 볼 수 있습니다.

30초 만에 Google TTS Standard 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-standard",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

스펙 및 제한

오디오

언어
Cloud TTS 보이스 타입 중 가장 넓은 로케일 범위. Standard 보이스 id는 af-ZA, ar-XA, bg-BG, bn-IN, ca-ES, cmn-CN, cmn-TW, cs-CZ, da-DK, de-DE, el-GR, en-AU, en-GB, en-IN, en-US, es-ES, es-US, et-EE, eu-ES, fi-FI, fil-PH, fr-CA, fr-FR, gl-ES, gu-IN, he-IL, hi-IN, hu-HU, id-ID, is-IS, it-IT, ja-JP, kn-IN, ko-KR, lt-LT, lv-LV, ml-IN, mr-IN, ms-MY, nb-NO, nl-BE, nl-NL, pa-IN, pl-PL, pt-BR, pt-PT, ro-RO, ru-RU, sk-SK, sr-RS, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN, vi-VN, yue-HK에 대해 공개되어 있습니다.
오디오 제한
synthesize 요청당 총 5,000바이트 콘텐츠 상한(일부 로케일에서는 문자 하나가 여러 바이트입니다). 출력은 LINEAR16(WAV 헤더와 함께 반환), 32 kbps MP3, OGG_OPUS, 또는 G.711 MULAW와 ALAW이며, 선택적 sampleRateHertz는 리샘플링하고 해당 인코딩에서 지원되지 않는 레이트면 요청이 실패합니다. 스트리밍 합성으로는 제공되지 않으며, Long Audio Synthesis(프리뷰)가 최대 100만 바이트 입력을 비동기로 처리합니다. 과금은 공백과 줄바꿈을 포함한 문자 단위이고 <mark>을 제외한 모든 SSML 태그가 계산되며, Standard와 WaveNet에서는 멀티바이트 문자를 한 번만 청구합니다.

실시간

보이스
보이스 id는 로케일에 문자를 붙인 패턴을 따릅니다(en-US-Standard-A, cmn-CN-Standard-A). Google 비교표는 Standard를 비용 효율적, 정식 제공, SSML로 제어 가능, 스트리밍 불가로 표기하며, 문서는 이 보이스들을 보코더를 거치는 파라메트릭 텍스트 음성 변환으로 설명합니다.
세션
  • AudioConfig 제어: speakingRate 0.25에서 2.0까지(원음은 1.0)
  • pitch -20.0에서 20.0 세미톤
  • volumeGainDb -96.0에서 16.0
  • effectsProfileId 기기 프로필은 웨어러블, 핸드셋, 헤드폰, 소형 및 중형 블루투스 스피커, 대형 홈 엔터테인먼트, 대형 차량용, 텔레포니 재생용
  • SSML 태그로는 speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice, lang 등

모델

모달리티
텍스트 → 오디오

Google Cloud Text-to-Speech의 Standard 보이스 티어로, 가격 페이지에서는 WaveNet, Studio와 함께 Legacy TTS 모델로 묶여 있습니다. 문자당 US$0.000004(100만 문자당 US$4)이며 매월 첫 400만 문자가 무료로, 가격표가 공개한 것 중 가장 큰 무료 허용량입니다.

출처: Google 공식 문서 ↗

Google TTS Standard 소개

Google이 비용 효율적이라고 표기한 티어
Cloud TTS 보이스 타입 중 가장 넓은 로케일 범위
SSML과 기기 프로필을 갖춘 파라메트릭 보이스

Google TTS Standard는 Google Cloud Text-to-Speech의 Standard 보이스 티어를 노출하며, Google 자체 비교표가 그저 비용 효율적이라고만 표기한 티어입니다.

  • 이 보이스들은 카탈로그에서 가장 오래된 기술이고 문서도 그 점을 솔직히 밝힙니다.
  • 파라메트릭 텍스트 음성 변환은 보코더라 불리는 신호 처리 알고리즘에 출력을 통과시켜 오디오를 만들어 내는데, Standard 보이스 다수가 그 기술의 변형을 사용하며 이것이 생성형 티어보다 밋밋하게 들리는 정직한 이유입니다.
  • 가격 페이지는 Standard를 WaveNet, Studio와 나란히 Legacy TTS 모델로 분류하고 문자당 US$0.000004, 즉 100만 문자당 US$4로 표기하며, 매월 첫 400만 문자는 무료로 가격표가 공개한 것 중 가장 큰 무료 허용량입니다.
  • Standard가 표현력에서 내주는 것은 도달 범위로 만회합니다.
  • 보이스 id는 en-US-Standard-A나 cmn-CN-Standard-A처럼 로케일에 문자를 붙인 패턴을 따르고, 지원 보이스 표는 af-ZA와 eu-ES에서 hi-IN, ja-JP, ur-IN을 거쳐 yue-HK에 이르기까지 제품 내에서 가장 넓은 로케일 범위에 걸쳐 Standard를 나열하는데, 이는 더 새로운 티어들이 닿는 범위를 한참 넘어섭니다.
  • 제어 수단은 SSML이며 speak, break, prosody, emphasis, say-as, sub, phoneme 같은 태그를 포함하고, AudioConfig 블록은 0.25에서 2.0까지의 speakingRate, 양방향으로 20세미톤에 걸친 pitch, -96에서 16까지의 volumeGainDb, 선택적 출력 샘플 레이트, 그리고 웨어러블, 핸드셋, 헤드폰, 블루투스 스피커, 차량 오디오, IVR에 맞춰 조정된 effectsProfileId 기기 프로필을 더합니다.
  • 출력은 WAV 헤더가 붙은 LINEAR16, 32 kbps MP3, OGG_OPUS, 또는 G.711 MULAW와 ALAW입니다.
  • 중요한 제약이 둘 있습니다.
  • 한 요청은 최대 5,000바이트의 콘텐츠를 담고, Standard는 스트리밍 합성으로 제공되지 않으므로 긴 텍스트는 비동기 Long Audio Synthesis 경로를 쓰거나 직접 청크로 나눠야 합니다.
  • 과금은 공백, 줄바꿈, 그리고 mark를 제외한 SSML 태그까지 모든 문자를 세지만, Standard에서는 멀티바이트 문자를 한 번만 셉니다.
  • Synthorai는 OpenAI 호환 /v1/audio/speech 엔드포인트로 이 모델을 서빙합니다.

자주 묻는 질문

Google TTS Standard API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $4/M 기준으로, 이 크레딧만으로도 Google TTS Standard에 약 4K 토큰 규모의 요청을 대략 61회 보낼 수 있습니다.

Google TTS Standard는 무엇에 가장 강한가요?

Google이 비용 효율적이라고 표기한 티어, Cloud TTS 보이스 타입 중 가장 넓은 로케일 범위, SSML과 기기 프로필을 갖춘 파라메트릭 보이스. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Google TTS Standard의 가격은 얼마인가요?

Synthorai에서 Google TTS Standard는 입력 토큰 100만 개당 $4, 출력 토큰 100만 개당 $0입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

Google TTS Standard는 프롬프트 캐싱을 지원하나요?

Google TTS Standard는 현재 Synthorai에서 캐시 읽기 할인이 없습니다. 게이트웨이의 다른 모델에는 프롬프트 캐싱이 여전히 적용됩니다. 캐싱을 지원하는 대안은 가격표에서 확인하세요. 공급사별 캐싱 비교 →

Google TTS Standard는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="google-tts-standard"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

무료 API 키 받기 내 비용 비교하기 →