🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

TTS-1 HD

OpenAI 음성 합성스트리밍
입력$30/M
컨텍스트4K

공급사 정가. 플랫폼 마진 없음, 종량제. 아래는 공식 정가입니다. 로그인한 고객은 /console/pricing 에서 워크스페이스 할인이 반영된 실제 가격을 볼 수 있습니다.

30초 만에 TTS-1 HD 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

스펙 및 제한

오디오

언어
대체로 Whisper 모델의 언어 지원을 따릅니다: 아프리칸스어, 아랍어, 아르메니아어, 아제르바이잔어, 벨라루스어, 보스니아어, 불가리아어, 카탈루냐어, 중국어, 크로아티아어, 체코어, 덴마크어, 네덜란드어, 영어, 에스토니아어, 핀란드어, 프랑스어, 갈리시아어, 독일어, 그리스어, 히브리어, 힌디어, 헝가리어, 아이슬란드어, 인도네시아어, 이탈리아어, 일본어, 칸나다어, 카자흐어, 한국어, 라트비아어, 리투아니아어, 마케도니아어, 말레이어, 마라티어, 마오리어, 네팔어, 노르웨이어, 페르시아어, 폴란드어, 포르투갈어, 루마니아어, 러시아어, 세르비아어, 슬로바키아어, 슬로베니아어, 스페인어, 스와힐리어, 스웨덴어, 타갈로그어, 타밀어, 태국어, 터키어, 우크라이나어, 우르두어, 베트남어, 웨일스어. 다만 음성 자체는 영어에 최적화되어 있습니다
오디오 제한
  • 음성 생성 엔드포인트(v1/audio/speech) 전용이며 Chat Completions, Responses, Realtime, Batch, 파인튜닝은 모두 미지원으로 명시
  • 입력 텍스트는 4096자로 제한
  • 출력은 mp3(기본값), opus, aac, flac, wav 또는 pcm(원시 24 kHz 16-bit 부호 있는 리틀 엔디언 샘플)
  • 청크 전송 인코딩을 통한 실시간 재생

실시간

보이스
alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer로 전체 13개 TTS 음성 목록보다 작은 세트이며, 현재 음성은 영어에 최적화되어 있습니다.

모델

모달리티
텍스트 → 오디오

품질에 최적화된 텍스트 음성 변환 모델로, tts-1과 동일한 Speech 엔드포인트를 쓰되 저지연이 아니라 고품질 용도에 맞춰 튜닝되었습니다. gpt-4o-mini-tts에서 억양, 감정, 인토네이션, 어조를 조절하는 instructions 파라미터는 tts-1과 tts-1-hd에서는 동작하지 않습니다.

출처: OpenAI 공식 문서 ↗

TTS-1 HD 소개

지연보다 품질에 최적화
100만 문자당 $30으로 tts-1의 두 배 요율
대화형 음성이 아닌 내레이션·배포용 오디오에 적합

TTS-1 HD는 품질에 최적화된 OpenAI의 텍스트 음성 변환 모델로, tts-1과 짝을 이루는 고충실도 쪽입니다.

  • 모델 페이지는 고품질 텍스트 음성 변환 사용 사례를 위해 텍스트를 자연스럽게 들리는 음성으로 변환하는 모델로 소개하고, 가이드는 그 교환 관계를 직접적으로 밝힙니다: tts-1은 더 낮은 지연을 제공하지만 tts-1-hd보다 품질이 낮습니다.
  • 그 추가 품질이 차이의 전부이며, 가격도 그에 맞춰 100만 문자당 $30으로 tts-1 요율의 두 배입니다.
  • 그래서 한 턴씩 주고받는 대화형 음성보다는 내레이션, 배포용 오디오, 청취자가 두 번 이상 듣게 될 콘텐츠에 알맞은 선택지가 됩니다.
  • 나머지는 형제 모델과 모두 같습니다.
  • Audio API의 speech 엔드포인트만 서빙하고, 텍스트를 받아 오디오를 반환하며, 동일한 아홉 가지 음성(alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer), 동일한 MP3·Opus·AAC·FLAC·WAV·24 kHz PCM 출력 포맷, 기본값 1.0을 중심으로 한 동일한 0.25에서 4.0까지의 속도 범위, 재생을 일찍 시작할 수 있게 해 주는 동일한 청크 전송 스트리밍을 제공합니다.
  • 동일한 두 가지 제약도 그대로 적용됩니다: 어조와 전달을 조정하는 instructions 파라미터는 tts-1이나 tts-1-hd에서 동작하지 않는다고 문서화되어 있고, sse 스트림 포맷은 지원되지 않아 raw 오디오 스트리밍만 남습니다.
  • 언어 커버리지는 Whisper의 목록을 따르되 음성은 영어에 최적화된 상태이며, OpenAI는 해당 음성이 AI로 생성되었음을 명확히 고지하도록 요구합니다.
  • Synthorai는 동일한 OpenAI 호환 /v1/audio/speech 엔드포인트로 TTS-1 HD를 서빙합니다.

자주 묻는 질문

TTS-1 HD API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $30/M 기준으로, 이 크레딧만으로도 TTS-1 HD에 약 4K 토큰 규모의 요청을 대략 8회 보낼 수 있습니다.

TTS-1 HD는 무엇에 가장 강한가요?

지연보다 품질에 최적화, 100만 문자당 $30으로 tts-1의 두 배 요율, 대화형 음성이 아닌 내레이션·배포용 오디오에 적합. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

TTS-1 HD의 가격은 얼마인가요?

Synthorai에서 TTS-1 HD는 입력 토큰 100만 개당 $30, 출력 토큰 100만 개당 $0입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

TTS-1 HD는 프롬프트 캐싱을 지원하나요?

TTS-1 HD는 현재 Synthorai에서 캐시 읽기 할인이 없습니다. 게이트웨이의 다른 모델에는 프롬프트 캐싱이 여전히 적용됩니다. 캐싱을 지원하는 대안은 가격표에서 확인하세요. 공급사별 캐싱 비교 →

TTS-1 HD는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="tts-1-hd"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

무료 API 키 받기 내 비용 비교하기 →