新規 無料登録で、呼び出し 10 回分(最大 $1)をお試しいただけます。カード登録は不要です。

TTS-1 vs TTS-1 HD

vs

どんなときに、どちらを選ぶか

同じ 4096 文字の上限、同じストリーミング、同じ音声、そして同じく音声制御なし。tts-1-hd は 100万文字あたり $30 対 $15、ちょうど 2 倍で、より高品質な合成を買います。公開仕様に他の差はありません。下書きや量をこなすなら tts-1、ユーザーに届く音声なら tts-1-hd を選んでください。

料金

TTS-1 TTS-1 HD Δ
100 万文字あたり $15 $30 0.5×

ビルド時点の現行カタログの料金です。最新の料金表は各モデルのページに掲載しています。

両モデルの位置:100 万文字あたりの料金(この課金単位の音声合成モデル全 7 件、対数スケール)

対応機能

TTS-1 TTS-1 HD
ストリーミング あり あり
SSML undocumented undocumented
課金単位 character character

仕様

TTS-1 TTS-1 HD
入力モダリティ テキスト テキスト
出力モダリティ 音声 音声
リリース 2023-11-06 2023-11-06
リクエストあたりの上限 4096 characters 4096 characters
ボイス alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English. alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
言語 Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
ボイス調整 none none
制限

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

仕様は各ベンダーのドキュメントから転記しています。ベンダーが公表していない項目は、推測で埋めずに省いています。 出典の一覧: TTS-1 · TTS-1 HD

1 行の変更で切り替え

以下のどのタブにも両方のモデル ID が入っています。書き換えるのはハイライトされた 2 行だけで、エンドポイント、キー、リクエスト形式はすべて同じです。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="tts-1",
    # model="tts-1-hd",  # この行のコメントを外し、上の行をコメントアウト
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API キーを取得 →

よくある質問

TTS-1 と TTS-1 HD ではどちらが安いですか?

100 万文字あたりは TTS-1 のほうが安くなります($15 対 $30、2.0 倍の差)。ほかの行では逆になることもあります。料金の全体は上の表に掲載しており、実際のコストは利用の内訳によって変わります。

TTS-1 と TTS-1 HD の A/B テストは、実装を 2 つ用意せずにできますか?

はい。どちらも同じ OpenAI 互換エンドポイントから 1 つの API キーで利用できます。切り替えはモデル名の文字列を 1 行変えるだけなので、トラフィックの一部をそれぞれに振り分けて、請求額を直接比較できます。

音声合成(Text-to-Speech)の課金方法は?

入力テキストの文字数に応じて課金されます。1 リクエストあたりの文字数上限は仕様表に掲載しています。どちらのモデルでも、長い原稿は複数のリクエストに分けて送る必要があります。

関連する比較

当社の実測レポートより