🎁 新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

TTS-1 HD

OpenAI 音声合成ストリーミング
入力$30/M
コンテキスト4K

ベンダー定価。プラットフォーム手数料なし、従量課金。 これらは公式 list 価格です。ログイン中のお客様は /console/pricing でワークスペース割引を含む実効価格を確認できます。

30 秒で TTS-1 HD を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

スペックと制限

音声

言語
おおむね Whisper モデルの言語対応に準じます:アフリカーンス語、アラビア語、アルメニア語、アゼルバイジャン語、ベラルーシ語、ボスニア語、ブルガリア語、カタルーニャ語、中国語、クロアチア語、チェコ語、デンマーク語、オランダ語、英語、エストニア語、フィンランド語、フランス語、ガリシア語、ドイツ語、ギリシャ語、ヘブライ語、ヒンディー語、ハンガリー語、アイスランド語、インドネシア語、イタリア語、日本語、カンナダ語、カザフ語、韓国語、ラトビア語、リトアニア語、マケドニア語、マレー語、マラーティー語、マオリ語、ネパール語、ノルウェー語、ペルシア語、ポーランド語、ポルトガル語、ルーマニア語、ロシア語、セルビア語、スロバキア語、スロベニア語、スペイン語、スワヒリ語、スウェーデン語、タガログ語、タミル語、タイ語、トルコ語、ウクライナ語、ウルドゥー語、ベトナム語、ウェールズ語。ただしボイスは英語向けに最適化されています
音声の制限
  • 音声生成エンドポイント(v1/audio/speech)のみで、Chat Completions、Responses、Realtime、Batch、ファインチューニングはいずれも非対応と記載されています。
  • 入力テキストは 4096 文字まで。
  • 出力は mp3(デフォルト)、opus、aac、flac、wav、pcm(生の 24 kHz 16-bit 符号付きリトルエンディアンのサンプル)。
  • チャンク転送エンコーディングによるリアルタイム再生に対応。

リアルタイム

ボイス
alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer。全 13 種類の TTS ボイスリストより少ないセットで、ボイスは現在英語向けに最適化されています。

モデル

モダリティ
テキスト → 音声
  • 品質に最適化されたテキスト読み上げモデルです。
  • tts-1 と同じ Speech エンドポイントを使い、低レイテンシではなく高品質のユースケース向けに調整されています。
  • gpt-4o-mini-tts でアクセント、感情、抑揚、トーンを制御する instructions パラメータは、tts-1 と tts-1-hd では機能しません。

出典:OpenAI 公式ドキュメント ↗

TTS-1 HD について

レイテンシではなく品質に最適化
100 万文字あたり $30 で tts-1 の 2 倍の料金
対話的な発話ではなくナレーションや公開音声に適します

TTS-1 HD は品質に最適化された OpenAI の text-to-speech モデルで、tts-1 と対をなす高忠実度側です。

  • モデルページは、高品質な text-to-speech のユースケースのためにテキストを自然に聞こえる音声へ変換するものと位置づけ、ガイドはその取引を率直に述べています。
  • tts-1 はより低いレイテンシを提供するが、その品質は tts-1-hd より低い、というものです。
  • その上乗せされた品質が違いのすべてであり、価格もそれに応じて 100 万文字あたり $30 と tts-1 の 2 倍です。
  • そのため、対話的にやり取りする発話ではなく、ナレーション、公開する音声、聞き手が二度以上聞くものに向いた選択肢になります。
  • それ以外はすべて兄弟モデルと共通です。
  • Audio API の speech エンドポイントのみで提供され、テキストを入力に取って音声を返し、同じ 9 種類の音声(alloy、ash、coral、echo、fable、onyx、nova、sage、shimmer)、同じ MP3、Opus、AAC、FLAC、WAV、24 kHz PCM の出力形式、既定 1.0 を中心とした同じ 0.25 から 4.0 の速度範囲、そして再生を早く開始できる同じチャンク転送のストリーミングを備えます。
  • 同じ 2 つの制限も適用されます。
  • 語調や話し方を制御する instructions パラメータは tts-1 と tts-1-hd では機能しないと文書化されており、sse ストリーム形式は非対応で、生の音声ストリーミングだけが選択肢として残ります。
  • 言語のカバレッジは Whisper のリストに従い、音声は英語に最適化されたままで、OpenAI はその音声が AI により生成されたものであることの明確な開示を求めています。
  • Synthorai は TTS-1 HD を同じ OpenAI 互換の /v1/audio/speech エンドポイント経由で提供します。

よくある質問

TTS-1 HD API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。入力 $30/M で計算すると、このクレジットだけで TTS-1 HD に対して約 8 回の ~4K トークンのリクエストを送れます。

TTS-1 HD は何が得意ですか?

レイテンシではなく品質に最適化、100 万文字あたり $30 で tts-1 の 2 倍の料金、対話的な発話ではなくナレーションや公開音声に適します。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

TTS-1 HD の料金はいくらですか?

Synthorai 上の TTS-1 HD は入力 100 万トークンあたり $30、出力 100 万トークンあたり $0 です。ベンダー定価のままで、プラットフォーム手数料はありません。

TTS-1 HD はプロンプトキャッシュに対応していますか?

TTS-1 HD には現在 Synthorai 上でキャッシュ読み取り割引がありません。ゲートウェイ上の他のモデルではプロンプトキャッシュが引き続き利用できます。キャッシュ対応の代替モデルは料金表をご覧ください。 プロバイダー別キャッシュ比較 →

TTS-1 HD を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="tts-1-hd" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

無料の API キーを取得 コストを比較する →