新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

TTS-1

TTS-1 は速度に最適化された OpenAI の text-to-speech モデルです。

入力
テキスト $15/M
出力
音声
コンテキスト
4K

価格の位置づけ

同種 7 モデル中の料金の位置

入力$15/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声合成

合成対応言語 おおむね Whisper モデルの言語対応に準じます:アフリカーンス語、アラビア語、アルメニア語、アゼルバイジャン語、ベラルーシ語、ボスニア語、ブルガリア語、カタルーニャ語、中国語、クロアチア語、チェコ語、デンマーク語、オランダ語、英語、エストニア語、フィンランド語、フランス語、ガリシア語、ドイツ語、ギリシャ語、ヘブライ語、ヒンディー語、ハンガリー語、アイスランド語、インドネシア語、イタリア語、日本語、カンナダ語、カザフ語、韓国語、ラトビア語、リトアニア語、マケドニア語、マレー語、マラーティー語、マオリ語、ネパール語、ノルウェー語、ペルシア語、ポーランド語、ポルトガル語、ルーマニア語、ロシア語、セルビア語、スロバキア語、スロベニア語、スペイン語、スワヒリ語、スウェーデン語、タガログ語、タミル語、タイ語、トルコ語、ウクライナ語、ウルドゥー語、ベトナム語、ウェールズ語。ただしボイスは英語向けに最適化されています
ボイス alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer。全 13 種類の TTS ボイスリストより少ないセットで、ボイスは現在英語向けに最適化されています。
入力上限 4,096 文字 この上限を公開する単位はベンダーごとに異なります。非ラテン文字では、バイト上限は文字数上限と一致しません。
ストリーミング合成 対応
SSML ドキュメントに記載なし
音声コントロール このモデルでは利用不可
課金単位 入力文字数あたり
エンドポイントと形式
  • 音声生成エンドポイント(v1/audio/speech)のみで、Chat Completions、Responses、Realtime、Batch、ファインチューニングはいずれも非対応と記載されています。
  • 入力テキストは 4096 文字まで。
  • 出力は mp3(デフォルト)、opus、aac、flac、wav、pcm(生の 24 kHz 16-bit 符号付きリトルエンディアンのサンプル)。
  • チャンク転送エンコーディングによるリアルタイム再生に対応。

モデル

モダリティ テキスト → 音声
  • 速度に最適化されたテキスト読み上げモデルです。
  • OpenAI は tts-1 を、tts-1-hd と並ぶ低レイテンシ・低品質の選択肢として記載しています。
  • gpt-4o-mini-tts でアクセント、感情、抑揚、トーンを制御する instructions パラメータは、tts-1 と tts-1-hd では機能しません。

出典:OpenAI 公式ドキュメント ↗

30 秒で TTS-1 を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

TTS-1 について

  • モデルページはテキストを自然に聞こえる音声に変換するもので、リアルタイムの text-to-speech ユースケース向けに調整されていると説明し、text-to-speech ガイドはファミリーの線引きを率直に述べています。
  • tts-1 はより低いレイテンシを提供するが、その品質は tts-1-hd より低い、というものです。
  • 単一目的のモデルで、Audio API の speech エンドポイントでのみ対応し、ほかのルートでは利用できず、テキストを入力に取って音声を返し、価格は 100 万文字あたり $15 です。
  • 利用できる音声は 9 種類で、Speech エンドポイントが全体として提供する 13 種類より少なく、alloy、ash、coral、echo、fable、onyx、nova、sage、shimmer です。
  • 出力は既定の MP3 のほか、Opus、AAC、FLAC、WAV、生の 24 kHz PCM が選べ、OpenAI は最速の応答には WAV または PCM を推奨しています。
  • 読み上げ速度は 0.25 から 4.0 まで調整でき既定は 1.0 で、音声はチャンク転送エンコーディングでストリーミングできるため、ファイル全体が揃う前に再生を開始できます。
  • この世代を新しい世代と分け、コピーしたコードを壊しうる制限が 2 つあります。
  • アクセント、感情、話し方を制御する instructions パラメータは tts-1 と tts-1-hd では機能しないこと、そして sse ストリーム形式がここでは非対応であることです。
  • 言語のカバレッジはおおむね Whisper の 50 を超える言語のリストに従いますが、音声自体は英語に最適化されており、OpenAI の利用ポリシーはその音声が AI により生成されたものであることをエンドユーザーに伝えるよう求めています。
  • Synthorai は TTS-1 を OpenAI 互換の /v1/audio/speech エンドポイント経由で提供するため、既存の音声クライアントは変更なしで動作します。

よくある質問

TTS-1 API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで TTS-1 を試すには十分な量です。

TTS-1 は何が得意ですか?

速度とリアルタイムの text-to-speech ユースケースに最適化、tts-1-hd より低いレイテンシ、より低い品質、非対応の instructions パラメータと sse ストリーム形式。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

TTS-1 の料金はいくらですか?

Synthorai 上の TTS-1 は入力 100 万トークンあたり $15、出力 100 万トークンあたり $0 です。ベンダー定価のままで、プラットフォーム手数料はありません。

TTS-1 はプロンプトキャッシュに対応していますか?

TTS-1 には現在 Synthorai 上でキャッシュ読み取り割引がありません。ゲートウェイ上の他のモデルではプロンプトキャッシュが引き続き利用できます。キャッシュ対応の代替モデルは料金表をご覧ください。 プロバイダー別キャッシュ比較 →

TTS-1 を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="tts-1" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →