新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

GPT-4o Transcribe Diarize

2025-10 リリース

transcription

GPT-4o Transcribe Diarize は、誰がいつ話しているかを識別する自動音声認識モデルです。

入力
音声 テキスト $2.5/M
出力
テキスト $2.5/M
音声入力
$6.25/M
コンテキスト
16K
知識カットオフ
2024-06

価格の位置づけ

同種 3 モデル中の料金の位置

入力$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
出力$2.5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

トークン

最大出力(ベンダー仕様) 2,000
知識カットオフ 2024-06

音声

言語 transcriptions エンドポイントに掲載された 57 言語(すべての文字起こしモデルで共通のリスト。GPT-4o ベースのモデルでは ISO 639-1 / 639-3 のコードを受け付けます)
音声の制限
  • mp3/mp4/mpeg/mpga/m4a/wav/webm、最大 25MB。
  • diarized_json 出力による話者ダイアライゼーションを内蔵(話者ラベルとセグメントのタイムスタンプ)。
  • 30 秒を超える音声には chunking_strategy が必要。
  • prompt は非対応。
話者分離 対応
ストリーミング文字起こし 対応
タイムスタンプ 対応

モデル

モダリティ 音声 + テキスト → テキスト

話者ダイアライゼーションを内蔵する唯一の OpenAI 文字起こしモデルです。

出典:OpenAI 公式ドキュメント ↗

30 秒で GPT-4o Transcribe Diarize を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe-diarize",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

GPT-4o Transcribe Diarize について

  • 会話の中で音声セグメントを異なる話者に結びつけるため、文字起こしは何が話されたかだけでなく誰が話したかまで捉えます。
  • GPT-4o 文字起こしファミリーの 16K トークンのコンテキストウィンドウと 2K の最大出力トークンを共有し、汎用チャットではなく文字起こしエンドポイントのために専用に構築されています。
  • OpenAI は、このモデルが Transcription API のみで利用でき Realtime API では利用できないと明言しています。
  • 話者ラベルをセグメントのタイムスタンプとともに返す diarized JSON レスポンス形式を返す唯一の OpenAI モデルです。
  • 通常の JSON とテキストも利用できますが、SRT、VTT、詳細 JSON はありません。
  • このモデルに固有の挙動が 2 つあります。
  • 30 秒を超える音声にはチャンク分割の方式が必須で、自動か、自分で指定する音声区間検出の設定のいずれかを使います。
  • またプロンプトはまったく利用できないため、兄弟モデルで通用するコンテキストの工夫はここでは適用できません。
  • 話者は事前に名前を付けることもでき、それぞれ数秒の短い参照クリップを最大 4 つまで与えられます。
  • ストリーミングは機能しますが、話者の割り当ては単語単位ではなくセグメント単位で確定します。
  • 議事録、通話分析、インタビュー用のツールが自然な適用先です。
  • Synthorai は兄弟モデルと同じ OpenAI 互換の文字起こし API 経由で公開します。

よくある質問

GPT-4o Transcribe Diarize API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで GPT-4o Transcribe Diarize を試すには十分な量です。

GPT-4o Transcribe Diarize は何が得意ですか?

話者ダイアライゼーションを内蔵、誰が言ったかを文字起こしが捉える、会議メモと通話分析に適合。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

GPT-4o Transcribe Diarize の料金はいくらですか?

Synthorai 上の GPT-4o Transcribe Diarize は入力 100 万トークンあたり $2.5、出力 100 万トークンあたり $2.5 です。ベンダー定価のままで、プラットフォーム手数料はありません。

GPT-4o Transcribe Diarize はどの言語に対応していますか?

GPT-4o Transcribe Diarize は transcriptions エンドポイントに掲載された 57 言語(すべての文字起こしモデルで共通のリスト。GPT-4o ベースのモデルでは ISO 639-1 / 639-3 のコードを受け付けます) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

GPT-4o Transcribe Diarize を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="gpt-4o-transcribe-diarize" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →