新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

GPT-4o Mini Transcribe

2025-03-20 リリース

transcription

GPT-4o Mini Transcribe は GPT-4o mini を基盤とする音声認識モデルで、初代 Whisper モデルと比べて単語誤り率が改善され、言語認識と精度も向上しています。

入力
音声 テキスト $1.25/M
出力
テキスト $5/M
音声入力
$3/M
コンテキスト
16K
知識カットオフ
2024-06

ベンチマーク

GPT-4o Mini Transcribe:33 件公開されているが、比較に足る数のモデルが測っている項目がない。

GPT-4o Mini Transcribe 測定された他モデル 測定対象の平均 他モデルに上回られていない
FLEURS Arabic (WER)
14.06%

ベンダー公表: OpenAI

価格の位置づけ

同種 3 モデル中の料金の位置

入力$1.25/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
出力$5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

トークン

最大出力(ベンダー仕様) 2,000
知識カットオフ 2024-06

音声

言語 transcriptions エンドポイントに掲載された 57 言語(すべての文字起こしモデルで共通のリスト。GPT-4o ベースのモデルでは ISO 639-1 / 639-3 のコードを受け付けます)
音声の制限
  • mp3/mp4/mpeg/mpga/m4a/wav/webm、最大 25MB。
  • ストリーミング文字起こしに対応。
  • 出力は json/text のみ。
  • 単語タイムスタンプと話者ダイアライゼーションは非対応。
話者分離 非対応
ストリーミング文字起こし 対応
タイムスタンプ 非対応

モデル

モダリティ 音声 + テキスト → テキスト

GPT-4o 文字起こしのコスト効率に優れたティアです。

出典:OpenAI 公式ドキュメント ↗

30 秒で GPT-4o Mini Transcribe を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-mini-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

GPT-4o Mini Transcribe について

  • OpenAI の文字起こしラインアップの中ではコスト効率の高い選択肢で、価格は GPT-4o Transcribe の音声入力単価の半分、コンテキストウィンドウは 16K トークン、リクエストあたりの出力は最大 2K トークンです。
  • ファミリー共通の運用条件を共有します。
  • mp3、mp4、mpeg、mpga、m4a、wav、webm のファイルを 25MB まで、ストリーミング文字起こし、名前や専門語彙のためのプロンプトによるコンテキスト注入、要求に応じた対数確率に対応し、出力は JSON かプレーンテキストに限られ、タイムスタンプの粒度指定はありません。
  • スナップショットをピン留めすべき変更が 2 つあります。
  • OpenAI が日付なしのエイリアスを 2025 年 12 月のスナップショットへ移したため、バージョンをピン留めしていなかった統合は黙ってモデルが変わりました。
  • また当初の 2025 年 3 月のスナップショットは、その後提供終了が予定されています。
  • 2026 年初頭に Batch API 対応が追加され、大量のオフラインの積み残しをより安価に処理できるようになりました。
  • 上位の兄弟モデルと同様に文字起こしエンドポイントとリアルタイム文字起こしセッションの両方で提供され、文字起こし API が公開する 70 を超える言語のリストをカバーし、知識カットオフは 2024 年 6 月です。
  • 精度も依然として重要だがアーキテクチャを決めるのはトークンあたりの音声コストであり、話者ダイアライゼーション済みの文字起こしや字幕のタイミングを必要としない、大量の文字起こしパイプラインに適しています。
  • Synthorai は OpenAI 互換の音声文字起こしエンドポイントで扱います。

よくある質問

GPT-4o Mini Transcribe API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで GPT-4o Mini Transcribe を試すには十分な量です。

GPT-4o Mini Transcribe は何が得意ですか?

初代 Whisper より改善された単語誤り率、プレミアムティアの音声入力レートの半額、16K コンテキストと最大 2K 出力。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

GPT-4o Mini Transcribe の料金はいくらですか?

Synthorai 上の GPT-4o Mini Transcribe は入力 100 万トークンあたり $1.25、出力 100 万トークンあたり $5 です。ベンダー定価のままで、プラットフォーム手数料はありません。

GPT-4o Mini Transcribe はどの言語に対応していますか?

GPT-4o Mini Transcribe は transcriptions エンドポイントに掲載された 57 言語(すべての文字起こしモデルで共通のリスト。GPT-4o ベースのモデルでは ISO 639-1 / 639-3 のコードを受け付けます) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

GPT-4o Mini Transcribe を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="gpt-4o-mini-transcribe" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →