🎁 新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Chirp 2 vs Chirp 3

vs

いつ、どちらを使うべきか — ベンチマーク表ではなく、厳選された評価

どちらも音声 1 分あたり $0.016 なので、新しい chirp-3 が既定です。Recognize と BatchRecognize で 14 言語の話者分離が加わり、GA 29 とプレビュー 82 のロケールを公開しています。chirp-2 は分離を行わず、StreamingRecognize は 16 ロケールに限られます。引き換えになるのはタイムスタンプと長さで、chirp-2 は単語レベルのタイムスタンプを備え、バッチは 1 分から 8 時間まで扱えますが、chirp-3 は単語タイムスタンプを非対応と記載し、バッチは 1 時間が上限です。単語単位の時刻や非常に長い音声が必要なら chirp-2 を選んでください。

料金

Chirp 2 Chirp 3 Δ
音声1分あたり $0.016 $0.016 =

ビルド時のライブカタログの料金です。各モデルのページには現在の料金カードが記載されています。

位置付け — この課金単位におけるすべての11個の音声テキスト変換モデル全体の音声1分あたりの料金 (対数スケール)

Chirp 2 · $0.016 Chirp 3 · $0.016
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

機能

Chirp 2 Chirp 3
話者ダイアライゼーション なし あり
ストリーミング あり あり
タイムスタンプ あり あり

仕様

Chirp 2 Chirp 3
入力モダリティ 音声 音声
出力モダリティ テキスト テキスト
リリース 2025-10-13
制限

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–8 hrs, StreamingRecognize for real-time

optional word-level timestamps

language-agnostic transcription (the model infers the prevalent spoken language and transcribes in it)

no standalone language detection

no speaker diarization

speech translation supported

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

言語

Varies by method: BatchRecognize offers the most extensive coverage and Recognize is "on par with Chirp"

StreamingRecognize is limited to 16 locales (Chinese Simplified/Traditional, Cantonese, English AU/IN/GB/US, French CA/FR, German, Italian, Japanese, Korean, Portuguese (Brazil), Spanish ES/US)

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

仕様は各ベンダーのドキュメントから転記されています。ベンダーが公開していない行は推測せず、省略しています。 すべての出典: Chirp 2 · Chirp 3

1行で切り替え

以下のすべてのタブには両方のIDが含まれています — 変更箇所はハイライトされた2行のみです。エンドポイント、キー、リクエスト形式はすべて同じです。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    # model="chirp-3",  # この行をアンコメントし、上の行をコメントアウトします
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

APIキーを取得する →

FAQ

Chirp 2 と Chirp 3 ではどちらが安いですか?

同じ 音声1分あたり($0.016)が設定されているため、ここでは価格が決定打にはなりません — 下記の仕様と機能を確認してください。

2つの統合を行わずに Chirp 2 と Chirp 3 のA/Bテストを実施できますか?

はい。両方とも1つのAPIキーで同じOpenAI互換エンドポイントを通じて提供されます — モデル文字列を1行変更するだけで切り替えられるため、トラフィックの一部をそれぞれにルーティングし、請求額を直接比較できます。

Chirp 2 と Chirp 3 は話者ダイアライゼーションをサポートしていますか?

上の機能表では、各ベンダーのドキュメントから直接引用してモデルごとに回答しています — ダイアライゼーション、ストリーミング、タイムスタンプは、モデルによってこれら3つすべてが異なるため、個別にリストされています。

関連する比較

当社の測定調査より