新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Chirp 3

2025-10-13 リリース

transcription

Chirp 3 は Speech-to-Text v2 API 上の Google の多言語 ASR 特化型生成モデルの最新世代で、2025 年 10 月から米国と EU のマルチリージョンで一般提供されています。

入力
音声
出力
テキスト
価格
$0.016/min

価格の位置づけ

同種 11 モデル中の料金の位置

1 分あたり$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声

言語 StreamingRecognize、Recognize、BatchRecognize 全体で 29 の GA ロケール + 82 のプレビューロケール(合計 111。うち 14 で話者ダイアライゼーションが利用可能)
音声の制限
  • 音声デコードは自動判別。
  • 同期の Recognize は 1 分未満、BatchRecognize は 1 分〜1 時間(単語タイムスタンプ付きでは 20 分以下)、リアルタイムには StreamingRecognize。
  • 話者ダイアライゼーションは BatchRecognize と Recognize で利用可(14 言語)。
  • 発話レベルのタイムスタンプは StreamingRecognize のみで、単語レベルのタイムスタンプは非対応と記載。
  • 言語非依存の文字起こし。
  • 29 の GA ロケール + 82 のプレビューロケール。
話者分離 対応
ストリーミング文字起こし 対応
タイムスタンプ 対応

モデル

モダリティ 音声 → テキスト
  • 公式モデル id は chirp_3。
  • Speech-to-Text のリリースノートによると 2025-04-11 にプライベートプレビュー、2025-10-13 に GA。
  • 課金は音声単位。

出典:Google 公式ドキュメント ↗

30 秒で Chirp 3 を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Chirp 3 について

  • 公式ドキュメントは、これまでの Chirp モデルを超える精度と速度の向上に加え、話者ダイアライゼーションと自動言語検出という 2 つの新機能を強調しています。
  • 一般提供とプレビューの各ティアにわたり 100 を超えるロケールを公開し、自動の句読点付与と大文字化を生成し、最大 1,000 個のフレーズヒントによる音声アダプテーションを受け付けます。
  • ただし Google は、アダプテーション以外の用語が劣化しないよう、登録は可能な限り少なくすることを推奨しています。
  • ストリーミング・同期・バッチ認識すべてに対応し、ダイアライゼーションはバッチ認識で 14 言語にわたり利用できます。
  • 新しい制御としては、文字起こしの書式を誘導するプレビュー段階のカスタムプロンプト、背景の人の声は除去できないと Google が警告するノイズ除去のフラグ、standard、short、supershort のエンドポインティング感度があります。
  • このアップグレードは純粋な追加ではなく、切り替え前に確認すべき欠落があります。
  • Chirp 3 は単語レベルではなく発話レベルのタイムスタンプを文書化しており、音声翻訳と不適切語フィルタは文書化されておらず、バッチ音声の上限は 1 時間、タイムスタンプを有効にした場合は 20 分で、Chirp 2 の 8 時間には及びません。
  • Synthorai では、Chirp 3 は他のすべての音声モデルと同じ OpenAI 互換の文字起こしインターフェースから利用できます。

よくある質問

Chirp 3 API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Chirp 3 を試すには十分な量です。

Chirp 3 は何が得意ですか?

話者ダイアライゼーションと自動言語検出、100 を超える言語とその変種を文字起こし、最大 1,000 フレーズヒントの音声アダプテーション。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Chirp 3 の料金はいくらですか?

Synthorai 上の Chirp 3 は文字起こしする音声 1 分あたり $0.016 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。

Chirp 3 はどの言語に対応していますか?

Chirp 3 は StreamingRecognize、Recognize、BatchRecognize 全体で 29 の GA ロケール + 82 のプレビューロケール(合計 111。うち 14 で話者ダイアライゼーションが利用可能) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

Chirp 3 を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="chirp-3" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →