Chirp 2 は Google Cloud の多言語自動音声認識モデルで、Speech-to-Text v2 API 経由で提供されます。
- 入力
- 音声
- 出力
- テキスト
- 価格
- $0.016/min
価格の位置づけ
同種 11 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
音声
| 言語 | メソッドによって異なる言語カバレッジ(BatchRecognize が最も広く、Recognize は「Chirp と同等」、StreamingRecognize は 16 ロケールに限定:中国語簡体字/繁体字、広東語、英語 AU/IN/GB/US、フランス語 CA/FR、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語(ブラジル)、スペイン語 ES/US) |
|---|---|
| 音声の制限 |
|
| 話者分離 | 非対応 |
| ストリーミング文字起こし | 対応 |
| タイムスタンプ | 対応 |
モデル
| モダリティ | 音声 → テキスト |
|---|
- Speech-to-Text V2 の公式モデル id は chirp_2(アンダースコア)。
- GA で、2025-01-27 にリージョン GA を拡大(us-central1/europe-west4/asia-southeast1)。
- 課金は音声単位。
30 秒で Chirp 2 を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Chirp 2 について
- Google は、精度と速度の両面で初代 Chirp を改善しつつ、単語レベルのタイムスタンプ、モデルアダプテーション(フレーズバイアス)、音声翻訳を追加したモデルと位置づけています。
- 自動の句読点付与と大文字化、言語非依存の文字起こし(モデルが音声中で優勢な言語を推定し、その言語で文字起こしします)、不適切語フィルタリングを備え、1 分未満から最大 8 時間の音声に対しストリーミング・同期・バッチ認識に対応します。
- これは Chirp のどのモデルよりも長いバッチの上限です。
- ストリーミングは 16 のロケールをカバーし、バッチはファミリーで最も広範な言語対応を備えます。
- 単語レベルのタイムスタンプはオプトインで、Google は有効にすると文字起こしの品質と速度がわずかに低下すると注記しています。
- 返される単語レベルの信頼度の値は、真の信頼度スコアではないと文書化されています。
- アダプテーションは単純な単語やフレーズを受け付けますが、クラストークンとカスタムクラスには非対応です。
- 音声翻訳は非対称のペアで動作し、27 のソース言語から米国英語へ、そして米国英語から 18 の言語へ変換します。
- 強制正規化とノイズ除去機能が機能セットを締めくくります。
- 唯一の大きな欠落は話者ダイアライゼーションで、Google は非対応と記載しています。
- この機能こそが Chirp 3 へ移行する理由です。
- 提供リージョンは少数に限られます。
- Synthorai は OpenAI 互換の音声エンドポイント経由で Chirp 2 の文字起こしを提供します。
よくある質問
Chirp 2 API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Chirp 2 を試すには十分な量です。
Chirp 2 は何が得意ですか?
前身より改善された精度と速度、単語レベルのタイムスタンプと音声翻訳、1 分未満から 8 時間の音声。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Chirp 2 の料金はいくらですか?
Synthorai 上の Chirp 2 は文字起こしする音声 1 分あたり $0.016 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。
Chirp 2 はどの言語に対応していますか?
Chirp 2 は メソッドによって異なる言語カバレッジ(BatchRecognize が最も広く、Recognize は「Chirp と同等」、StreamingRecognize は 16 ロケールに限定:中国語簡体字/繁体字、広東語、英語 AU/IN/GB/US、フランス語 CA/FR、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語(ブラジル)、スペイン語 ES/US) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。
Chirp 2 を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="chirp-2" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。