Whisper v1 は OpenAI の汎用音声認識モデルで、多様な音声の大規模データセットで学習されています。
- 入力
- 音声
- 出力
- テキスト
- 価格
- $0.006/min
価格の位置づけ
同種 11 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
音声
| 言語 | 対応として掲載された 57 言語(学習自体は 98 言語で、掲載の 57 言語は transcriptions と translations のエンドポイント全体で OpenAI の単語誤り率 50% 未満という基準を満たしたもの) |
|---|---|
| 音声の制限 |
|
| 話者分離 | 非対応 |
| ストリーミング文字起こし | 非対応 |
| タイムスタンプ | 対応 |
モデル
| モダリティ | 音声 → テキスト |
|---|
- オープンソースの Whisper large-v2 を API 経由で提供。
- prompt は 224 トークンまでです。
30 秒で Whisper v1 を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Whisper v1 について
- 文字起こし、多言語音声認識、音声翻訳、言語識別を行うマルチタスクシステムで、処理した音声の分単位でシンプルに課金されます。
- GPT-4o ベースのより新しい文字起こしモデルがあるにもかかわらず、いくつかの作業では今なお OpenAI の音声スタックで唯一の選択肢です。
- 音声を英語に変換する translations エンドポイントで提供される唯一のモデルであり、セグメントレベルまたは単語レベルのタイムスタンプ粒度に対応する唯一のモデルでもあります。
- またファミリー中で最も広いレスポンス形式への対応を持ち、JSON、プレーンテキスト、詳細 JSON、SRT、VTT をカバーします。
- これは字幕のパイプラインが必要とするものです。
- トレードオフも同じくらい具体的です。
- ストリーミングによる文字起こしには非対応で、プロンプトは内容ではなくスタイルを誘導し(モデルはプロンプトの句読点と大文字化を真似る傾向があります)、プロンプトのうち最後の 224 トークンだけが考慮されます。
- 共通の文字起こしの制限が適用され、mp3、mp4、mpeg、mpga、m4a、wav、webm を 25MB まで受け付けます。
- OpenAI のドキュメントは現在これを歴史的な文脈で扱っていますが、モデルページに非推奨の告知はありません。
- Synthorai は Whisper のジョブを OpenAI 互換の /v1/audio/transcriptions ルートで受け付けるため、既存のクライアントはそのまま動作します。
よくある質問
Whisper v1 API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Whisper v1 を試すには十分な量です。
Whisper v1 は何が得意ですか?
マルチタスク:文字起こし・翻訳・言語識別、音声の分単位でシンプルに課金、文字起こしと翻訳のエンドポイントで互換。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Whisper v1 の料金はいくらですか?
Synthorai 上の Whisper v1 は文字起こしする音声 1 分あたり $0.006 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。
Whisper v1 はどの言語に対応していますか?
Whisper v1 は 対応として掲載された 57 言語(学習自体は 98 言語で、掲載の 57 言語は transcriptions と translations のエンドポイント全体で OpenAI の単語誤り率 50% 未満という基準を満たしたもの) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。
Whisper v1 を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="whisper-1" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。