Fun-ASR は Alibaba Cloud Model Studio の録音ファイル音声認識モデルで、収録済み音声のオフライン文字起こし向けです。
- 入力
- 音声
- 出力
- テキスト
- 価格
- $0.0021/min
価格の位置づけ
同種 11 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
音声
| 言語 | 方言を含む多言語対応で 30 言語:中国語(標準中国語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語および各地の訛り)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 |
|---|---|
| 音声の制限 |
|
| 話者分離 | 対応 |
| ストリーミング文字起こし | 非対応 |
| タイムスタンプ | 対応 |
モデル
| モダリティ | 音声 → テキスト |
|---|
- 歌唱認識を 2025-12 に追加。
- オープンソース化された Fun-ASR-Nano は、ここで提供されるウェイトとは別のモデルです。
30 秒で Fun-ASR を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Fun-ASR について
- 最大 12 時間・2 GB のファイルを受け付け、単一ファイルとバッチジョブに対応し、中国語(標準中国語に加え広東語、呉語、閩南語など多くの地方方言)、英語、日本語、韓国語、その他数十の言語を認識します。
- 公式ドキュメントは、専門用語向けのホットワードカスタマイズと、複数話者の録音のための話者ダイアライゼーションを強調しています。
- どちらにも、あらかじめ知っておく価値のある実務上の細部があります。
- ホットワードテーブルは最大 500 エントリを保持でき、めったに変わらない用語に適しています。
- ダイアライゼーションは有効にするまでオフで、想定される話者数を宣言できます。
- また Alibaba は、ダイアライゼーションを行う音声を約 2 時間以内に収めるよう推奨しており、それを超えるとジョブがタイムアウトする可能性があります。
- 文字起こしは非同期です(ファイルを送信し、タスク ID を受け取り、結果をポーリングします)。
- ミリ秒単位の文・単語レベルのタイムスタンプが標準で返り、機微語フィルタリングとマルチトラック録音向けのチャンネル選択も併せて利用できます。
- 感情ラベル付けはこのモデルの機能ではなく、Qwen3-ASR ラインに属します。
- 言語ヒントは受け付けられますが、ドキュメントはリストの最初の値のみが読まれると注記しています。
- Synthorai は Fun-ASR を OpenAI 互換エンドポイント経由で提供するため、既存の文字起こしクライアントを変更なしで利用できます。
よくある質問
Fun-ASR API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Fun-ASR を試すには十分な量です。
Fun-ASR は何が得意ですか?
最大 12 時間のファイルを受け付け、専門用語向けのホットワードカスタマイズ、複数話者録音向けの話者ダイアライゼーション。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Fun-ASR の料金はいくらですか?
Synthorai 上の Fun-ASR は文字起こしする音声 1 分あたり $0.0021 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。
Fun-ASR はどの言語に対応していますか?
Fun-ASR は 方言を含む多言語対応で 30 言語:中国語(標準中国語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語および各地の訛り)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。
Fun-ASR を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="fun-asr" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。