Fun-ASR Flash は Alibaba の Fun-ASR 音声認識ファミリーの高速オフライン版で、最大 5 分の短い録音の文字起こし向けに構築されています。
- 入力
- 音声
- 出力
- テキスト
- 価格
- $0.0021/min
価格の位置づけ
同種 11 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
音声
| 言語 | 方言を含む多言語対応で、Fun-ASR 本体バージョンと同じ 30 言語のリスト:中国語(標準中国語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語および各地の訛り)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 |
|---|---|
| 音声の制限 |
|
| 話者分離 | 非対応 |
| ストリーミング文字起こし | 対応 |
モデル
| モダリティ | 音声 → テキスト |
|---|
Fun-ASR ファミリーの高速な同期ティアです。
30 秒で Fun-ASR Flash を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Fun-ASR Flash について
- 公式ドキュメントによる特徴は、プロンプトベースのコンテキスト注入です。
- ホットワードリストを管理する代わりに、専門用語をプロンプトで直接与えて認識精度を誘導します。
- ファミリーの中でこの方式が文書化されている唯一のモデルであり、それぞれ数百文字のコンテキストを最大 5 ラウンドまで受け付けます。
- これはプロジェクト単位ではなく呼び出し単位で変わる用語に適しています。
- ファミリーの広範な言語カバレッジを維持し、地方方言を含む中国語、英語、日本語、韓国語、多くのヨーロッパおよび東南アジアの言語にわたります。
- ベースモデルとのそれ以外のトレードオフも同じくらい具体的です。
- 呼び出しは送信してポーリングする方式ではなくストリーミング結果を伴う同期方式のため、短いクリップはタスク ID を介さずインラインで返ります。
- ただし 12 時間の上限は 5 分の上限に置き換わり(2 GB のファイル制限はそのままなので、ここで効いてくるのは長さです)、話者ダイアライゼーションは利用できません。
- あわせて読むと、ファミリー内の選択は明快です。
- 語彙が安定した長時間・複数話者のアーカイブには Fun-ASR、素早い回答とリクエストごとの用語指定が必要な短いクリップには Fun-ASR Flash です。
- Synthorai では標準の OpenAI 互換 API 面から利用できます。
よくある質問
Fun-ASR Flash API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Fun-ASR Flash を試すには十分な量です。
Fun-ASR Flash は何が得意ですか?
ホットワードに代わるプロンプトベースのコンテキスト注入、最大 5 分の短い録音を文字起こし、中国語の地方方言を含む広範なカバレッジ。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Fun-ASR Flash の料金はいくらですか?
Synthorai 上の Fun-ASR Flash は文字起こしする音声 1 分あたり $0.0021 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。
Fun-ASR Flash はどの言語に対応していますか?
Fun-ASR Flash は 方言を含む多言語対応で、Fun-ASR 本体バージョンと同じ 30 言語のリスト:中国語(標準中国語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語および各地の訛り)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語 に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。
Fun-ASR Flash を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="fun-asr-flash" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。