新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Seed ASR

transcription

seed-asr-bigmodel は BytePlus 上の ByteDance の Seed-ASR 大規模モデル音声認識サービスで、音声ファイル認識 API から bigmodel エンジンとして公開されています。

入力
音声
出力
テキスト
価格
$0.002/min

価格の位置づけ

同種 11 モデル中の料金の位置

1 分あたり$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声

言語 `language` を空にした場合の標準中国語、英語、広東語、上海語、閩南語、四川方言、陝西方言に加えて、明示的に固定できる 39 の言語キー(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK)、および任意の自動検出(enable_auto_lang)
音声の制限
  • 非同期の音声ファイルモード:512MB 未満、5 時間未満、OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A(生の PCM も受け付け)。
  • 結果は 3 時間以内に返り、7 日間保持されます。
  • 話者ダイアライゼーションは enable_speaker_info で利用(音声ファイル API のみ、話者 10 人以下が最適、ストリーミング API では非対応)。
  • show_utterances により start_time/end_time 付きの文および単語の分割。
  • enable_lid による言語判定。
  • ホットワード/コンテキストは最大 800 トークン、20 ラウンドまで。
  • 課金は呼び出し単位。
話者分離 対応
ストリーミング文字起こし 対応
タイムスタンプ 対応

モデル

モダリティ 音声 → テキスト
  • 'seed-asr-bigmodel' という公式のモデル id は存在しません。
  • BytePlus Seed Speech は model_name 'bigmodel' を使い、リソース id は volc.bigasr.auc(Seed ASR 1.0)/ volc.seedasr.auc(Seed ASR 2.0)です。

出典:ByteDance 公式ドキュメント ↗

30 秒で Seed ASR を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Seed ASR について

  • バッチおよびオフラインのワークロードに適した、送信して問い合わせるフローで録音を非同期に文字起こしします。
  • 呼び出し側が自ら用意したリクエスト ID がタスク ID を兼ね、ステータスコードが完了を報告するまでポーリングします。
  • 結果は 3 時間以内に生成され、7 日間取得できます。
  • 音声は OPUS、WAV、MP3、OGG、AMR、AAC、M4A で最大 5 時間・512 MB まで、モノラルまたはステレオに対応します。
  • 既定では標準中国語、英語、広東語、いくつかの中国語方言を認識し、日本語からアラビア語まで数十の言語を設定でき、自動言語検出も選択できます。
  • 両方が設定されている場合、自動検出が明示的に指定された言語より優先されます。
  • ホットワードによるバイアスと会話のコンテキストが精度を高め、ホットワードのリストは最大 5,000 語、対話のコンテキストは 800 トークンまたは 20 ラウンドが上限で、Seed ASR 2.0 はそのコンテキストをリクエストにつき 1 枚の付随画像にまで拡張します。
  • 話者ダイアライゼーション、チャネル分離、信頼度付きの発話および単語レベルのタイムスタンプ、機微語のフィルタリング、繁体字中国語の変種はいずれも任意のフラグです。
  • 句読点は既定でオフ、逆テキスト正規化は既定でオンであること、そしてダイアライゼーションはファイルモードの機能でストリーミングモードでは提供されないことに注意してください。
  • Synthorai は OpenAI 互換の文字起こしエンドポイントでこれをラップします。

よくある質問

Seed ASR API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Seed ASR を試すには十分な量です。

Seed ASR は何が得意ですか?

非同期の送信・照会バッチ文字起こし、自動検出を伴う数十の設定可能な言語、会話コンテキストが付随する画像にまで拡張。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Seed ASR の料金はいくらですか?

Synthorai 上の Seed ASR は文字起こしする音声 1 分あたり $0.002 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。

Seed ASR はどの言語に対応していますか?

Seed ASR は `language` を空にした場合の標準中国語、英語、広東語、上海語、閩南語、四川方言、陝西方言に加えて、明示的に固定できる 39 の言語キー(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK)、および任意の自動検出(enable_auto_lang) に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

Seed ASR を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="seed-asr-bigmodel" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →