新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

Seed ASR

transcription

seed-asr-bigmodel 是字節跳動 Seed-ASR 大模型語音辨識服務在 BytePlus 上的形態,以 bigmodel 引擎透過音訊檔案辨識 API 開放。

輸入
音訊
輸出
文字
價格
$0.002/min

價格在同類中的位置

價格在 11 個同類模型中的位置

每分鐘$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

這條線顯示該模型的價格,在 Synthorai 上同類模型裡處於什麼位置。兩端標出了最便宜和最貴的那個。這裡是基礎價,批次、區域與快取寫入的折扣見價格頁。

規格與限制

音訊

語言 `language` 留空時,模型涵蓋普通話、英語、粵語、上海話、閩南語、四川話與陝西方言;可顯式指定 39 個語言鍵(en-US、zh-CN、yue-CN、ja-JP、ko-KR、id-ID、es-MX、pt-BR、de-DE、fr-FR、fil-PH、ms-MY、th-TH、ar-SA、it-IT、bn-BD、el-GR、nl-NL、ru-RU、tr-TR、vi-VN、pl-PL、ro-RO、uk-UA、az-AZ、bg-BG、cs-CZ、da-DK、fi-FI、hi-IN、hu-HU、kk-KZ、km-KH、my-MM、no-NO、pa-PK、sv-SE、sw-KE、ur-PK),另有可選的自動偵測(enable_auto_lang)
音訊限制
  • 非同步音訊檔案模式:小於 512MB、短於 5 小時,支援 OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A(也接受原始 PCM),結果在 3 小時內回傳並保留 7 天
  • 透過 enable_speaker_info 進行語者分離(僅音訊檔案 API,說話者不超過 10 人時效果最佳,串流 API 不支援分離)
  • 透過 show_utterances 取得句級與詞級切分及 start_time/end_time
  • 透過 enable_lid 進行語種辨識
  • 熱詞與上下文最多 800 token、20 輪
  • 按呼叫計費
語者分離 支援
串流轉寫 支援
時間戳 支援

模型

模態 音訊 → 文字

並沒有 'seed-asr-bigmodel' 這個官方模型 id:BytePlus Seed Speech 使用的 model_name 是 'bigmodel',搭配資源 id volc.bigasr.auc(Seed ASR 1.0)/ volc.seedasr.auc(Seed ASR 2.0)。

依據 ByteDance 官方文件 ↗

30 秒用上 Seed ASR

OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

關於 Seed ASR

  • 它以先提交、後查詢的非同步流程轉寫錄音,適合批次與離線負載:呼叫方自行提供請求 ID,該 ID 同時作為任務 ID,之後輪詢直到狀態碼報告完成,結果在三小時內產出並可取回七天。
  • 音訊最長五小時、最大 512 MB,支援 OPUS、WAV、MP3、OGG、AMR、AAC 和 M4A,單聲道或立體聲皆可。
  • 它預設辨識普通話、英語、粵語及多種中文方言,另有從日語到阿拉伯語的數十種可設定語言和可選的自動語言偵測;兩者同時設定時,自動偵測優先於明確指定的語言。
  • 熱詞偏置和對話上下文可提升準確率,熱詞列表上限為 5,000 個詞,對話上下文上限為 800 token 或二十輪,Seed ASR 2.0 還把該上下文擴充到一張隨附影像,每個請求一張。
  • 語者分離、聲道分離、帶信賴值的語句級與詞級時間戳、敏感詞過濾和繁體中文變體都是可選開關;請注意標點預設關閉而逆文字正規化預設開啟,而且語者分離是檔案模式的功能,串流模式並不提供。
  • Synthorai 將它包裝為 OpenAI 相容轉寫端點。

常見問題

Seed ASR API 可以免費試用嗎?

可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。足以在新增付款方式之前,用真實工作負載試試 Seed ASR。

Seed ASR 最擅長什麼?

提交後查詢的非同步批次轉寫、數十種可設語言,自動偵測、對話上下文可擴展到隨附影像。完整能力請見「關於」一節,內容取自廠商官方發布說明。

Seed ASR 的價格是多少?

在 Synthorai 上,Seed ASR 依轉錄音訊每分鐘 $0.002 計費,按用量計費,無平台加價,無需訂閱。

Seed ASR 支援哪些語言?

Seed ASR 支援 `language` 留空時,模型涵蓋普通話、英語、粵語、上海話、閩南語、四川話與陝西方言;可顯式指定 39 個語言鍵(en-US、zh-CN、yue-CN、ja-JP、ko-KR、id-ID、es-MX、pt-BR、de-DE、fr-FR、fil-PH、ms-MY、th-TH、ar-SA、it-IT、bn-BD、el-GR、nl-NL、ru-RU、tr-TR、vi-VN、pl-PL、ro-RO、uk-UA、az-AZ、bg-BG、cs-CZ、da-DK、fi-FI、hi-IN、hu-HU、kk-KZ、km-KH、my-MM、no-NO、pa-PK、sv-SE、sw-KE、ur-PK),另有可選的自動偵測(enable_auto_lang)。在 Synthorai 上透過 POST /v1/audio/transcriptions 呼叫,即標準 OpenAI 轉錄 API 形式。

如何開通 Seed ASR?

把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "seed-asr-bigmodel" 即可。一組 API key 通用閘道上的所有模型。

相關模型

對比

本頁每個值都轉錄自廠商自己的文件(連結見上),並帶有核對日期。價格在全目錄範圍內比較;各廠商定義不同的規格值,只說明差異而不作圖表對比。此處沒有任何由我們測量的資料,也不做評分。

取得 API 金鑰 算算你的成本 →