新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Seed ASR

transcription

seed-asr-bigmodel 是字节跳动 Seed-ASR 大模型语音识别服务在 BytePlus 上的形态,通过音频文件识别 API 以 bigmodel 引擎的形式开放。

输入
音频
输出
文本
价格
$0.002/min

价格在同类中的位置

价格在 11 个同类模型中的位置

每分钟$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

这条线显示该模型的价格,在 Synthorai 上同类模型里处于什么位置。两端标出了最便宜和最贵的那个。这里是基础价,批量、区域和缓存写入的折扣见价格页。

规格与限制

音频

语言 `language` 留空时,模型覆盖普通话、英语、粤语、上海话、闽南语、四川话和陕西话;也可显式指定 39 个语言键(en-US、zh-CN、yue-CN、ja-JP、ko-KR、id-ID、es-MX、pt-BR、de-DE、fr-FR、fil-PH、ms-MY、th-TH、ar-SA、it-IT、bn-BD、el-GR、nl-NL、ru-RU、tr-TR、vi-VN、pl-PL、ro-RO、uk-UA、az-AZ、bg-BG、cs-CZ、da-DK、fi-FI、hi-IN、hu-HU、kk-KZ、km-KH、my-MM、no-NO、pa-PK、sv-SE、sw-KE、ur-PK),并可选自动检测(enable_auto_lang)
音频限制
  • 异步音频文件模式:<512MB、<5 小时,OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A(也接受原始 PCM),结果在 3 小时内返回并保留 7 天
  • 通过 enable_speaker_info 实现说话人分离(仅音频文件 API,<=10 位说话人时效果最佳,流式 API 不支持分离)
  • 通过 show_utterances 输出带 start_time/end_time 的句级 + 词级切分
  • 通过 enable_lid 实现语种识别
  • 热词/上下文最多 800 token 和 20 轮
  • 按调用计费
说话人分离 支持
流式转写 支持
时间戳 支持

模型

模态 音频 → 文本

不存在官方模型 id 'seed-asr-bigmodel':BytePlus Seed Speech 使用 model_name 'bigmodel',配合资源 id volc.bigasr.auc(Seed ASR 1.0)/ volc.seedasr.auc(Seed ASR 2.0)。

依据 ByteDance 官方文档 ↗

30 秒用上 Seed ASR

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

关于 Seed ASR

  • 它以提交加查询的流程异步转写录音,适合批量和离线负载:调用方自行提供 request ID,该 ID 同时充当任务 ID,随后轮询直到状态码报告完成,结果在三小时内产出并可在七天内取回。
  • 音频最长五小时、最大 512 MB,支持 OPUS、WAV、MP3、OGG、AMR、AAC 和 M4A,单声道或立体声均可。
  • 它默认识别普通话、英语、粤语和若干中文方言,另有从日语到阿拉伯语的数十种可设定语言以及可选的自动语言检测;当两者同时设置时,自动检测优先于显式指定的语言。
  • 热词偏置和对话上下文可提升准确率,热词列表上限为 5,000 个词,对话上下文上限为 800 token 或二十轮,Seed ASR 2.0 还把该上下文扩展到一张随附图像,每个请求一张。
  • 说话人分离、声道拆分、带置信度的句级与词级时间戳、敏感词过滤和繁体中文变体都是可选开关;注意标点默认关闭,而逆文本规范化默认开启,并且说话人分离是文件模式的能力,流式模式不提供。
  • Synthorai 把它包装在 OpenAI 兼容的转写端点之后。

常见问题

Seed ASR API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。足够在添加付款方式之前,用真实工作负载试一试 Seed ASR。

Seed ASR 最擅长什么?

先提交后查询的异步批量转写、数十种可设语言,自动检测、对话上下文可扩展到随附图像。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Seed ASR 的价格是多少?

在 Synthorai 上,Seed ASR 按转写音频每分钟 $0.002 计费,按量付费,无平台加价,无需订阅。

Seed ASR 支持哪些语言?

Seed ASR 支持 `language` 留空时,模型覆盖普通话、英语、粤语、上海话、闽南语、四川话和陕西话;也可显式指定 39 个语言键(en-US、zh-CN、yue-CN、ja-JP、ko-KR、id-ID、es-MX、pt-BR、de-DE、fr-FR、fil-PH、ms-MY、th-TH、ar-SA、it-IT、bn-BD、el-GR、nl-NL、ru-RU、tr-TR、vi-VN、pl-PL、ro-RO、uk-UA、az-AZ、bg-BG、cs-CZ、da-DK、fi-FI、hi-IN、hu-HU、kk-KZ、km-KH、my-MM、no-NO、pa-PK、sv-SE、sw-KE、ur-PK),并可选自动检测(enable_auto_lang)。在 Synthorai 上通过 POST /v1/audio/transcriptions 调用,即标准 OpenAI 转写 API 形态。

如何开通 Seed ASR?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "seed-asr-bigmodel" 即可。一把 API key 通用网关上的全部模型。

相关模型

对比

本页每个值都转录自厂商自己的文档(链接见上),并带有核对日期。价格在全目录范围内比较;各厂商定义不同的规格值,只说明差异而不作图表对比。此处没有任何由我们测量的数据,也不做评分。

获取 API 密钥 算算你的成本 →