신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Seed ASR

transcription

seed-asr-bigmodel은 BytePlus에서 제공되는 ByteDance의 Seed-ASR 대형 모델 음성 인식 서비스로, 오디오 파일 인식 API에서 bigmodel 엔진으로 노출됩니다.

입력
오디오
출력
텍스트
가격
$0.002/min

가격의 위치

동종 11개 모델 중 가격 위치

분당$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

오디오

언어 `language`를 비워 두면 표준 중국어, 영어, 광둥어, 상하이어, 민난어, 쓰촨 방언, 산시 방언을 처리합니다. 39개 언어 키를 명시적으로 고정할 수 있고(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), 자동 감지(enable_auto_lang)도 선택할 수 있습니다
오디오 제한
  • 비동기 오디오 파일 모드: 512MB 미만, 5시간 미만, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A(원시 PCM도 허용), 결과는 3시간 이내 반환되고 7일간 보관
  • enable_speaker_info를 통한 화자 분리(오디오 파일 API 전용, 화자 10명 이하에서 최적, 스트리밍 API에는 화자 분리 없음)
  • show_utterances를 통해 start_time/end_time이 포함된 문장 + 단어 분할
  • enable_lid를 통한 언어 식별
  • 핫워드/컨텍스트는 최대 800 토큰, 20회
  • 호출당 과금
화자 분리 지원
스트리밍 전사 지원
타임스탬프 지원

모델

모달리티 오디오 → 텍스트

'seed-asr-bigmodel'이라는 공식 모델 id는 없습니다. BytePlus Seed Speech는 model_name 'bigmodel'과 리소스 id volc.bigasr.auc(Seed ASR 1.0) / volc.seedasr.auc(Seed ASR 2.0)를 사용합니다.

출처: ByteDance 공식 문서 ↗

30초 만에 Seed ASR 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Seed ASR 소개

  • 제출 후 조회하는 흐름으로 녹음을 비동기 전사하며 배치·오프라인 워크로드에 적합합니다.
  • 호출자가 자체 요청 ID를 제공하고 이것이 작업 ID를 겸하며, 상태 코드가 완료를 보고할 때까지 폴링합니다.
  • 결과는 3시간 이내에 생성되고 7일간 조회할 수 있습니다.
  • 오디오는 OPUS, WAV, MP3, OGG, AMR, AAC, M4A로 최대 5시간, 512 MB까지, 모노 또는 스테레오로 받습니다.
  • 기본적으로 표준 중국어, 영어, 광둥어와 여러 중국어 방언을 인식하고, 일본어부터 아랍어까지 수십 개 언어를 지정할 수 있으며 선택적 자동 언어 감지도 있는데, 둘 다 설정되면 자동 감지가 명시된 언어보다 우선합니다.
  • 핫워드 바이어싱과 대화 컨텍스트가 정확도를 높이고, 핫워드 목록은 5,000단어, 대화 컨텍스트는 800토큰 또는 20턴으로 제한되며, Seed ASR 2.0은 그 컨텍스트를 요청당 한 장의 첨부 이미지로 확장합니다.
  • 화자 분리, 채널 분리, 신뢰도가 딸린 발화·단어 단위 타임스탬프, 민감어 필터링, 번체 중국어 변형은 모두 선택 플래그입니다.
  • 구두점은 기본으로 꺼져 있고 역텍스트 정규화는 켜져 있다는 점, 그리고 화자 분리는 스트리밍 모드에는 없는 파일 모드 전용 기능이라는 점에 유의하세요.
  • Synthorai는 이 서비스를 OpenAI 호환 전사 엔드포인트로 감쌉니다.

자주 묻는 질문

Seed ASR API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Seed ASR을 충분히 시험해 볼 수 있는 양입니다.

Seed ASR은 무엇에 가장 강한가요?

비동기 제출-조회 배치 전사, 자동 감지 지원의 수십 개 설정 가능 언어, 대화 컨텍스트가 첨부 이미지로 확장. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Seed ASR의 가격은 얼마인가요?

Synthorai에서 Seed ASR은 전사한 오디오 1분당 $0.002로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.

Seed ASR은 어떤 언어를 지원하나요?

Seed ASR은 `language`를 비워 두면 표준 중국어, 영어, 광둥어, 상하이어, 민난어, 쓰촨 방언, 산시 방언을 처리합니다. 39개 언어 키를 명시적으로 고정할 수 있고(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), 자동 감지(enable_auto_lang)도 선택할 수 있습니다를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

Seed ASR은 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="seed-asr-bigmodel"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →