seed-asr-bigmodel은 BytePlus에서 제공되는 ByteDance의 Seed-ASR 대형 모델 음성 인식 서비스로, 오디오 파일 인식 API에서 bigmodel 엔진으로 노출됩니다.
- 입력
- 오디오
- 출력
- 텍스트
- 가격
- $0.002/min
가격의 위치
동종 11개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
오디오
| 언어 | `language`를 비워 두면 표준 중국어, 영어, 광둥어, 상하이어, 민난어, 쓰촨 방언, 산시 방언을 처리합니다. 39개 언어 키를 명시적으로 고정할 수 있고(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), 자동 감지(enable_auto_lang)도 선택할 수 있습니다 |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 지원 |
| 스트리밍 전사 | 지원 |
| 타임스탬프 | 지원 |
모델
| 모달리티 | 오디오 → 텍스트 |
|---|
'seed-asr-bigmodel'이라는 공식 모델 id는 없습니다. BytePlus Seed Speech는 model_name 'bigmodel'과 리소스 id volc.bigasr.auc(Seed ASR 1.0) / volc.seedasr.auc(Seed ASR 2.0)를 사용합니다.
30초 만에 Seed ASR 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="seed-asr-bigmodel",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "seed-asr-bigmodel",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="seed-asr-bigmodel" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "seed-asr-bigmodel",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("seed-asr-bigmodel")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Seed ASR 소개
- 제출 후 조회하는 흐름으로 녹음을 비동기 전사하며 배치·오프라인 워크로드에 적합합니다.
- 호출자가 자체 요청 ID를 제공하고 이것이 작업 ID를 겸하며, 상태 코드가 완료를 보고할 때까지 폴링합니다.
- 결과는 3시간 이내에 생성되고 7일간 조회할 수 있습니다.
- 오디오는 OPUS, WAV, MP3, OGG, AMR, AAC, M4A로 최대 5시간, 512 MB까지, 모노 또는 스테레오로 받습니다.
- 기본적으로 표준 중국어, 영어, 광둥어와 여러 중국어 방언을 인식하고, 일본어부터 아랍어까지 수십 개 언어를 지정할 수 있으며 선택적 자동 언어 감지도 있는데, 둘 다 설정되면 자동 감지가 명시된 언어보다 우선합니다.
- 핫워드 바이어싱과 대화 컨텍스트가 정확도를 높이고, 핫워드 목록은 5,000단어, 대화 컨텍스트는 800토큰 또는 20턴으로 제한되며, Seed ASR 2.0은 그 컨텍스트를 요청당 한 장의 첨부 이미지로 확장합니다.
- 화자 분리, 채널 분리, 신뢰도가 딸린 발화·단어 단위 타임스탬프, 민감어 필터링, 번체 중국어 변형은 모두 선택 플래그입니다.
- 구두점은 기본으로 꺼져 있고 역텍스트 정규화는 켜져 있다는 점, 그리고 화자 분리는 스트리밍 모드에는 없는 파일 모드 전용 기능이라는 점에 유의하세요.
- Synthorai는 이 서비스를 OpenAI 호환 전사 엔드포인트로 감쌉니다.
자주 묻는 질문
Seed ASR API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Seed ASR을 충분히 시험해 볼 수 있는 양입니다.
Seed ASR은 무엇에 가장 강한가요?
비동기 제출-조회 배치 전사, 자동 감지 지원의 수십 개 설정 가능 언어, 대화 컨텍스트가 첨부 이미지로 확장. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Seed ASR의 가격은 얼마인가요?
Synthorai에서 Seed ASR은 전사한 오디오 1분당 $0.002로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.
Seed ASR은 어떤 언어를 지원하나요?
Seed ASR은 `language`를 비워 두면 표준 중국어, 영어, 광둥어, 상하이어, 민난어, 쓰촨 방언, 산시 방언을 처리합니다. 39개 언어 키를 명시적으로 고정할 수 있고(en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), 자동 감지(enable_auto_lang)도 선택할 수 있습니다를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
Seed ASR은 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="seed-asr-bigmodel"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.