Fun-ASR은 Alibaba Cloud Model Studio의 녹음 파일 음성 인식 모델로, 사전 녹음된 오디오의 오프라인 전사를 위한 것입니다.
- 입력
- 오디오
- 출력
- 텍스트
- 가격
- $0.0021/min
가격의 위치
동종 11개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
오디오
| 언어 | 방언을 포함한 다국어, 30개 언어: 중국어(표준어, 광둥어, 우어, 민난어, 하카어, 간어, 샹어, 진어 및 지역 억양), 영어, 일본어, 한국어, 베트남어, 태국어, 인도네시아어, 말레이어, 필리핀어, 힌디어, 아랍어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 이탈리아어, 네덜란드어, 스웨덴어, 덴마크어, 핀란드어, 노르웨이어, 그리스어, 폴란드어, 체코어, 헝가리어, 루마니아어, 불가리아어, 크로아티아어, 슬로바키아어 |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 지원 |
| 스트리밍 전사 | 미지원 |
| 타임스탬프 | 지원 |
모델
| 모달리티 | 오디오 → 텍스트 |
|---|
- 2025-12에 가창 인식 추가
- 오픈소스로 공개된 Fun-ASR-Nano는 여기서 서빙하는 가중치와 별개의 모델
출처: Alibaba 공식 문서 ↗
30초 만에 Fun-ASR 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Fun-ASR 소개
- 최대 12시간, 2 GB까지의 파일을 받아 단일 파일과 배치 작업을 처리하고, 중국어(표준어와 광둥어·우어·민난어 등 다수의 지역 방언), 영어, 일본어, 한국어를 비롯한 수십 개 언어를 인식합니다.
- 공식 문서는 도메인 용어를 위한 핫워드 커스터마이징과 다중 화자 녹음을 위한 화자 분리를 강조합니다.
- 두 기능 모두 미리 알아 둘 실무적인 세부 사항이 있습니다.
- 핫워드 테이블은 최대 500개 항목을 담으며 좀처럼 바뀌지 않는 용어에 적합하고, 화자 분리는 켜기 전까지는 꺼져 있으며 예상 화자 수를 선언할 수 있습니다.
- 또한 Alibaba는 화자 분리를 적용하는 오디오를 약 두 시간 이내로 유지할 것을 권장하는데, 그렇지 않으면 작업이 타임아웃될 수 있습니다.
- 전사는 비동기 방식이며(파일을 제출해 작업 id를 받고 결과를 폴링), 밀리초 단위의 문장 및 단어 수준 타임스탬프가 기본으로 반환되고, 민감어 필터링과 다중 트랙 녹음의 채널별 선택도 함께 제공됩니다.
- 감정 라벨링은 이 모델에 포함되지 않으며 Qwen3-ASR 계열의 몫입니다.
- 언어 힌트를 받아들이기는 하지만 문서는 목록의 첫 번째 값만 읽힌다고 밝힙니다.
- Synthorai는 OpenAI 호환 엔드포인트로 Fun-ASR을 서빙하므로 기존 전사 클라이언트가 수정 없이 동작합니다.
자주 묻는 질문
Fun-ASR API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Fun-ASR을 충분히 시험해 볼 수 있는 양입니다.
Fun-ASR은 무엇에 가장 강한가요?
최대 12시간 파일 수용, 도메인 용어용 핫워드 커스터마이징, 다중 화자 녹음의 화자 분리. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Fun-ASR의 가격은 얼마인가요?
Synthorai에서 Fun-ASR은 전사한 오디오 1분당 $0.0021로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.
Fun-ASR은 어떤 언어를 지원하나요?
Fun-ASR은 방언을 포함한 다국어, 30개 언어: 중국어(표준어, 광둥어, 우어, 민난어, 하카어, 간어, 샹어, 진어 및 지역 억양), 영어, 일본어, 한국어, 베트남어, 태국어, 인도네시아어, 말레이어, 필리핀어, 힌디어, 아랍어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 이탈리아어, 네덜란드어, 스웨덴어, 덴마크어, 핀란드어, 노르웨이어, 그리스어, 폴란드어, 체코어, 헝가리어, 루마니아어, 불가리아어, 크로아티아어, 슬로바키아어를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
Fun-ASR은 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="fun-asr"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.