신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Fun-ASR Realtime

2025-09-23 출시

transcription

Fun-ASR Realtime은 Alibaba의 스트리밍 음성 인식 모델입니다.

입력
오디오
출력
텍스트
가격
$0.002/min

가격의 위치

동종 11개 모델 중 가격 위치

분당$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

오디오

언어 방언을 포함한 다국어, 30개 언어: 중국어(표준어, 광둥어, 우어, 민난어, 하카어, 간어, 샹어, 진어 및 지역 억양), 영어, 일본어, 한국어, 베트남어, 태국어, 인도네시아어, 말레이어, 필리핀어, 힌디어, 아랍어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 이탈리아어, 네덜란드어, 스웨덴어, 덴마크어, 핀란드어, 노르웨이어, 그리스어, 폴란드어, 체코어, 헝가리어, 루마니아어, 불가리아어, 크로아티아어, 슬로바키아어
오디오 제한
  • 실시간 WebSocket 스트리밍, 길이 제한 없음
  • RAG 기반 대규모 핫워드
  • 밀리초 단위 타임스탬프
  • VAD 턴 감지
화자 분리 미지원
스트리밍 전사 지원
타임스탬프 지원

모델

모달리티 오디오 → 텍스트

문서의 실시간 가이드에는 7가지 상태의 감정 인식도 설명되어 있음.

출처: Alibaba 공식 문서 ↗

30초 만에 Fun-ASR Realtime 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Fun-ASR Realtime 소개

  • 오디오를 지속 연결로 흘려보내면 텍스트가 낮은 지연 시간으로 스트리밍되어 돌아오며, 스트림 길이에는 상한이 없습니다.
  • 공식 문서는 실시간 자막, 음성 어시스턴트, 회의 전사를 대상으로 이 모델을 포지셔닝하고, 핫워드 커스터마이징과 중국어 지역 방언·영어·일본어·한국어를 포함하는 다국어 커버리지라는 Fun-ASR 패밀리의 강점을 그대로 갖추고 있습니다.
  • 실시간 인터페이스에는 파일 기반 모델에 필요 없는 제어가 추가됩니다.
  • 의미 기반 구두점, 기본으로 켜져 있는 구두점 예측, 발화를 언제 닫을지 결정하는 조정 가능한 최대 문장 묵음 구간, 배경음에 맞춰 조정하는 음성·잡음 임계값, 그리고 스트림이 흐르는 동안 방출되는 단어 수준 타임스탬프입니다.
  • 오디오는 8 또는 16 kHz의 PCM, WAV, MP3, Opus, Speex, AAC, AMR으로 들어옵니다.
  • 설계 시 감안할 제약이 두 가지 있습니다.
  • 실시간 경로에서는 화자 분리를 쓸 수 없고(누가 말했는지가 필요하면 녹음 파일 모델을 써야 합니다), 언어 커버리지가 패밀리 전반에 균일하지 않고 날짜별 스냅샷에 따라 크게 달라지므로 필요한 언어 세트가 있는 스냅샷을 고정해야 합니다.
  • Qwen3-ASR 계열의 차별점인 감정 라벨링도 여기서는 제공되지 않으며, 컨텍스트 기반 정확도 튜닝은 일부 스냅샷에서만 가능합니다.
  • Synthorai는 나머지 오디오 카탈로그와 동일한 OpenAI 호환 인터페이스로 이 모델을 호출할 수 있게 합니다.

자주 묻는 질문

Fun-ASR Realtime API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Fun-ASR Realtime를 충분히 시험해 볼 수 있는 양입니다.

Fun-ASR Realtime는 무엇에 가장 강한가요?

길이 제한 없는 스트리밍 전사, 라이브 자막·회의용 설계, 다국어 커버리지의 핫워드 커스터마이징. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Fun-ASR Realtime의 가격은 얼마인가요?

Synthorai에서 Fun-ASR Realtime는 전사한 오디오 1분당 $0.002로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.

Fun-ASR Realtime는 어떤 언어를 지원하나요?

Fun-ASR Realtime는 방언을 포함한 다국어, 30개 언어: 중국어(표준어, 광둥어, 우어, 민난어, 하카어, 간어, 샹어, 진어 및 지역 억양), 영어, 일본어, 한국어, 베트남어, 태국어, 인도네시아어, 말레이어, 필리핀어, 힌디어, 아랍어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 이탈리아어, 네덜란드어, 스웨덴어, 덴마크어, 핀란드어, 노르웨이어, 그리스어, 폴란드어, 체코어, 헝가리어, 루마니아어, 불가리아어, 크로아티아어, 슬로바키아어를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

Fun-ASR Realtime는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="fun-asr-realtime"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →