신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Qwen3-ASR Flash

2025-09-08 출시

transcription

Qwen3-ASR Flash는 Qwen3 라인의 음성 인식 모델로, 최대 10 MB, 5분 길이의 오디오 파일을 전사하면서 실시간 진행 상황 피드백을 위한 스트리밍 중간 결과를 제공합니다.

입력
오디오
출력
텍스트
가격
$0.0021/min

가격의 위치

동종 11개 모델 중 가격 위치

분당$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

오디오

언어 모든 Qwen-ASR 모델이 공유하는 단일 목록의 26개 언어: 중국어(표준어, 쓰촨어, 민난어, 우어, 광둥어), 영어, 일본어, 독일어, 한국어, 러시아어, 프랑스어, 포르투갈어, 아랍어, 이탈리아어, 스페인어, 힌디어, 인도네시아어, 태국어, 터키어, 우크라이나어, 베트남어, 체코어, 덴마크어, 필리핀어, 핀란드어, 아이슬란드어, 말레이어, 노르웨이어, 폴란드어, 스웨덴어
오디오 제한
  • 동기 인식 10MB 이하 / 5분 이하, 스트리밍 또는 비스트리밍 출력
  • 26개 언어에 걸친 자동 언어 식별
  • 컨텍스트 텍스트 주입
  • 가창 인식
  • 화자 분리 없음
  • OpenAI 호환 응답에는 타임스탬프 필드가 없음(필요하면 qwen3-asr-flash-filetrans 사용)
화자 분리 미지원
스트리밍 전사 지원
타임스탬프 미지원

모델

모달리티 오디오 → 텍스트
  • Qwen3-Omni 베이스 위에 구축됨
  • 서빙되는 flash API 모델은 상용 모델(오픈 공개된 Qwen3-ASR 0.6B/1.7B은 별개의 모델)

출처: Alibaba 공식 문서 ↗

30초 만에 Qwen3-ASR Flash 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Qwen3-ASR Flash 소개

  • 공식 문서는 약 30개 언어에 걸친 인식을 강조하는데 여기에는 다섯 가지 중국어 변형(표준어, 쓰촨어, 민난어, 우어, 광둥어)이 포함되며, Fun-ASR 형제 모델에는 없는 능력으로 전사와 함께 감정을 감지하는 기능을 꼽습니다.
  • Qwen3-ASR 시리즈는 음악이나 노래가 섞인 음성에 대한 견고한 인식으로도 알려져 있습니다.
  • 감정 라벨링은 항상 켜져 있고 놀람, 중립, 기쁨, 슬픔, 혐오, 분노, 두려움의 일곱 가지 상태 중 하나를 반환하며, 언어를 지정하지 않으면 언제나 자동으로 감지되고 여러 언어가 섞인 오디오에도 적용됩니다.
  • 도메인 용어의 정확도를 유도하는 방식은 Fun-ASR 패밀리와 다릅니다.
  • 핫워드 목록을 업로드하는 대신 요청과 함께 컨텍스트 텍스트를 주입하므로, 호출마다 달라지는 어휘에 적합합니다.
  • 단어 수준 타임스탬프는 문서화된 일부 언어에서 켤 수 있고, 역텍스트 정규화는 제공되지만 기본은 꺼짐입니다.
  • 오디오는 폭넓은 컨테이너와 코덱 형식으로 받아들이며, 이 모델은 OpenAI 호환 경로와 Alibaba 자체 동기 인터페이스 양쪽으로 접근할 수 있습니다.
  • 화자 분리는 제공되지 않고 5분 상한은 확고합니다.
  • 더 긴 녹음은 Alibaba가 별도의 파일 전사 모델로 보냅니다.
  • Synthorai는 OpenAI 호환 전사 엔드포인트로 이 모델을 제공합니다.

자주 묻는 질문

Qwen3-ASR Flash API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Qwen3-ASR Flash를 충분히 시험해 볼 수 있는 양입니다.

Qwen3-ASR Flash는 무엇에 가장 강한가요?

전사와 동시에 감정 감지, 약 30개 언어, 다섯 가지 중국어 변형, 음악 섞인 음성에도 견고. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Qwen3-ASR Flash의 가격은 얼마인가요?

Synthorai에서 Qwen3-ASR Flash는 전사한 오디오 1분당 $0.0021로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.

Qwen3-ASR Flash는 어떤 언어를 지원하나요?

Qwen3-ASR Flash는 모든 Qwen-ASR 모델이 공유하는 단일 목록의 26개 언어: 중국어(표준어, 쓰촨어, 민난어, 우어, 광둥어), 영어, 일본어, 독일어, 한국어, 러시아어, 프랑스어, 포르투갈어, 아랍어, 이탈리아어, 스페인어, 힌디어, 인도네시아어, 태국어, 터키어, 우크라이나어, 베트남어, 체코어, 덴마크어, 필리핀어, 핀란드어, 아이슬란드어, 말레이어, 노르웨이어, 폴란드어, 스웨덴어를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

Qwen3-ASR Flash는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="qwen3-asr-flash"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →