신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Paraformer Realtime v2

transcription

Paraformer-Realtime-v2는 Alibaba Cloud의 이전 세대 실시간 음성 인식 모델로, 양방향 연결로 오디오를 흘려보내고 전사 결과를 받습니다.

입력
오디오
출력
텍스트
가격
$0.002/min

가격의 위치

동종 11개 모델 중 가격 위치

분당$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

오디오

언어 7개 언어: 중국어(표준어와 광둥어, 우어, 민난어 및 15개 지역 억양), 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어
오디오 제한
  • 실시간 WebSocket 스트리밍, 길이 제한 없음
  • 핫워드 + language_hints
  • 단어/문장 타임스탬프
  • 중국어 방언/영어/일본어/한국어/독일어/프랑스어/러시아어
스트리밍 전사 지원
타임스탬프 지원

모델

모달리티 오디오 → 텍스트

핫워드 커스터마이징과 다국어 커버리지를 갖춘 스트리밍 우선 Paraformer 세대.

출처: Alibaba 공식 문서 ↗

30초 만에 Paraformer Realtime v2 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Paraformer Realtime v2 소개

  • 중국어 표준어와 함께 이례적으로 폭넓은 지역 방언(광둥어, 우어, 민난어, 쓰촨어 등)에 더해 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어를 인식하며, 감지를 유도하는 language_hints 파라미터를 지원합니다.
  • 이는 v2에서만 추가된 기능이며, 이전 버전이 16 kHz를 요구했던 것과 달리 임의의 샘플링 레이트를 받아들이는 것도 마찬가지입니다.
  • Alibaba 문서는 이제 신규 프로젝트에 Fun-ASR이나 Qwen-ASR을 권장하며, 이 모델은 기존 통합을 위한 것으로 포지셔닝합니다.
  • 그럼에도 계속 쓸 만한 이유는 성숙한 파라미터 인터페이스입니다.
  • 도메인 어휘를 위한 핫워드 테이블, 기본으로 켜져 있는 역텍스트 정규화, 기본으로 켜져 있는 구두점 예측과 선택적 의미 기반 구두점, 발화를 닫는 설정 가능한 최대 문장 묵음 구간, 그리고 군말을 제거하는 선택적 비유창성 필터(Fun-ASR 실시간 모델에는 문서화되어 있지 않은 제어)입니다.
  • 문장 및 단어 수준 타임스탬프가 밀리초 단위로 반환되고, 연결은 PCM, WAV, MP3, Opus, Speex, AAC, AMR을 받아들입니다.
  • 실시간 경로에서는 화자 분리가 제공되지 않으며 감정 인식도 없습니다.
  • 새 작업의 출발점이라기보다 이 모델에 맞춰 이미 튜닝된 파이프라인을 위한 안정적인 엔드포인트로 보시면 됩니다.
  • Synthorai는 OpenAI 호환 엔드포인트로 이 모델을 계속 서빙합니다.

자주 묻는 질문

Paraformer Realtime v2 API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Paraformer Realtime v2를 충분히 시험해 볼 수 있는 양입니다.

Paraformer Realtime v2는 무엇에 가장 강한가요?

오디오 스트리밍 입력, 전사 스트리밍 출력, 이례적으로 넓은 중국어 지역 방언 커버리지, 감지를 유도하는 language_hints 파라미터. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Paraformer Realtime v2의 가격은 얼마인가요?

Synthorai에서 Paraformer Realtime v2는 전사한 오디오 1분당 $0.002로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.

Paraformer Realtime v2는 어떤 언어를 지원하나요?

Paraformer Realtime v2는 7개 언어: 중국어(표준어와 광둥어, 우어, 민난어 및 15개 지역 억양), 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

Paraformer Realtime v2는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="paraformer-realtime-v2"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →