신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Chirp 2

transcription

Chirp 2는 Speech-to-Text v2 API로 제공되는 Google Cloud의 다국어 자동 음성 인식 모델입니다.

입력
오디오
출력
텍스트
가격
$0.016/min

가격의 위치

동종 11개 모델 중 가격 위치

분당$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

오디오

언어 메서드에 따라 다름: BatchRecognize가 가장 폭넓은 커버리지를 제공하고 Recognize는 “Chirp와 동등한 수준”; StreamingRecognize는 16개 로케일로 제한(중국어 간체/번체, 광둥어, 영어 AU/IN/GB/US, 프랑스어 CA/FR, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어(브라질), 스페인어 ES/US)
오디오 제한
  • 오디오 디코딩 자동 감지
  • 동기 Recognize는 1분 미만, BatchRecognize는 1분-8시간, 실시간은 StreamingRecognize
  • 단어 단위 타임스탬프 선택 가능
  • 언어 불문 전사(모델이 오디오에서 우세한 언어를 추론해 그 언어로 전사)
  • 독립적인 언어 감지 없음
  • 화자 분리 없음
  • 음성 번역 지원
화자 분리 미지원
스트리밍 전사 지원
타임스탬프 지원

모델

모달리티 오디오 → 텍스트
  • 공식 Speech-to-Text V2 모델 id는 chirp_2(밑줄)
  • GA 상태이며 2025-01-27에 리전 GA 확장(us-central1/europe-west4/asia-southeast1)
  • 오디오 기준 과금

출처: Google 공식 문서 ↗

30초 만에 Chirp 2 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Chirp 2 소개

  • Google은 원조 Chirp 대비 정확도와 속도를 모두 개선하면서 단어 단위 타임스탬프, 모델 적응(문구 바이어싱), 음성 번역을 추가한 모델로 포지셔닝합니다.
  • 자동 구두점·대문자 처리, 모델이 오디오에서 우세한 언어를 추론해 그 언어로 옮기는 언어 불문 전사, 비속어 필터링을 제공하고, 1분 미만부터 8시간까지의 오디오에 대해 스트리밍·동기·배치 인식을 지원하는데, 이 8시간은 Chirp 계열 모델 중 가장 긴 배치 상한입니다.
  • 스트리밍은 16개 로케일을 커버하고, 배치는 패밀리에서 가장 광범위한 언어 지원을 갖추고 있습니다.
  • 단어 단위 타임스탬프는 옵트인 방식이며, Google은 이를 켜면 전사 품질과 속도가 약간 저하된다고 밝힙니다.
  • 함께 반환되는 단어 단위 신뢰도 값은 진짜 신뢰도 점수가 아니라고 문서화되어 있습니다.
  • 적응은 단순한 단어와 문구를 받지만 클래스 토큰과 커스텀 클래스는 지원하지 않습니다.
  • 음성 번역은 비대칭 쌍으로 동작해 27개 소스 언어를 US English로, 그로부터 18개 대상 언어로 번역하며, 강제 정규화와 디노이저가 기능 세트를 마무리합니다.
  • 하나 크게 비어 있는 것은 화자 분리로, Google은 이를 지원하지 않는다고 표기합니다.
  • 바로 그 기능이 Chirp 3로 옮길 이유입니다.
  • 제공 범위는 소수의 리전으로 제한됩니다.
  • Synthorai는 OpenAI 호환 오디오 엔드포인트로 Chirp 2 전사를 서빙합니다.

자주 묻는 질문

Chirp 2 API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Chirp 2를 충분히 시험해 볼 수 있는 양입니다.

Chirp 2는 무엇에 가장 강한가요?

전작 대비 향상된 정확도와 속도, 단어 단위 타임스탬프와 음성 번역, 1분 미만부터 8시간까지의 오디오. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Chirp 2의 가격은 얼마인가요?

Synthorai에서 Chirp 2는 전사한 오디오 1분당 $0.016로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.

Chirp 2는 어떤 언어를 지원하나요?

Chirp 2는 메서드에 따라 다름: BatchRecognize가 가장 폭넓은 커버리지를 제공하고 Recognize는 “Chirp와 동등한 수준”; StreamingRecognize는 16개 로케일로 제한(중국어 간체/번체, 광둥어, 영어 AU/IN/GB/US, 프랑스어 CA/FR, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어(브라질), 스페인어 ES/US)를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

Chirp 2는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="chirp-2"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →