Chirp 3는 Speech-to-Text v2 API에서 제공되는 Google의 다국어 ASR 특화 생성형 모델의 최신 세대로, 2025년 10월부터 US와 EU 멀티 리전에서 정식 제공됩니다.
- 입력
- 오디오
- 출력
- 텍스트
- 가격
- $0.016/min
가격의 위치
동종 11개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
오디오
| 언어 | StreamingRecognize, Recognize, BatchRecognize 전반에 걸쳐 GA 29개 + 프리뷰 82개 로케일(총 111개, 화자 분리는 그중 14개) |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 지원 |
| 스트리밍 전사 | 지원 |
| 타임스탬프 | 지원 |
모델
| 모달리티 | 오디오 → 텍스트 |
|---|
- 공식 모델 id는 chirp_3
- Speech-to-Text 릴리스 노트 기준 2025-04-11 비공개 프리뷰, 2025-10-13 GA
- 오디오 기준 과금
출처: Google 공식 문서 ↗
30초 만에 Chirp 3 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Chirp 3 소개
- 공식 문서는 이전 Chirp 모델을 넘어서는 향상된 정확도와 속도에 더해 화자 분리와 자동 언어 감지라는 두 가지 새 기능을 강조합니다.
- 정식 제공과 프리뷰 티어를 합쳐 100개가 넘는 로케일을 공개하고, 자동 구두점·대문자 처리를 생성하며, 최대 1,000개의 문구 힌트를 통한 음성 적응을 받아들이지만, Google은 적응 대상이 아닌 표현의 품질이 떨어지지 않도록 항목을 가능한 한 적게 쓰라고 권합니다.
- 스트리밍·동기·배치 인식을 모두 지원하고, 화자 분리는 14개 언어에 걸쳐 배치 인식에서 사용할 수 있습니다.
- 새로 추가된 제어로는 전사 서식을 유도하는 프리뷰 단계의 커스텀 프롬프트, Google이 배경의 사람 목소리는 제거할 수 없다고 경고하는 디노이저 플래그, 그리고 standard·short·supershort의 엔드포인팅 민감도가 있습니다.
- 이번 업그레이드는 순수한 추가가 아니므로 전환 전에 빠진 부분을 확인할 만합니다.
- Chirp 3는 단어 단위가 아닌 발화 단위 타임스탬프를 문서화하고, 음성 번역이나 비속어 필터를 문서화하지 않으며, 배치 오디오 상한이 Chirp 2의 8시간에 비해 1시간, 타임스탬프를 켜면 20분입니다.
- Synthorai에서 Chirp 3는 다른 모든 음성 모델과 동일한 OpenAI 호환 전사 인터페이스로 접근할 수 있습니다.
자주 묻는 질문
Chirp 3 API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Chirp 3을 충분히 시험해 볼 수 있는 양입니다.
Chirp 3은 무엇에 가장 강한가요?
화자 분리와 자동 언어 감지, 100개 이상의 언어·변형 전사, 최대 1,000개 문구 힌트의 음성 적응. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Chirp 3의 가격은 얼마인가요?
Synthorai에서 Chirp 3은 전사한 오디오 1분당 $0.016로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.
Chirp 3은 어떤 언어를 지원하나요?
Chirp 3은 StreamingRecognize, Recognize, BatchRecognize 전반에 걸쳐 GA 29개 + 프리뷰 82개 로케일(총 111개, 화자 분리는 그중 14개)를 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
Chirp 3은 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="chirp-3"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.