Whisper v1은 다양한 오디오로 구성된 대규모 데이터셋으로 학습된 OpenAI의 범용 음성 인식 모델입니다.
- 입력
- 오디오
- 출력
- 텍스트
- 가격
- $0.006/min
가격의 위치
동종 11개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
오디오
| 언어 | 98개 언어로 학습; 57개 언어가 지원 대상으로 명시되며, transcriptions와 translations 엔드포인트 전반에서 단어 오류율 50% 미만이라는 OpenAI의 기준을 충족한 언어들 |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 미지원 |
| 스트리밍 전사 | 미지원 |
| 타임스탬프 | 지원 |
모델
| 모달리티 | 오디오 → 텍스트 |
|---|
- API로 서빙되는 오픈소스 Whisper large-v2
- 프롬프트는 224 토큰으로 제한
출처: OpenAI 공식 문서 ↗
30초 만에 Whisper v1 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Whisper v1 소개
- 전사, 다국어 음성 인식, 음성 번역, 언어 식별을 수행하는 멀티태스크 시스템이며, 과금은 단순히 처리된 오디오 분 단위로 이루어집니다.
- 더 새로운 GPT-4o 기반 전사 모델이 있음에도, 몇몇 작업에서는 여전히 OpenAI 오디오 스택에서 유일한 선택지입니다.
- 음성을 영어로 옮기는 translations 엔드포인트에서 서빙되는 유일한 모델이며, 세그먼트 또는 단어 단위 타임스탬프 granularity를 지원하는 유일한 모델입니다.
- 응답 형식 지원도 패밀리에서 가장 넓어 JSON, 일반 텍스트, verbose JSON, SRT, VTT를 아우르는데, 이는 자막 파이프라인에 필요한 것들입니다.
- 교환 관계도 그만큼 구체적입니다.
- 스트리밍 전사는 지원되지 않고, 프롬프트는 내용이 아니라 스타일을 유도하며(모델은 프롬프트의 구두점과 대소문자를 따라가는 경향이 있습니다), 프롬프트는 마지막 224 토큰만 반영됩니다.
- 공통 전사 제한이 적용되어 mp3, mp4, mpeg, mpga, m4a, wav, webm을 25MB까지 받습니다.
- OpenAI 문서는 이제 이 모델을 역사적 맥락에서 설명하지만, 모델 페이지에 폐기 고지는 없습니다.
- Synthorai는 OpenAI 호환 /v1/audio/transcriptions 경로에서 Whisper 작업을 받으므로 기존 클라이언트가 그대로 동작합니다.
자주 묻는 질문
Whisper v1 API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 Whisper v1을 충분히 시험해 볼 수 있는 양입니다.
Whisper v1은 무엇에 가장 강한가요?
멀티태스크: 전사·번역·언어 식별, 오디오 분당 단순 과금, 전사·번역 엔드포인트 전반 호환. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Whisper v1의 가격은 얼마인가요?
Synthorai에서 Whisper v1은 전사한 오디오 1분당 $0.006로 과금됩니다. 종량제, 플랫폼 마진 없음, 구독 불필요.
Whisper v1은 어떤 언어를 지원하나요?
Whisper v1은 98개 언어로 학습; 57개 언어가 지원 대상으로 명시되며, transcriptions와 translations 엔드포인트 전반에서 단어 오류율 50% 미만이라는 OpenAI의 기준을 충족한 언어들을 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
Whisper v1은 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="whisper-1"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.