GPT-4o Transcribe는 GPT-4o를 사용해 오디오를 전사하는 음성-텍스트 변환 모델로, OpenAI의 프리미엄 전사 제품 역할을 합니다.
- 입력
- 오디오 텍스트 $2.5/M
- 출력
- 텍스트 $10/M
- 오디오 입력
- $6/M
- 컨텍스트
- 16K
- 지식 컷오프
- 2024-06
벤치마크
벤더 공개: Alibaba (Qwen) ByteDance Google OpenAI
가격의 위치
동종 3개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 최대 출력(벤더 스펙) | 2,000 |
|---|---|
| 지식 컷오프 | 2024-06 |
오디오
| 언어 | 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용 |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 미지원 |
| 스트리밍 전사 | 지원 |
| 타임스탬프 | 미지원 |
모델
| 모달리티 | 오디오 + 텍스트 → 텍스트 |
|---|
출처: OpenAI 공식 문서 ↗
30초 만에 GPT-4o Transcribe 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());GPT-4o Transcribe 소개
- 공식 페이지는 원조 Whisper 모델 대비 단어 오류율 개선과 더 나은 언어 인식·정확도를 강점으로 꼽습니다.
- 요청은 16K 토큰 컨텍스트 윈도우와 최대 2K 출력 토큰을 가지며, 이 모델은 전사 엔드포인트와 실시간 엔드포인트 양쪽에서 서빙됩니다.
- 업로드는 전사 API의 공통 제한을 따릅니다. mp3, mp4, mpeg, mpga, m4a, wav, webm을 파일당 25MB까지 받으며, 더 긴 녹음은 클라이언트 쪽에서 분할해야 합니다.
- Whisper와 달리 프롬프트를 받아들이는데, OpenAI는 이를 다른 GPT-4o 모델에 프롬프트를 주는 것과 같은 방식으로 모델에 추가 컨텍스트를 제공해 전사 품질을 높이는 방법이라고 설명하며, 이름·전문 용어·제품 표기에 유용합니다.
- 스트리밍 전사가 지원되고, 신뢰도를 다루는 파이프라인을 위한 로그 확률도 제공됩니다.
- 통합을 좌우하는 제약은 두 가지입니다.
- 출력은 JSON 또는 일반 텍스트로만 제공되며 SRT, VTT, verbose JSON은 없고, 단어 또는 세그먼트 단위 타임스탬프 granularity는 이 모델에서 제공되지 않습니다.
- 언어 커버리지는 전사 API가 공개한 70개 이상 언어 목록을 따르는데, OpenAI는 보편적 지원을 주장하는 대신 단어 오류율 임계값으로 이 목록을 통제합니다.
- 지식 컷오프는 2024년 6월입니다.
- OpenAI는 스트리밍이 우선순위가 아닐 때의 더 높은 정확도 선택지로 이 모델을 설명합니다.
- Synthorai에서는 OpenAI 호환 /v1/audio/transcriptions 경로에 변경 없이 그대로 연결됩니다.
자주 묻는 질문
GPT-4o Transcribe API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 GPT-4o Transcribe를 충분히 시험해 볼 수 있는 양입니다.
GPT-4o Transcribe는 무엇에 가장 강한가요?
프리미엄 전사 티어, 오리지널 Whisper보다 나은 언어 인식, 전사·실시간 엔드포인트 양쪽에서 서빙. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
GPT-4o Transcribe의 가격은 얼마인가요?
Synthorai에서 GPT-4o Transcribe는 입력 토큰 100만 개당 $2.5, 출력 토큰 100만 개당 $10입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.
GPT-4o Transcribe는 어떤 언어를 지원하나요?
GPT-4o Transcribe는 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용을 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
GPT-4o Transcribe는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gpt-4o-transcribe"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.