GPT-4o Transcribe Diarize는 누가 언제 말하는지를 식별하는 자동 음성 인식 모델입니다.
- 입력
- 오디오 텍스트 $2.5/M
- 출력
- 텍스트 $2.5/M
- 오디오 입력
- $6.25/M
- 컨텍스트
- 16K
- 지식 컷오프
- 2024-06
가격의 위치
동종 3개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 최대 출력(벤더 스펙) | 2,000 |
|---|---|
| 지식 컷오프 | 2024-06 |
오디오
| 언어 | 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용 |
|---|---|
| 오디오 제한 |
|
| 화자 분리 | 지원 |
| 스트리밍 전사 | 지원 |
| 타임스탬프 | 지원 |
모델
| 모달리티 | 오디오 + 텍스트 → 텍스트 |
|---|
화자 분리를 내장한 유일한 OpenAI 전사 모델.
출처: OpenAI 공식 문서 ↗
30초 만에 GPT-4o Transcribe Diarize 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());GPT-4o Transcribe Diarize 소개
- 대화 속 오디오 구간을 서로 다른 화자와 연결해, 전사본이 무엇을 말했는지뿐 아니라 누가 말했는지까지 담게 합니다.
- GPT-4o 전사 패밀리의 16K 토큰 컨텍스트 윈도우와 2K 최대 출력 토큰을 공유하며, 일반 챗이 아니라 전사 엔드포인트 전용으로 만들어졌습니다.
- OpenAI는 이 모델이 Transcription API로만 제공되고 Realtime API에서는 제공되지 않는다고 명확히 밝힙니다.
- 세그먼트 타임스탬프와 함께 화자 레이블을 담는 diarized JSON 응답 형식을 반환하는 유일한 OpenAI 모델이며, 일반 JSON과 텍스트도 사용할 수 있지만 SRT, VTT, verbose JSON은 지원되지 않습니다.
- 이 모델에만 해당하는 동작이 두 가지 있습니다.
- 30초를 넘는 오디오에는 청킹 전략이 필요한데 자동이거나 직접 제공하는 음성 활동 감지 설정이어야 하고, 프롬프팅은 아예 제공되지 않으므로 형제 모델에서 통하던 컨텍스트 요령은 여기서는 쓸 수 없습니다.
- 각각 몇 초짜리 참조 클립을 최대 네 개까지 제공해 화자 이름을 미리 지정할 수도 있습니다.
- 스트리밍은 동작하지만 화자 배정은 단어 단위가 아니라 세그먼트 단위로 확정됩니다.
- 회의록, 콜 분석, 인터뷰 도구가 자연스러운 적용처입니다.
- Synthorai는 형제 모델들과 동일한 OpenAI 호환 전사 API로 이 모델을 노출합니다.
자주 묻는 질문
GPT-4o Transcribe Diarize API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 GPT-4o Transcribe Diarize를 충분히 시험해 볼 수 있는 양입니다.
GPT-4o Transcribe Diarize는 무엇에 가장 강한가요?
내장 화자 분리, 누가 말했는지 담는 전사본, 회의록·통화 분석에 적합. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
GPT-4o Transcribe Diarize의 가격은 얼마인가요?
Synthorai에서 GPT-4o Transcribe Diarize는 입력 토큰 100만 개당 $2.5, 출력 토큰 100만 개당 $2.5입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.
GPT-4o Transcribe Diarize는 어떤 언어를 지원하나요?
GPT-4o Transcribe Diarize는 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용을 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.
GPT-4o Transcribe Diarize는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gpt-4o-transcribe-diarize"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.