신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

GPT-4o Transcribe

2025-03-20 출시

transcription

GPT-4o Transcribe는 GPT-4o를 사용해 오디오를 전사하는 음성-텍스트 변환 모델로, OpenAI의 프리미엄 전사 제품 역할을 합니다.

입력
오디오 텍스트 $2.5/M
출력
텍스트 $10/M
오디오 입력
$6/M
컨텍스트
16K
지식 컷오프
2024-06

벤치마크

평균 상회비교 가능 1개뿐
GPT-4o Transcribe 측정된 다른 모델 측정 대상 평균 더 높은 점수를 낸 모델 없음
WenetSpeech test-net (CER)
15.3%

벤더 공개: Alibaba (Qwen) ByteDance Google OpenAI

가격의 위치

동종 3개 모델 중 가격 위치

입력$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
출력$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

최대 출력(벤더 스펙) 2,000
지식 컷오프 2024-06

오디오

언어 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용
오디오 제한
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, 최대 25MB
  • 스트리밍 전사 지원(Realtime 전사 세션 포함)
  • json/text 출력만 가능
  • 단어 타임스탬프와 화자 분리 없음
화자 분리 미지원
스트리밍 전사 지원
타임스탬프 미지원

모델

모달리티 오디오 + 텍스트 → 텍스트

출처: OpenAI 공식 문서 ↗

30초 만에 GPT-4o Transcribe 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

GPT-4o Transcribe 소개

  • 공식 페이지는 원조 Whisper 모델 대비 단어 오류율 개선과 더 나은 언어 인식·정확도를 강점으로 꼽습니다.
  • 요청은 16K 토큰 컨텍스트 윈도우와 최대 2K 출력 토큰을 가지며, 이 모델은 전사 엔드포인트와 실시간 엔드포인트 양쪽에서 서빙됩니다.
  • 업로드는 전사 API의 공통 제한을 따릅니다. mp3, mp4, mpeg, mpga, m4a, wav, webm을 파일당 25MB까지 받으며, 더 긴 녹음은 클라이언트 쪽에서 분할해야 합니다.
  • Whisper와 달리 프롬프트를 받아들이는데, OpenAI는 이를 다른 GPT-4o 모델에 프롬프트를 주는 것과 같은 방식으로 모델에 추가 컨텍스트를 제공해 전사 품질을 높이는 방법이라고 설명하며, 이름·전문 용어·제품 표기에 유용합니다.
  • 스트리밍 전사가 지원되고, 신뢰도를 다루는 파이프라인을 위한 로그 확률도 제공됩니다.
  • 통합을 좌우하는 제약은 두 가지입니다.
  • 출력은 JSON 또는 일반 텍스트로만 제공되며 SRT, VTT, verbose JSON은 없고, 단어 또는 세그먼트 단위 타임스탬프 granularity는 이 모델에서 제공되지 않습니다.
  • 언어 커버리지는 전사 API가 공개한 70개 이상 언어 목록을 따르는데, OpenAI는 보편적 지원을 주장하는 대신 단어 오류율 임계값으로 이 목록을 통제합니다.
  • 지식 컷오프는 2024년 6월입니다.
  • OpenAI는 스트리밍이 우선순위가 아닐 때의 더 높은 정확도 선택지로 이 모델을 설명합니다.
  • Synthorai에서는 OpenAI 호환 /v1/audio/transcriptions 경로에 변경 없이 그대로 연결됩니다.

자주 묻는 질문

GPT-4o Transcribe API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 GPT-4o Transcribe를 충분히 시험해 볼 수 있는 양입니다.

GPT-4o Transcribe는 무엇에 가장 강한가요?

프리미엄 전사 티어, 오리지널 Whisper보다 나은 언어 인식, 전사·실시간 엔드포인트 양쪽에서 서빙. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

GPT-4o Transcribe의 가격은 얼마인가요?

Synthorai에서 GPT-4o Transcribe는 입력 토큰 100만 개당 $2.5, 출력 토큰 100만 개당 $10입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

GPT-4o Transcribe는 어떤 언어를 지원하나요?

GPT-4o Transcribe는 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용을 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

GPT-4o Transcribe는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gpt-4o-transcribe"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →