신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

GPT-4o Mini Transcribe

2025-03-20 출시

transcription

GPT-4o Mini Transcribe는 GPT-4o mini로 구동되는 음성-텍스트 변환 모델로, 원조 Whisper 모델 대비 단어 오류율이 개선되고 언어 인식과 정확도가 향상되었습니다.

입력
오디오 텍스트 $1.25/M
출력
텍스트 $5/M
오디오 입력
$3/M
컨텍스트
16K
지식 컷오프
2024-06

벤치마크

GPT-4o Mini Transcribe: 33개 공개되었지만, 비교할 만큼 다른 모델이 측정한 항목이 없다.

GPT-4o Mini Transcribe 측정된 다른 모델 측정 대상 평균 더 높은 점수를 낸 모델 없음
FLEURS Arabic (WER)
14.06%

벤더 공개: OpenAI

가격의 위치

동종 3개 모델 중 가격 위치

입력$1.25/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
출력$5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

최대 출력(벤더 스펙) 2,000
지식 컷오프 2024-06

오디오

언어 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용
오디오 제한
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, 최대 25MB
  • 스트리밍 전사 지원
  • json/text 출력만 가능
  • 단어 타임스탬프와 화자 분리 없음
화자 분리 미지원
스트리밍 전사 지원
타임스탬프 미지원

모델

모달리티 오디오 + 텍스트 → 텍스트

GPT-4o 전사의 비용 효율 티어.

출처: OpenAI 공식 문서 ↗

30초 만에 GPT-4o Mini Transcribe 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-mini-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

GPT-4o Mini Transcribe 소개

  • OpenAI 전사 라인업의 비용 효율적인 선택지로, GPT-4o Transcribe의 오디오 입력 요율의 절반 가격이며 16K 토큰 컨텍스트 윈도우와 요청당 최대 2K 출력 토큰을 제공합니다.
  • 패밀리의 운용 범위를 그대로 공유합니다. mp3, mp4, mpeg, mpga, m4a, wav, webm 파일을 25MB까지 받고, 스트리밍 전사, 이름과 도메인 어휘를 위한 프롬프트 기반 컨텍스트 주입, 요청 시 로그 확률을 제공하며, 출력은 JSON 또는 일반 텍스트로 제한되고 타임스탬프 granularity는 없습니다.
  • 스냅샷을 고정할 만한 변경이 두 가지 있습니다.
  • OpenAI가 날짜 없는 별칭을 2025년 12월 스냅샷으로 옮기면서 버전을 고정하지 않은 통합은 조용히 모델이 바뀌었고, 원래의 2025년 3월 스냅샷은 이후 퇴역 일정이 잡혔습니다.
  • 2026년 초에는 Batch API 지원이 추가되어 대규모 오프라인 백로그를 더 저렴하게 처리할 수 있게 되었습니다.
  • 큰 형제 모델과 마찬가지로 전사 엔드포인트와 실시간 전사 세션 양쪽에서 서빙되고, 전사 API가 공개한 70개 이상 언어 목록을 커버하며, 지식 컷오프는 2024년 6월입니다.
  • 정확도도 여전히 중요하지만 토큰당 오디오 비용이 아키텍처를 결정하고, 화자가 구분된 전사본이나 자막 타이밍이 필요하지 않은 대용량 전사 파이프라인에 적합합니다.
  • Synthorai는 OpenAI 호환 오디오 전사 엔드포인트로 이 모델을 처리합니다.

자주 묻는 질문

GPT-4o Mini Transcribe API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 결제 수단을 추가하기 전에 실제 워크로드로 GPT-4o Mini Transcribe를 충분히 시험해 볼 수 있는 양입니다.

GPT-4o Mini Transcribe는 무엇에 가장 강한가요?

오리지널 Whisper 대비 개선된 단어 오류율, 프리미엄 티어 오디오 입력 요율의 절반, 최대 2K 출력의 16K 컨텍스트. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

GPT-4o Mini Transcribe의 가격은 얼마인가요?

Synthorai에서 GPT-4o Mini Transcribe는 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $5입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

GPT-4o Mini Transcribe는 어떤 언어를 지원하나요?

GPT-4o Mini Transcribe는 전사 엔드포인트에 명시된 57개 언어(모든 전사 모델이 공유하는 단일 목록); GPT-4o 기반 모델은 ISO 639-1 / 639-3 코드를 허용을 지원합니다. Synthorai에서는 POST /v1/audio/transcriptions로 호출합니다. OpenAI 전사 API 형태 그대로입니다.

GPT-4o Mini Transcribe는 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gpt-4o-mini-transcribe"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →