🎁 신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

GPT Realtime 2.1 vs GPT Realtime 2.1 Mini

vs

언제 어떤 모델을 사용할까 — 벤치마크 표가 아닌 선별된 평가

mini 단은 모든 항목에서 더 쌉니다—텍스트 100만당 $0.6과 $2.4가 $4와 $24 대비, 오디오 입출력 100만당 $10과 $20이 $32와 $64 대비—즉 오디오는 약 3배, 텍스트 입력은 약 7배 저렴합니다. 둘 다 128K 세션 컨텍스트에 음성-음성, 툴 사용, 프롬프트 캐싱을 갖췄고, 풀 모델은 여기에 조절 가능한 추론 강도와 끼어들기 처리를 명시합니다. 물량이면 mini, 세션마다 추론 강도를 조절하려면 풀 모델을 고르세요.

가격

GPT Realtime 2.1 GPT Realtime 2.1 Mini Δ
오디오 입력 / 1M 토큰 $32 $10 3.2×
오디오 출력 / 1M 토큰 $64 $20 3.2×
오디오 캐시 읽기 / 1M 토큰 $0.4 $0.3 1.3×
텍스트 입력 / 1M 토큰 $4 $0.6 6.7×
텍스트 출력 / 1M 토큰 $24 $2.4 10×
캐시 쓰기 별도 비용 없음 별도 비용 없음

빌드 시점의 라이브 카탈로그 요금입니다. 각 모델 페이지에 현재 요금표가 표시됩니다.

현재 위치 — 이 청구 단위를 사용하는 모든 6개의 실시간 음성-음성 변환 모델 전체의 1M 오디오 토큰당 가격 (로그 스케일)

기능

GPT Realtime 2.1 GPT Realtime 2.1 Mini
프롬프트 캐싱 암시적 (자동) 암시적 (자동)
캐시 수명 5–10m, up to 1h 5–10m, up to 1h
최소 캐시 접두사 1024 토큰 1024 토큰

사양

GPT Realtime 2.1 GPT Realtime 2.1 Mini
입력 모달리티 텍스트 오디오 텍스트 오디오
출력 모달리티 텍스트 오디오 텍스트 오디오
출시일 2026-07-06 2026-07-06
지식 컷오프 2024-09 2024-09
세션 기능
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
  • Speech-to-speech with reasoning & tool use
  • prompt caching
  • 128K context
컨텍스트 윈도우 128K 128K

사양은 각 공급업체의 문서를 그대로 기록한 것입니다. 공급업체가 공개하지 않은 항목은 추론하지 않고 제외했습니다. 전체 출처: GPT Realtime 2.1 · GPT Realtime 2.1 Mini

코드 한 줄로 모델 전환

두 id는 아래의 모든 탭에 있습니다 — 강조 표시된 두 줄이 유일한 수정 사항입니다. 동일한 엔드포인트, 동일한 키, 동일한 요청 형태입니다.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1-mini"  # 이 줄의 주석을 해제하고, 윗줄을 주석 처리하세요
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API 키 발급받기 →

FAQ

GPT Realtime 2.1와(과) GPT Realtime 2.1 Mini 중 어느 것이 더 저렴한가요?

오디오 입력 / 1m 토큰 항목에서는 GPT Realtime 2.1 Mini이(가) 더 저렴합니다($10 대 $32, 3.2× 차이). 다른 항목에서는 결과가 다를 수 있습니다 — 위의 표에 전체 정보가 있으며, 실제 비용은 사용 조합에 따라 달라집니다.

두 번의 연동 과정 없이 GPT Realtime 2.1와(과) GPT Realtime 2.1 Mini를 A/B 테스트할 수 있나요?

네. 둘 다 하나의 API 키를 사용하여 동일한 OpenAI 호환 엔드포인트를 통해 제공됩니다 — 모델 문자열을 한 줄만 변경하면 전환되므로, 트래픽의 일부를 각각 라우팅하여 요금을 직접 비교할 수 있습니다.

GPT Realtime 2.1 및 GPT Realtime 2.1 Mini는 프롬프트 캐싱을 지원하나요?

네 — 두 모델 모두 캐시 읽기에 대해 입력 요금보다 낮게 청구하므로, 웜 프리픽스 워크로드는 공시된 요금보다 비용이 적게 듭니다. 정확한 캐시 읽기 행은 위의 가격표에 있습니다.

관련 비교