🎁 新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

GPT Realtime vs GPT Realtime 2.1

vs

いつ、どちらを使うべきか — ベンチマーク表ではなく、厳選された評価

テキスト入力はどちらも 100万あたり $4、音声は入力 $32・出力 $64、キャッシュ読み取りは $0.4 で同じ。gpt-realtime-2.1 が高いのはテキスト出力だけ($24 対 $16)で、セッションのコンテキストを 32K から 128K へ 4 倍にします。さらに旧モデルの関数呼び出しに、設定可能な推論の強さと割り込み処理を加えます。既存の統合を維持する場合にだけ gpt-realtime を選んでください — テキスト出力以外は新しい方も同じ価格です。

料金

GPT Realtime GPT Realtime 2.1 Δ
音声入力 / 1Mトークン $32 $32 =
音声出力 / 1Mトークン $64 $64 =
音声キャッシュ読み取り / 1Mトークン $0.4 $0.4 =
テキスト入力 / 1Mトークン $4 $4 =
テキスト出力 / 1Mトークン $16 $24 0.67×
キャッシュ書き込み 別途料金なし 別途料金なし

ビルド時のライブカタログの料金です。各モデルのページには現在の料金カードが記載されています。

位置付け — この課金単位におけるすべての6個のリアルタイム音声対音声モデル全体の1M音声トークンあたりの料金 (対数スケール)

機能

GPT Realtime GPT Realtime 2.1
プロンプトキャッシング 暗黙的 (自動) 暗黙的 (自動)
キャッシュ有効期間 5–10m, up to 1h 5–10m, up to 1h
最小キャッシュプレフィックス 1024 トークン 1024 トークン

仕様

GPT Realtime GPT Realtime 2.1
入力モダリティ テキスト 音声 テキスト 音声
出力モダリティ テキスト 音声 テキスト 音声
リリース 2025-08-28 2026-07-06
知識のカットオフ 2023-10 2024-09
セッション機能
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
コンテキストウィンドウ 32K 128K

仕様は各ベンダーのドキュメントから転記されています。ベンダーが公開していない行は推測せず、省略しています。 すべての出典: GPT Realtime · GPT Realtime 2.1

1行で切り替え

以下のすべてのタブには両方のIDが含まれています — 変更箇所はハイライトされた2行のみです。エンドポイント、キー、リクエスト形式はすべて同じです。

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # この行をアンコメントし、上の行をコメントアウトします
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

APIキーを取得する →

FAQ

GPT Realtime と GPT Realtime 2.1 ではどちらが安いですか?

同じ 音声入力 / 1mトークン($32)が設定されているため、ここでは価格が決定打にはなりません — 下記の仕様と機能を確認してください。

2つの統合を行わずに GPT Realtime と GPT Realtime 2.1 のA/Bテストを実施できますか?

はい。両方とも1つのAPIキーで同じOpenAI互換エンドポイントを通じて提供されます — モデル文字列を1行変更するだけで切り替えられるため、トラフィックの一部をそれぞれにルーティングし、請求額を直接比較できます。

GPT Realtime と GPT Realtime 2.1 はプロンプトキャッシングをサポートしていますか?

はい — どちらのモデルでもキャッシュ読み込みは入力レートよりも低く請求されるため、ウォームプレフィックスのワークロードは定価が示すよりも低コストになります。キャッシュ読み込みの正確な行は、上の料金表に記載されています。

関連する比較

当社の測定調査より