新規 無料登録で、呼び出し 10 回分(最大 $1)をお試しいただけます。カード登録は不要です。

GPT Realtime vs GPT Realtime 2.1

GPT Realtime は招待制で提供しています。以下の数値は現在適用されている料金ですが、呼び出すにはワークスペースへの利用許可が必要です。この比較をもとに開発を始める前に、当社まで利用をお申し込みください。

GPT Realtime 2.1 は招待制で提供しています。以下の数値は現在適用されている料金ですが、呼び出すにはワークスペースへの利用許可が必要です。この比較をもとに開発を始める前に、当社まで利用をお申し込みください。

vs

どんなときに、どちらを選ぶか

テキスト入力はどちらも 100万あたり $4、音声は入力 $32・出力 $64、キャッシュ読み取りは $0.4 で同じ。gpt-realtime-2.1 が高いのはテキスト出力だけ($24 対 $16)で、セッションのコンテキストを 32K から 128K へ 4 倍にします。さらに旧モデルの関数呼び出しに、設定可能な推論の強さと割り込み処理を加えます。既存の統合を維持する場合にだけ gpt-realtime を選んでください — テキスト出力以外は新しい方も同じ価格です。

ベンチマーク

GPT Realtime 2.1:ベンダーがベンチマークスコアを公表していません。

GPT Realtime:公表値は 8 件ありますが、比較できるだけの数のモデルが測定している項目がありません。

GPT Realtime GPT Realtime 2.1 測定された他モデル 他モデルの平均 ★ これを上回るモデルなし
AMI near+far field (WER)
35.9%
N/A
Big Bench Audio
82.8%
N/A
BFCL v3 (single-turn, python only)
80.4%
N/A

ベンダー公表値: Amazon OpenAI

料金

GPT Realtime GPT Realtime 2.1 Δ
音声入力 / 100 万トークン $32 $32 =
音声出力 / 100 万トークン $64 $64 =
音声キャッシュ読み取り / 100 万トークン $0.4 $0.4 =
テキスト入力 / 100 万トークン $4 $4 =
テキスト出力 / 100 万トークン $16 $24 0.67×
キャッシュ書き込み 追加料金なし 追加料金なし -

ビルド時点の現行カタログの料金です。最新の料金表は各モデルのページに掲載しています。

両モデルの位置:音声トークン 100 万あたりの料金(この課金単位のリアルタイム音声対話モデル全 6 件、対数スケール)

対応機能

GPT Realtime GPT Realtime 2.1
プロンプトキャッシュ 自動(暗黙的) 自動(暗黙的)
キャッシュ保持時間 5-10m, up to 1h 5-10m, up to 1h
キャッシュ対象の最小プレフィックス 1024 トークン 1024 トークン

仕様

GPT Realtime GPT Realtime 2.1
入力モダリティ テキスト 音声 テキスト 音声
出力モダリティ テキスト 音声 テキスト 音声
リリース 2025-08-28 2026-07-06
知識カットオフ 2023-10 2024-09
セッション機能
  • Native speech-to-speech over WebSocket
  • function calling
  • 32K context
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
コンテキストウィンドウ 32K 128K

仕様は各ベンダーのドキュメントから転記しています。ベンダーが公表していない項目は、推測で埋めずに省いています。 出典の一覧: GPT Realtime · GPT Realtime 2.1

1 行の変更で切り替え

以下のどのタブにも両方のモデル ID が入っています。書き換えるのはハイライトされた 2 行だけで、エンドポイント、キー、リクエスト形式はすべて同じです。

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # この行のコメントを外し、上の行をコメントアウト
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API キーを取得 →

よくある質問

GPT Realtime と GPT Realtime 2.1 ではどちらが安いですか?

音声入力 / 100 万トークンはどちらも同じ($32)なので、価格は決め手になりません。以下の仕様と対応機能を見比べてください。

GPT Realtime と GPT Realtime 2.1 の A/B テストは、実装を 2 つ用意せずにできますか?

はい。どちらも同じ OpenAI 互換エンドポイントから 1 つの API キーで利用できます。切り替えはモデル名の文字列を 1 行変えるだけなので、トラフィックの一部をそれぞれに振り分けて、請求額を直接比較できます。

GPT Realtime と GPT Realtime 2.1 はプロンプトキャッシュに対応していますか?

はい。どちらのモデルも、キャッシュ読み取りは通常の入力単価より安く課金されます。そのため、同じプレフィックスを繰り返し使うワークロードでは、定価から見込まれるよりコストが下がります。キャッシュ読み取りの正確な単価は、上の料金表に掲載しています。

関連する比較

当社の実測レポートより