Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

gemini-3.1-flash-live vs GPT Realtime 2.1

gemini-3.1-flash-live gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

GPT Realtime 2.1 gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

vs

Welches Modell wofür

Beide sind Echtzeit-Audio-Modelle, die pro Million Token abgerechnet werden, aber gemini-3.1-flash-live ist die günstigere Option: $3 Audio-Input gegenüber $32 (etwa 10.7x weniger) und $12 Audio-Output gegenüber $64, mit Text für $0.75/$4.5 im Vergleich zu $4/$24 (rund 5.3x weniger). Es akzeptiert außerdem Bild- und Video-Input neben Audio und Text, bietet einen 131072-Token-Kontext mit bis zu 65536 Output-Token und seine Live API-Sitzungen sind auf 15 Minuten nur für Audio (2 Minuten mit Video) begrenzt, sofern sie nicht verlängert werden. Wählen Sie gpt-realtime-2.1, wenn Sie den Audio/Text-Stack von OpenAI mit $0.4 Cache-Reads, seinem 128000-Token-Kontext und 32000 max Output möchten.

Preise

gemini-3.1-flash-live GPT Realtime 2.1 Δ
Audio-Eingabe / 1M Tokens $3 $32 0.094×
Audio-Ausgabe / 1M Tokens $12 $64 0.19×
Audio-Cache-Lesen / 1M Tokens - $0.4 -
Text-Eingabe / 1M Tokens $0.75 $4 0.19×
Text-Ausgabe / 1M Tokens $4.5 $24 0.19×
Cache-Schreiben - keine gesonderte Gebühr -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

gemini-3.1-flash-live GPT Realtime 2.1
Thinking-Steuerung immer aktiv -
Prompt-Caching implizit + explizit implizit (automatisch)
Cache-Lebensdauer nicht veröffentlicht 5-10m, up to 1h
Mindestlänge des gecachten Präfixes 4096 Tokens 1024 Tokens

Spezifikationen

gemini-3.1-flash-live GPT Realtime 2.1
Eingabemodalitäten Text Bild Audio Video Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2026-03-26 2026-07-06
Knowledge-Cutoff - 2024-09
Stimmen

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

-
Sitzungsfunktionen
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
  • Speech-to-speech over WebSocket
  • configurable reasoning effort
  • tool use
  • interruption handling
  • 128K context
Kontextfenster 131K 128K

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: gemini-3.1-flash-live · GPT Realtime 2.1

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# URL = "wss://synthorai.io/v1/realtime?model=gpt-realtime-2.1"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: gemini-3.1-flash-live oder GPT Realtime 2.1?

gemini-3.1-flash-live ist bei Audio-Eingabe / 1M Tokens günstiger ($3 vs. $32, Faktor 11). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich gemini-3.1-flash-live gegen GPT Realtime 2.1 A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen gemini-3.1-flash-live und GPT Realtime 2.1 Prompt-Caching?

In unserem Feed ist nur für eines der beiden Modelle ein Preis für Cache-Lesezugriffe hinterlegt. Fehlt ein Preis, berechnet der Anbieter Cache-Lesezugriffe nicht gesondert.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen