Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

gemini-3.1-flash-live vs nova-2-sonic

gemini-3.1-flash-live gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

nova-2-sonic gibt es nur auf Einladung. Die Werte unten sind die aktuellen Live-Preise, für Aufrufe muss Ihr Arbeitsbereich aber erst freigeschaltet werden. Fragen Sie den Zugang bei uns an, bevor Sie auf diesen Vergleich bauen.

vs

Welches Modell wofür

Audio kostet auf beiden gleich, $3 pro Million Eingabe und $12 Ausgabe, die Rechnung trennt sich also beim Text: nova-2-sonic berechnet $0.06 und $0.24 pro Million gegenüber $0.75 und $4.5, also rund 12x und 19x weniger. gemini-3.1-flash-live ist das Modell mit den breiteren Eingaben - Text, Bild, Audio und Video, mehr als 90 Sprachen, 15-minütige reine Audiositzungen - während nova-2-sonic nur Audio und Text nimmt, über eine 8-Minuten-Verbindung mit dokumentiertem Fortsetzungsmuster, und in vier Regionen läuft. Nehmen Sie nova-2-sonic für die Kosten bei textlastigen Sitzungen, gemini-3.1-flash-live für Videoeingabe und Sprachabdeckung.

Benchmarks

gemini-3.1-flash-live: Der Anbieter hat keine Benchmark-Werte veröffentlicht.

nova-2-sonic: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.

gemini-3.1-flash-live nova-2-sonic weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
AMI near+far field (WER)
N/A
29.7%
Big Bench Audio
N/A
87%
BFCL v3 (single-turn, python only)
N/A
74.5%

Anbieterangaben: Amazon OpenAI

Preise

gemini-3.1-flash-live nova-2-sonic Δ
Audio-Eingabe / 1M Tokens $3 $3 =
Audio-Ausgabe / 1M Tokens $12 $12 =
Text-Eingabe / 1M Tokens $0.75 $0.06 13×
Text-Ausgabe / 1M Tokens $4.5 $0.24 19×
Cache-Schreiben - keine gesonderte Gebühr -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Audio-Tokens aller 6 Echtzeit-Speech-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

gemini-3.1-flash-live nova-2-sonic
Thinking-Steuerung immer aktiv -
Prompt-Caching implizit + explizit nicht unterstützt
Cache-Lebensdauer nicht veröffentlicht nicht zutreffend
Mindestlänge des gecachten Präfixes 4096 Tokens nicht zutreffend

Spezifikationen

gemini-3.1-flash-live nova-2-sonic
Eingabemodalitäten Text Bild Audio Video Text Audio
Ausgabemodalitäten Text Audio Text Audio
Veröffentlicht 2026-03-26 2025-12-02
Stimmen

Any voice from the Gemini text-to-speech voice set

native-audio output models switch languages naturally during a conversation.

Feminine- and masculine-sounding voices per locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN and hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR)

tiffany and matthew are polyglot voices that speak every supported language.

Sitzungsfunktionen
  • Function calling is sequential only - the model will not start responding until the tool response is sent
  • search grounding and thinking supported
  • VAD interruption cancels the in-flight generation
  • no caching, structured outputs, code execution or Batch API
  • Intelligent turn-taking with configurable endpointing sensitivity
  • graceful interruption handling without losing context
  • function calling with asynchronous tool handling (the assistant keeps speaking while tools run)
  • RAG grounding
  • mixed audio and text input in one conversation
  • 8-minute connection limit
Kontextfenster 131K 1M

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: gemini-3.1-flash-live · nova-2-sonic

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"  # diese Zeile einkommentieren, die darüberliegende auskommentieren
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: gemini-3.1-flash-live oder nova-2-sonic?

Bei Audio-Eingabe / 1M Tokens kosten beide gleich viel ($3). Der Preis entscheidet hier also nichts; ausschlaggebend sind die Spezifikationen und Fähigkeiten weiter unten.

Kann ich gemini-3.1-flash-live gegen nova-2-sonic A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen gemini-3.1-flash-live und nova-2-sonic Prompt-Caching?

In unserem Feed ist nur für eines der beiden Modelle ein Preis für Cache-Lesezugriffe hinterlegt. Fehlt ein Preis, berechnet der Anbieter Cache-Lesezugriffe nicht gesondert.

Verwandte Vergleiche