Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

gemini-2.5-flash-native-audio

geschlossene Beta Tool-AufrufeReasoning

Gemini 2.5 Flash Native Audio ist Googles Live-API-Modell mit nativem Audio, das die Modellseite als Ermöglicher latenzarmer Echtzeit-Sprach- und Videointeraktionen mit Gemini 2.5 Flash beschreibt: Es verarbeitet kontinuierliche Ströme aus Audio, Video oder Text und antwortet mit unmittelbarer, menschenähnlicher Sprache, statt einen Transkriptor und einen Synthesizer hintereinanderzuschalten.

Eingabe
Text Audio Video $0.5/M
Ausgabe
Text Audio $2/M
Audio-Input
$3/M
Audio-Output
$12/M
Knowledge Cutoff
2025-01

Benchmarks

gemini-2.5-flash-native-audio: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.

gemini-2.5-flash-native-audio weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

Herstellerangaben: Amazon OpenAI

Preis im Vergleich

Preisposition unter 6 vergleichbaren Modellen

Eingabe$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
Ausgabe$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 131.072
Max. Output (Anbieter-Spezifikation) 8.192
Knowledge Cutoff 2025-01

Thinking

Anbieter-Parameter thinkingBudget
Standardwert dynamisches Thinking gilt, wenn die Anfrage nichts angibt
Abschaltbar Ja
Thinking-Verhalten Der Live-API-Leitfaden dokumentiert für dieses 2.5-Live-Modell ein Token-Budget statt einer Stufe: dynamisches Thinking standardmäßig aktiv, thinkingBudget 0 zum Abschalten.
Parameter reasoning_effort
Werte minimal · low · medium · high akzeptierte Werte je Anbieter

Audio

Audio-Limits
  • Live-API-Sitzung: rohes Little-Endian-16-Bit-PCM, 16 kHz Input und 24 kHz Output
  • reine Audiositzungen sind auf 15 Minuten begrenzt (2 Minuten mit Video), sofern sie nicht über das Session-Management verlängert werden
  • 128k Token Sitzungskontext
Streaming-Transkription Ja

Realtime

Stimmen Jede Stimme aus dem Text-to-Speech-Stimmenset von Gemini; Modelle mit Native-Audio-Output wechseln die Sprache während eines Gesprächs auf natürliche Weise.
Sitzung
  • Function Calling unterstützt, wobei NON_BLOCKING-Funktionsdeklarationen das Modell weitersprechen lassen, während ein Tool läuft
  • VAD-Unterbrechung bricht die laufende Generierung ab und verwirft sie
  • Search Grounding und Thinking unterstützt
  • kein Caching, keine strukturierten Ausgaben, keine Codeausführung und keine Batch API

Modell

Modalitäten Text + Audio + Video → Text + Audio

Native-Audio-Modell für die Live API, das Rohaudio durchgängig verarbeitet, statt STT und TTS aneinanderzureihen. Die Modellseite von Google nennt einen Knowledge Cutoff im Januar 2025 und ein ungewöhnlich kleines Output-Limit von 8.192 Token neben dem Eingabefenster von 131.072 Token.

laut Offizielle Google-Dokumentation ↗

gemini-2.5-flash-native-audio in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über gemini-2.5-flash-native-audio

  • Sitzungen laufen über einen zustandsbehafteten WebSocket, nehmen rohes 16-Bit-PCM mit 16 kHz entgegen und geben es mit 24 kHz zurück, und das Modell akzeptiert Audio, Video und Text, während es Audio und Text zurückgibt.
  • Die Token-Limits liegen bei 131.072 für Input und ungewöhnlich niedrigen 8.192 für Output, das Sitzungs-Kontextfenster beträgt für Native-Audio-Modelle 128k Token, und reine Audiositzungen laufen 15 Minuten, mit Video 2 Minuten, sofern sie nicht per Session Management verlängert werden.
  • Function Calling, Search Grounding und Thinking werden unterstützt; Caching, strukturierte Ausgaben, Code-Ausführung und die Batch API nicht.
  • Zwei Fähigkeiten heben diese Generation vom neueren Live-Modell ab und sind der Grund, bei ihr zu bleiben: proaktives Audio, das das Modell entscheiden lässt, nicht zu antworten, wenn die Eingabe nicht relevant ist, und affektiver Dialog, der den Antwortstil an Ausdruck und Tonfall der sprechenden Person anpasst.
  • Asynchrones Function Calling wird hier ebenfalls unterstützt, sodass eine als non-blocking markierte Deklaration das Modell weitersprechen lässt, während ein Tool läuft.
  • Die Stimmen stammen aus Googles Text-to-Speech-Set, die Native-Audio-Ausgabe wechselt die Sprache im Gespräch auf natürliche Weise und akzeptiert keinen expliziten Sprachcode, und der Knowledge Cutoff liegt im Januar 2025.
  • Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit, der für den Rest seines Sprachkatalogs verwendet wird.

FAQ

Lässt sich die gemini-2.5-flash-native-audio API kostenlos testen?

gemini-2.5-flash-native-audio befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.

Worin ist gemini-2.5-flash-native-audio am besten?

Latenzarme Echtzeit-Sprache und -Video über die Live API; proaktives Audio und affektiver Dialog, im neueren Live-Modell nicht vorhanden; reine Audiositzungen laufen 15 Minuten, mit Video zwei. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio kostet auf Synthorai $0.5 pro Million Input-Tokens und $2 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Wie rufe ich die gemini-2.5-flash-native-audio-API auf?

gemini-2.5-flash-native-audio ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).

Wie erhalte ich Zugang zu gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gemini-2.5-flash-native-audio".

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →