Gemini 2.5 Flash Native Audio ist Googles Live-API-Modell mit nativem Audio, das die Modellseite als Ermöglicher latenzarmer Echtzeit-Sprach- und Videointeraktionen mit Gemini 2.5 Flash beschreibt: Es verarbeitet kontinuierliche Ströme aus Audio, Video oder Text und antwortet mit unmittelbarer, menschenähnlicher Sprache, statt einen Transkriptor und einen Synthesizer hintereinanderzuschalten.
- Eingabe
- Text Audio Video $0.5/M
- Ausgabe
- Text Audio $2/M
- Audio-Input
- $3/M
- Audio-Output
- $12/M
- Knowledge Cutoff
- 2025-01
Benchmarks
gemini-2.5-flash-native-audio: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.
Preis im Vergleich
Preisposition unter 6 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 131.072 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 8.192 |
| Knowledge Cutoff | 2025-01 |
Thinking
| Anbieter-Parameter | thinkingBudget |
|---|---|
| Standardwert | dynamisches Thinking gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Der Live-API-Leitfaden dokumentiert für dieses 2.5-Live-Modell ein Token-Budget statt einer Stufe: dynamisches Thinking standardmäßig aktiv, thinkingBudget 0 zum Abschalten. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high akzeptierte Werte je Anbieter |
Audio
| Audio-Limits |
|
|---|---|
| Streaming-Transkription | Ja |
Realtime
| Stimmen | Jede Stimme aus dem Text-to-Speech-Stimmenset von Gemini; Modelle mit Native-Audio-Output wechseln die Sprache während eines Gesprächs auf natürliche Weise. |
|---|---|
| Sitzung |
|
Modell
| Modalitäten | Text + Audio + Video → Text + Audio |
|---|
Native-Audio-Modell für die Live API, das Rohaudio durchgängig verarbeitet, statt STT und TTS aneinanderzureihen. Die Modellseite von Google nennt einen Knowledge Cutoff im Januar 2025 und ein ungewöhnlich kleines Output-Limit von 8.192 Token neben dem Eingabefenster von 131.072 Token.
gemini-2.5-flash-native-audio in 30 Sekunden nutzen
OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio", {
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol - use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio' <<'EOF'
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio", h)
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"), new WebSocket.Listener() {
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);Über gemini-2.5-flash-native-audio
- Sitzungen laufen über einen zustandsbehafteten WebSocket, nehmen rohes 16-Bit-PCM mit 16 kHz entgegen und geben es mit 24 kHz zurück, und das Modell akzeptiert Audio, Video und Text, während es Audio und Text zurückgibt.
- Die Token-Limits liegen bei 131.072 für Input und ungewöhnlich niedrigen 8.192 für Output, das Sitzungs-Kontextfenster beträgt für Native-Audio-Modelle 128k Token, und reine Audiositzungen laufen 15 Minuten, mit Video 2 Minuten, sofern sie nicht per Session Management verlängert werden.
- Function Calling, Search Grounding und Thinking werden unterstützt; Caching, strukturierte Ausgaben, Code-Ausführung und die Batch API nicht.
- Zwei Fähigkeiten heben diese Generation vom neueren Live-Modell ab und sind der Grund, bei ihr zu bleiben: proaktives Audio, das das Modell entscheiden lässt, nicht zu antworten, wenn die Eingabe nicht relevant ist, und affektiver Dialog, der den Antwortstil an Ausdruck und Tonfall der sprechenden Person anpasst.
- Asynchrones Function Calling wird hier ebenfalls unterstützt, sodass eine als non-blocking markierte Deklaration das Modell weitersprechen lässt, während ein Tool läuft.
- Die Stimmen stammen aus Googles Text-to-Speech-Set, die Native-Audio-Ausgabe wechselt die Sprache im Gespräch auf natürliche Weise und akzeptiert keinen expliziten Sprachcode, und der Knowledge Cutoff liegt im Januar 2025.
- Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit, der für den Rest seines Sprachkatalogs verwendet wird.
FAQ
Lässt sich die gemini-2.5-flash-native-audio API kostenlos testen?
gemini-2.5-flash-native-audio befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.
Worin ist gemini-2.5-flash-native-audio am besten?
Latenzarme Echtzeit-Sprache und -Video über die Live API; proaktives Audio und affektiver Dialog, im neueren Live-Modell nicht vorhanden; reine Audiositzungen laufen 15 Minuten, mit Video zwei. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet gemini-2.5-flash-native-audio?
gemini-2.5-flash-native-audio kostet auf Synthorai $0.5 pro Million Input-Tokens und $2 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Wie rufe ich die gemini-2.5-flash-native-audio-API auf?
gemini-2.5-flash-native-audio ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).
Wie erhalte ich Zugang zu gemini-2.5-flash-native-audio?
gemini-2.5-flash-native-audio ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gemini-2.5-flash-native-audio".
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.