Gemini 3.1 Flash Live ist Googles latenzarmes Audio-zu-Audio-Modell für Echtzeitdialog und sprachzentrierte Anwendungen, und seine Modellseite schreibt ihm die Erkennung akustischer Nuancen, numerische Präzision und multimodales Bewusstsein zu.
- Eingabe
- Text Bild Audio Video $0.75/M
- Ausgabe
- Text Audio $4.5/M
- Audio-Input
- $3/M
- Audio-Output
- $12/M
Preis im Vergleich
Preisposition unter 6 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 131.072 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
Thinking
| Anbieter-Parameter | thinkingLevel |
|---|---|
| Zulässige Werte | minimal · low · medium · high |
| Standardwert | minimal gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Nein |
| Thinking-Verhalten | Steht standardmäßig auf minimal, um auf geringste Latenz zu optimieren; die Gemini-3-Live-Modelle haben das thinkingBudget von 2.5 Live durch eine Stufe ersetzt. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Audio
| Sprachen | Mehr als 90 Sprachen für multimodale Konversation in Echtzeit |
|---|---|
| Audio-Limits |
|
| Streaming-Transkription | Ja |
Realtime
| Stimmen | Jede Stimme aus dem Text-to-Speech-Stimmenset von Gemini; Modelle mit Native-Audio-Output wechseln die Sprache während eines Gesprächs auf natürliche Weise. |
|---|---|
| Sitzung |
|
Modell
| Modalitäten | Text + Bild + Audio + Video → Text + Audio |
|---|
Audio-zu-Audio-Modell mit niedriger Latenz für Voice-First-Agenten, dokumentiert für die Erkennung akustischer Nuancen, numerische Präzision und multimodales Bewusstsein. Nutzt thinkingLevel (minimal / low / medium / high) statt thinkingBudget, standardmäßig minimal für die geringste Latenz.
gemini-3.1-flash-live in 30 Sekunden nutzen
OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live", {
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol - use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live' <<'EOF'
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live", h)
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"), new WebSocket.Listener() {
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);Über gemini-3.1-flash-live
- Es akzeptiert Text, Bilder, Audio und Video und gibt Text und Audio über den zustandsbehafteten WebSocket der Live API zurück, mit einem Input-Limit von 131.072 Token und einem Output-Limit von 65.536 Token, dem Achtfachen der Output-Obergrenze des 2.5-Native-Audio-Modells, das es ablöst.
- Function Calling, Search Grounding und Thinking werden unterstützt, Caching, strukturierte Ausgaben, Code-Ausführung und die Batch API nicht, und die Thinking-Tiefe wird mit thinkingLevel auf minimal, low, medium oder high gesetzt, standardmäßig auf minimal für die niedrigste Latenz, anstelle des numerischen thinkingBudget der 2.5-Generation.
- Die Migrationshinweise sind der nützliche Teil, denn dieses Upgrade entfernt ebenso, wie es ergänzt.
- Asynchrones Function Calling wird noch nicht unterstützt, Aufrufe laufen also sequenziell, und das Modell beginnt erst zu antworten, wenn die Tool-Antwort eintrifft; proaktives Audio und affektiver Dialog sind entfallen, und ihre Konfiguration muss entfernt werden.
- Ein einzelnes Server-Event kann jetzt mehrere Content-Teile auf einmal tragen, etwa einen Audio-Chunk und ein Transkript zusammen, sodass Clients, die nur den ersten Teil lesen, still Inhalte verlieren.
- Die Turn Coverage schließt standardmäßig nun erkannte Audioaktivität und alle Videoframes ein, was die Kosten für Anwendungen erhöhen kann, die durchgehend Video streamen, und Client-Inhalte dürfen nur den anfänglichen Verlauf befüllen.
- Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit.
FAQ
Lässt sich die gemini-3.1-flash-live API kostenlos testen?
gemini-3.1-flash-live befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.
Worin ist gemini-3.1-flash-live am besten?
Audio-zu-Audio-Modell für Echtzeitdialog und sprachzentrierte Anwendungen; achtfache Output-Obergrenze des 2.5-Native-Audio-Modells; kein asynchrones Function Calling, Tool-Aufrufe laufen sequenziell. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet gemini-3.1-flash-live?
gemini-3.1-flash-live kostet auf Synthorai $0.75 pro Million Input-Tokens und $4.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Wie rufe ich die gemini-3.1-flash-live-API auf?
gemini-3.1-flash-live ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).
Wie erhalte ich Zugang zu gemini-3.1-flash-live?
gemini-3.1-flash-live ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gemini-3.1-flash-live".
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.