🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

gemini-2.5-flash-native-audio

Google geschlossene Beta realtime audio
Input$0.5/M
Output$2/M
Audio-Input$3/M
Audio-Output$12/M

Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten.

gemini-2.5-flash-native-audio in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über gemini-2.5-flash-native-audio

Google Gemini 2.5 Flash Native Audio speech-to-speech over WebSocket (AI Studio).

  • Most natural native-audio voice.
  • Audio $3/M in · $12/M out; text $0.50/M in · $2/M out.
  • Billed per response at official list price.

FAQ

Lässt sich die gemini-2.5-flash-native-audio API kostenlos testen?

gemini-2.5-flash-native-audio befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.

Was kostet gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio kostet auf Synthorai $0.5 pro Million Input-Tokens und $2 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Wie rufe ich die gemini-2.5-flash-native-audio-API auf?

gemini-2.5-flash-native-audio ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und spiegeln Sie den OpenAI-Beta-Header.

Wie erhalte ich Zugang zu gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="gemini-2.5-flash-native-audio".

Verwandte Modelle

Kostenlosen API-Key holen Ihre Kosten vergleichen →