🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

gemini-2.5-flash-native-audio

Google bêta sur invitation realtime audio
Entrée$0.5/M
Sortie$2/M
Entrée audio$3/M
Sortie audio$12/M

Prix catalogue du fournisseur : sans majoration de plateforme, paiement à l'usage. Ce sont les prix catalogue officiels. Les clients connectés peuvent voir les prix effectifs incluant les remises de l’espace de travail sur /console/pricing.

Utilisez gemini-2.5-flash-native-audio en 30 secondes

Compatible OpenAI Realtime : connectez-vous en WebSocket, audio entrant et sortant. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

À propos de gemini-2.5-flash-native-audio

Google Gemini 2.5 Flash Native Audio speech-to-speech over WebSocket (AI Studio).

  • Most natural native-audio voice.
  • Audio $3/M in · $12/M out; text $0.50/M in · $2/M out.
  • Billed per response at official list price.

FAQ

Peut-on essayer l'API gemini-2.5-flash-native-audio gratuitement ?

gemini-2.5-flash-native-audio est actuellement en bêta sur invitation : l'accès se fait sur candidature plutôt que par inscription ouverte. Faites la demande depuis la console Synthorai ; une fois approuvée, la tarification standard au paiement à l'usage s'applique, sans abonnement.

Combien coûte gemini-2.5-flash-native-audio ?

Sur Synthorai, gemini-2.5-flash-native-audio coûte $0.5 par million de tokens en entrée et $2 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

Comment appeler l'API gemini-2.5-flash-native-audio ?

gemini-2.5-flash-native-audio est un modèle speech-to-speech : connectez-vous en WebSocket à wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio avec le SDK OpenAI Realtime (ou un WebSocket brut) pour envoyer et recevoir de l'audio. Ce n'est pas un envoi de fichier POST /v1/audio/transcriptions. Authentifiez-vous avec votre clé sk-syn et reproduisez l'en-tête OpenAI-Beta.

Comment obtenir l'accès à gemini-2.5-flash-native-audio ?

gemini-2.5-flash-native-audio est en bêta sur invitation : demandez l'accès depuis la console Synthorai. Une fois la demande approuvée, il fonctionne comme tous les autres modèles : pointez votre SDK OpenAI vers base_url="https://synthorai.io/v1" et définissez model="gemini-2.5-flash-native-audio".

Modèles associés

Obtenez votre clé API gratuite Comparez votre coût →