Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

gemini-2.5-flash-native-audio

bêta sur invitation Appel d'outilsRaisonnement

Gemini 2.5 Flash Native Audio est le modèle à audio natif de Google pour la Live API, que la page modèle décrit comme permettant des interactions vocales et vidéo en temps réel à faible latence avec Gemini 2.5 Flash : il traite des flux continus d'audio, de vidéo ou de texte et répond par une parole immédiate et proche de l'humain, au lieu d'enchaîner un transcripteur et un synthétiseur.

Entrée
texte audio vidéo $0.5/M
Sortie
texte audio $2/M
Entrée audio
$3/M
Sortie audio
$12/M
Coupure des connaissances
2025-01

Benchmarks

gemini-2.5-flash-native-audio : 8 publiés, mais aucun benchmark partagé avec assez de modèles pour comparer.

gemini-2.5-flash-native-audio autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

Chiffres publiés par les fournisseurs : Amazon OpenAI

Le prix en contexte

Position du prix parmi 6 modèles comparables

Entrée$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
Sortie$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 131 072
Sortie max (spéc. fournisseur) 8 192
Coupure des connaissances 2025-01

Raisonnement

Paramètre du fournisseur thinkingBudget
Valeur par défaut réflexion dynamique appliquée si la requête ne précise rien
Désactivable Oui
Comportement du raisonnement Le guide Live API documente ce modèle 2.5 Live comme utilisant un budget de tokens plutôt qu'un niveau: réflexion dynamique activée par défaut, thinkingBudget 0 pour la désactiver.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high l'ensemble accepté est celui du fournisseur

Audio

Limites audio
  • Session Live API: PCM 16 bits brut little-endian, 16 kHz en entrée et 24 kHz en sortie
  • sessions audio seules plafonnées à 15 minutes (2 minutes avec vidéo) sauf prolongation via la gestion de session
  • contexte de session de 128k tokens
Transcription en streaming Oui

Temps réel

Voix N'importe quelle voix du jeu de voix text-to-speech de Gemini ; les modèles à sortie audio native changent de langue naturellement au cours d'une conversation.
Session
  • Appel de fonctions pris en charge, les déclarations de fonction NON_BLOCKING permettant au modèle de continuer à parler pendant l'exécution d'un outil
  • l'interruption par VAD annule et abandonne la génération en cours
  • ancrage par recherche et réflexion pris en charge
  • pas de mise en cache, de sorties structurées, d'exécution de code ni de Batch API

Modèle

Modalités texte + audio + vidéo → texte + audio

Modèle Live API à audio natif qui traite l'audio brut de bout en bout au lieu de chaîner STT et TTS. La page modèle de Google indique une date limite des connaissances en janvier 2025 et une limite de sortie inhabituellement faible de 8 192 tokens, à côté d'une fenêtre d'entrée de 131 072 tokens.

selon docs officielles Google ↗

Utilisez gemini-2.5-flash-native-audio en 30 secondes

Compatible OpenAI Realtime : connectez-vous en WebSocket, audio entrant et sortant. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

À propos de gemini-2.5-flash-native-audio

  • Les sessions s'exécutent sur un WebSocket avec état, prenant du PCM 16 bits brut à 16 kHz en entrée et le renvoyant à 24 kHz, et le modèle accepte l'audio, la vidéo et le texte tout en renvoyant de l'audio et du texte.
  • Les limites de tokens sont de 131 072 en entrée et de 8 192 en sortie, une valeur inhabituellement basse, la fenêtre de contexte de session est de 128k tokens pour les modèles à audio natif, et les sessions audio seules durent 15 minutes, ou 2 minutes avec la vidéo, sauf prolongation via la gestion de session.
  • L'appel de fonctions, l'ancrage par recherche et la réflexion sont pris en charge ; la mise en cache, les sorties structurées, l'exécution de code et la Batch API ne le sont pas.
  • Deux capacités distinguent cette génération du modèle Live plus récent et constituent la raison d'y rester : l'audio proactif, qui laisse le modèle décider de ne pas répondre quand l'entrée n'est pas pertinente, et le dialogue affectif, qui adapte le style de réponse à l'expression et au ton du locuteur.
  • L'appel de fonctions asynchrone est également pris en charge ici, de sorte qu'une déclaration marquée non bloquante laisse le modèle continuer à parler pendant l'exécution d'un outil.
  • Les voix proviennent de l'ensemble text-to-speech de Google, la sortie à audio natif change de langue naturellement au cours d'une conversation et n'accepte pas de code de langue explicite, et la date limite des connaissances est janvier 2025.
  • Synthorai l'expose via l'endpoint WebSocket /v1/realtime compatible OpenAI utilisé pour le reste de son catalogue vocal.

FAQ

Peut-on essayer l'API gemini-2.5-flash-native-audio gratuitement ?

gemini-2.5-flash-native-audio est actuellement en bêta sur invitation : l'accès se fait sur candidature plutôt que par inscription ouverte. Faites la demande depuis la console Synthorai ; une fois approuvée, la tarification standard au paiement à l'usage s'applique, sans abonnement.

Quels sont les points forts de gemini-2.5-flash-native-audio ?

Voix et vidéo en temps réel à faible latence via la Live API ; audio proactif et dialogue affectif, absents du modèle Live plus récent ; sessions audio seules de 15 minutes, deux avec la vidéo. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte gemini-2.5-flash-native-audio ?

Sur Synthorai, gemini-2.5-flash-native-audio coûte $0.5 par million de tokens en entrée et $2 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

Comment appeler l'API gemini-2.5-flash-native-audio ?

gemini-2.5-flash-native-audio est un modèle speech-to-speech : connectez-vous en WebSocket à wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio avec le SDK OpenAI Realtime (ou un WebSocket brut) pour envoyer et recevoir de l'audio. Ce n'est pas un envoi de fichier POST /v1/audio/transcriptions. Authentifiez-vous avec votre clé sk-syn et n'envoyez que l'en-tête Authorization (le protocole beta est retiré).

Comment obtenir l'accès à gemini-2.5-flash-native-audio ?

gemini-2.5-flash-native-audio est en bêta sur invitation : demandez l'accès depuis la console Synthorai. Une fois la demande approuvée, il fonctionne comme tous les autres modèles : pointez votre SDK OpenAI vers base_url="https://synthorai.io/v1" et définissez model="gemini-2.5-flash-native-audio".

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →