🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

gemini-2.5-flash-native-audio

Google beta su invito realtime audio
Input$0.5/M
Output$2/M
Input audio$3/M
Output audio$12/M

Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing.

Usa gemini-2.5-flash-native-audio in 30 secondi

Compatibile con OpenAI Realtime: collegati via WebSocket, audio in ingresso e in uscita. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Informazioni su gemini-2.5-flash-native-audio

Google Gemini 2.5 Flash Native Audio speech-to-speech over WebSocket (AI Studio).

  • Most natural native-audio voice.
  • Audio $3/M in · $12/M out; text $0.50/M in · $2/M out.
  • Billed per response at official list price.

FAQ

L'API di gemini-2.5-flash-native-audio si può provare gratis?

gemini-2.5-flash-native-audio è attualmente in beta su invito: l'accesso avviene su candidatura, non con registrazione aperta. Invia la richiesta dalla console Synthorai; una volta approvata si applicano le normali tariffe con pagamento a consumo, senza abbonamento.

Quanto costa gemini-2.5-flash-native-audio?

Su Synthorai, gemini-2.5-flash-native-audio costa $0.5 per milione di token in input e $2 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Come si chiama l'API di gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio è un modello speech-to-speech: collegati via WebSocket a wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio con l'SDK OpenAI Realtime (o un WebSocket grezzo) e trasmetti audio in ingresso e in uscita. Non è un caricamento di file POST /v1/audio/transcriptions. Autenticati con la tua chiave sk-syn e rispecchia l'header OpenAI-Beta.

Come ottengo l'accesso a gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio è in beta su invito: richiedi l'accesso dalla console Synthorai. Una volta approvato funziona come ogni altro modello: punta il tuo SDK OpenAI a base_url="https://synthorai.io/v1" e imposta model="gemini-2.5-flash-native-audio".

Modelli correlati

Ottieni la tua chiave API gratuita Confronta il tuo costo →