🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

gemini-2.5-flash-native-audio

Google beta por convite realtime audio
Entrada$0.5/M
Saída$2/M
Entrada de áudio$3/M
Saída de áudio$12/M

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Use o gemini-2.5-flash-native-audio em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
HEADERS = {"Authorization": "Bearer sk-syn-...", "OpenAI-Beta": "realtime=v1"}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {"modalities": ["audio", "text"], "voice": "alloy"},
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o gemini-2.5-flash-native-audio

Google Gemini 2.5 Flash Native Audio speech-to-speech over WebSocket (AI Studio).

  • Most natural native-audio voice.
  • Audio $3/M in · $12/M out; text $0.50/M in · $2/M out.
  • Billed per response at official list price.

Perguntas frequentes

A API do gemini-2.5-flash-native-audio é gratuita para testar?

O gemini-2.5-flash-native-audio está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Quanto custa o gemini-2.5-flash-native-audio?

Na Synthorai, o gemini-2.5-flash-native-audio custa $0.5 por milhão de tokens de entrada e $2 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

Como chamar a API do gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e espelhe o cabeçalho OpenAI-Beta.

Como obtenho acesso ao gemini-2.5-flash-native-audio?

O gemini-2.5-flash-native-audio está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gemini-2.5-flash-native-audio".

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →