Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

gemini-2.5-flash-native-audio

beta por convite Chamada de ferramentasRaciocínio

O Gemini 2.5 Flash Native Audio é o modelo de áudio nativo da Live API do Google, que a página do modelo descreve como habilitando interações de voz e vídeo em tempo real e de baixa latência com o Gemini 2.5 Flash: ele processa fluxos contínuos de áudio, vídeo ou texto e responde com fala imediata e semelhante à humana em vez de encadear um transcritor e um sintetizador.

Entrada
texto áudio vídeo $0.5/M
Saída
texto áudio $2/M
Entrada de áudio
$3/M
Saída de áudio
$12/M
Corte de conhecimento
2025-01

Benchmarks

gemini-2.5-flash-native-audio: 8 publicados, mas nenhum benchmark partilhado com modelos suficientes para comparar.

gemini-2.5-flash-native-audio outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

Publicado pelos fornecedores: Amazon OpenAI

O preço em contexto

Posição do preço entre 6 modelos comparáveis

Entrada$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 131.072
Saída máxima (especificação do fornecedor) 8.192
Corte de conhecimento 2025-01

Raciocínio

Parâmetro do fornecedor thinkingBudget
Valor predefinido raciocínio dynamic aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O guia da Live API documenta este modelo 2.5 Live como usando um orçamento de tokens em vez de um nível: raciocínio dynamic ativado por padrão, thinkingBudget 0 para desativar.
Parâmetro reasoning_effort
Valores minimal · low · medium · high o conjunto aceite é do provedor

Áudio

Limites de áudio
  • Sessão da Live API: PCM bruto de 16 bits little-endian, 16 kHz na entrada e 24 kHz na saída
  • sessões apenas de áudio limitadas a 15 minutos (2 minutos com vídeo), a menos que sejam estendidas via gerenciamento de sessão
  • contexto de sessão de 128k tokens
Transcrição em streaming Sim

Tempo real

Vozes Qualquer voz do conjunto de vozes de text-to-speech do Gemini; os modelos de saída de áudio nativo trocam de idioma naturalmente durante uma conversa.
Sessão
  • Function calling suportado, com declarações de função NON_BLOCKING que deixam o modelo continuar falando enquanto uma ferramenta roda
  • a interrupção por VAD cancela e descarta a geração em andamento
  • grounding por busca e raciocínio suportados
  • sem cache, saídas estruturadas, execução de código ou Batch API

Modelo

Modalidades texto + áudio + vídeo → texto + áudio

Modelo de áudio nativo da Live API que processa áudio bruto de ponta a ponta em vez de encadear STT e TTS. A página do modelo do Google lista um corte de conhecimento de janeiro de 2025 e um limite de saída incomumente pequeno de 8.192 tokens, ao lado da janela de entrada de 131.072 tokens.

conforme documentação oficial da Google ↗

Use o gemini-2.5-flash-native-audio em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o gemini-2.5-flash-native-audio

  • As sessões rodam sobre um WebSocket com estado, recebendo PCM bruto de 16 bits a 16 kHz e devolvendo a 24 kHz, e o modelo aceita áudio, vídeo e texto enquanto retorna áudio e texto.
  • Os limites de tokens são 131.072 para entrada e um valor incomumente pequeno de 8.192 para saída, a janela de contexto da sessão é de 128k tokens para modelos de áudio nativo, e as sessões somente de áudio duram 15 minutos, ou 2 minutos com vídeo, a menos que sejam estendidas por gerenciamento de sessão.
  • Function calling, grounding por busca e raciocínio (thinking) são suportados; cache, saídas estruturadas, execução de código e a Batch API não são.
  • Duas capacidades separam esta geração do modelo Live mais novo e são a razão para permanecer nela: áudio proativo, que deixa o modelo decidir não responder quando a entrada não é relevante, e diálogo afetivo, que adapta o estilo de resposta à expressão e ao tom de quem fala.
  • A chamada assíncrona de funções também é suportada aqui, então uma declaração marcada como non-blocking deixa o modelo continuar falando enquanto uma ferramenta roda.
  • As vozes vêm do conjunto de text-to-speech do Google, a saída de áudio nativo troca de idioma naturalmente durante uma conversa e não aceita um código de idioma explícito, e o corte de conhecimento é janeiro de 2025.
  • A Synthorai o expõe pelo endpoint WebSocket /v1/realtime compatível com OpenAI usado pelo restante do seu catálogo de voz.

Perguntas frequentes

A API do gemini-2.5-flash-native-audio é gratuita para testar?

O gemini-2.5-flash-native-audio está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o gemini-2.5-flash-native-audio é melhor?

Voz e vídeo em tempo real com baixa latência pela Live API; áudio proativo e diálogo afetivo, ausentes no modelo Live mais novo; sessões somente de áudio duram 15 minutos, dois com vídeo. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o gemini-2.5-flash-native-audio?

Na Synthorai, o gemini-2.5-flash-native-audio custa $0.5 por milhão de tokens de entrada e $2 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

Como chamar a API do gemini-2.5-flash-native-audio?

gemini-2.5-flash-native-audio é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao gemini-2.5-flash-native-audio?

O gemini-2.5-flash-native-audio está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gemini-2.5-flash-native-audio".

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →