Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

gemini-3.1-flash-live

Lançado em 2026-03-26

beta por convite Chamada de ferramentasRaciocínioVisão

O Gemini 3.1 Flash Live é o modelo de áudio para áudio de baixa latência do Google para diálogo em tempo real e aplicações voice-first, e sua página de modelo o credita com detecção de nuances acústicas, precisão numérica e consciência multimodal.

Entrada
texto imagem áudio vídeo $0.75/M
Saída
texto áudio $4.5/M
Entrada de áudio
$3/M
Saída de áudio
$12/M

O preço em contexto

Posição do preço entre 6 modelos comparáveis

Entrada$0.75/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$4.5/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 131.072
Saída máxima (especificação do fornecedor) 65.536

Raciocínio

Parâmetro do fornecedor thinkingLevel
Valores aceites minimal · low · medium · high
Valor predefinido minimal aplicado quando o pedido nada indica
Pode ser desativado Não
Comportamento do raciocínio O padrão é minimal para otimizar a menor latência; os modelos Gemini 3 Live substituíram o thinkingBudget do 2.5 Live por um nível.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Áudio

Idiomas Mais de 90 idiomas para conversação multimodal em tempo real
Limites de áudio
  • Sessão da Live API: PCM bruto de 16 bits little-endian, 16 kHz na entrada e 24 kHz na saída
  • sessões apenas de áudio limitadas a 15 minutos (2 minutos com vídeo), a menos que sejam estendidas via gerenciamento de sessão
  • contexto de sessão de 128k tokens
Transcrição em streaming Sim

Tempo real

Vozes Qualquer voz do conjunto de vozes de text-to-speech do Gemini; os modelos de saída de áudio nativo trocam de idioma naturalmente durante uma conversa.
Sessão
  • O function calling é apenas sequencial: o modelo não começa a responder até que a resposta da ferramenta seja enviada
  • grounding por busca e raciocínio suportados
  • a interrupção por VAD cancela a geração em andamento
  • sem cache, saídas estruturadas, execução de código ou Batch API

Modelo

Modalidades texto + imagem + áudio + vídeo → texto + áudio

Modelo de áudio para áudio de baixa latência para agentes de voz, documentado para detecção de nuances acústicas, precisão numérica e percepção multimodal. Usa thinkingLevel (minimal / low / medium / high) em vez de thinkingBudget, com padrão minimal para a menor latência.

conforme documentação oficial da Google ↗

Use o gemini-3.1-flash-live em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o gemini-3.1-flash-live

  • Ele aceita texto, imagens, áudio e vídeo e retorna texto e áudio pelo WebSocket com estado da Live API, com limite de entrada de 131.072 tokens e limite de saída de 65.536 tokens, oito vezes o teto de saída do modelo de áudio nativo 2.5 que ele substitui.
  • Function calling, grounding por busca e raciocínio (thinking) são suportados, enquanto cache, saídas estruturadas, execução de código e a Batch API não são, e a profundidade do raciocínio é definida com thinkingLevel em minimal, low, medium ou high, assumindo minimal por padrão para a menor latência em vez do thinkingBudget numérico que a geração 2.5 usava.
  • As notas de migração são a parte útil, porque esta atualização remove tanto quanto adiciona.
  • A chamada assíncrona de funções ainda não é suportada, então as chamadas são sequenciais e o modelo não começará a responder até que a resposta da ferramenta chegue; o áudio proativo e o diálogo afetivo desapareceram e sua configuração precisa ser removida.
  • Um único evento de servidor agora pode carregar várias partes de conteúdo de uma vez, como um trecho de áudio e uma transcrição juntos, então clientes que leem apenas a primeira parte descartarão conteúdo silenciosamente.
  • A cobertura de turno agora inclui por padrão a atividade de áudio detectada e todos os frames de vídeo, o que pode elevar os custos para aplicações que transmitem vídeo continuamente, e o conteúdo do cliente pode apenas semear o histórico inicial.
  • A Synthorai o serve pelo endpoint WebSocket /v1/realtime compatível com OpenAI.

Perguntas frequentes

A API do gemini-3.1-flash-live é gratuita para testar?

O gemini-3.1-flash-live está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o gemini-3.1-flash-live é melhor?

Modelo de áudio para áudio para diálogo em tempo real e aplicações voice-first; oito vezes o teto de saída do modelo de áudio nativo 2.5; sem chamada assíncrona de funções, então as chamadas de ferramentas são sequenciais. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o gemini-3.1-flash-live?

Na Synthorai, o gemini-3.1-flash-live custa $0.75 por milhão de tokens de entrada e $4.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

Como chamar a API do gemini-3.1-flash-live?

gemini-3.1-flash-live é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao gemini-3.1-flash-live?

O gemini-3.1-flash-live está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="gemini-3.1-flash-live".

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →