Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Gemini 3 Flash

Lançado em 2025-12-17

chatVisãoCódigoChamada de ferramentasRaciocínioimageCache de prompts

O Gemini 3 Flash (preview) é o modelo que a documentação do Google descreve como o melhor do mundo em entendimento multimodal e seu “modelo agêntico e de vibe-coding mais poderoso até agora”, lançado com a promessa de desempenho de classe fronteira que rivaliza com modelos maiores por uma fração do custo.

Entrada
texto imagem vídeo áudio $0.5/M
Saída
texto $3/M
Entrada de áudio
$1/M
Leitura de cache
$0.05/M
Contexto
1M
vs GPT-4o
~90% mais barato
Corte de conhecimento
2025-01

Benchmarks

Acima da média7 / 16
Gemini 3 Flash outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
ResearchRubrics
36.9%
GPQA Diamond
90.7%
BrowseComp
41.5%
Video-MME (w. sub)
85.2%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$3/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.05/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.048.576
Saída máxima (especificação do fornecedor) 65.536
Corte de conhecimento 2025-01

Cache de prompts

Modo automático + explícito
Prefixo mín. 4.096

Raciocínio

Parâmetro do fornecedor thinkingLevel
Valores aceites minimal · low · medium · high
Valor predefinido high aplicado quando o pedido nada indica
Pode ser desativado Não
Comportamento do raciocínio O Google afirma que o Gemini 3 Flash não suporta desligar o raciocínio por completo, então minimal é um piso e não um interruptor, e os tokens de raciocínio são cobrados como tokens de saída em toda requisição; as thought signatures devem ser devolvidas e são obrigatórias para function calling.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem + vídeo + áudio → texto
  • Modelo em preview
  • 1.048.576 tokens de entrada
  • computer use suportado
  • geração de imagens NÃO suportada, apesar da tag de capacidade do gateway

conforme documentação oficial da Google ↗

Use o Gemini 3 Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3-flash-preview",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Gemini 3 Flash

  • Ele aceita entrada de texto, imagem, vídeo, áudio e PDF dentro de uma janela de contexto de 1.048.576 tokens e produz até 65.536 tokens de saída.
  • As capacidades incluem function calling, saídas estruturadas, execução de código, uso de computador, grounding por busca e Maps, contexto de URL, busca em arquivos, cache de contexto, a Batch API e inferência Flex e Priority.
  • O raciocínio é controlado por thinking_level, que aceita minimal, low, medium e high e assume high por padrão, o padrão mais caro da família: em todo modelo Gemini 3, minimal é um piso e não um interruptor de desligar, então os tokens de raciocínio são cobrados em cada requisição.
  • A geração também introduziu as thought signatures, traços criptografados de raciocínio interno que precisam ser devolvidos para preservar a continuidade em múltiplos turnos, junto com novos controles de resolução de mídia, e ambos são trabalho de migração, não extras opcionais, ao subir a partir do 2.5.
  • Como canal de preview, ele não traz garantias de estabilidade; o sucessor estável do Google é o gemini-3.5-flash, cuja página de modelo lista este ID como seu alias de preview.
  • A Synthorai o oferece pela sua interface unificada de chat completions compatível com OpenAI.

Perguntas frequentes

A API do Gemini 3 Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.5/M de tokens de entrada, só esse crédito já cobre cerca de 250 requisições de ~8K tokens ao Gemini 3 Flash.

Em que o Gemini 3 Flash é melhor?

Descrito como o melhor em entendimento multimodal; raciocínio de ponta com força em código criativo; suporte a uso de computador e grounding por Maps. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Gemini 3 Flash?

Na Synthorai, o Gemini 3 Flash custa $0.5 por milhão de tokens de entrada e $3 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.05/M.

O Gemini 3 Flash suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.05/M, contra $0.5/M sem cache; os prompts precisam de um prefixo estável de 4,096 tokens para entrar em cache. Guia de cache de prompts →

Como obtenho acesso ao Gemini 3 Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gemini-3-flash-preview" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Qual é o corte de conhecimento do Gemini 3 Flash?

O corte de conhecimento do Gemini 3 Flash é 2025-01, segundo a documentação oficial do fornecedor (verificado em 2026-07-09).

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →