🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

gemini-3.1-flash-lite-image vs GPT Image 2

vs

Qual usar, quando — veredito curado, não uma tabela de benchmark

Ambos são modelos de imagem que cobram os mesmos $30 por milhão de tokens de saída, então a verdadeira diferença está na entrada: o gemini-3.1-flash-lite-image aceita texto e imagens a $0.25 por milhão versus $5 do gpt-image-2, tornando 20x mais barato fornecer prompts e imagens de referência. Escolha o gemini-3.1-flash-lite-image para pipelines intensivos em prompts ou de imagem para imagem, onde o volume de entrada domina a fatura, e note que ele também pode retornar texto junto com as imagens, com um limite de saída de 4096 tokens e raciocínio que não pode ser desativado. Escolha o gpt-image-2 quando desejar um endpoint puramente de saída de imagem da OpenAI e o custo de entrada for um item de despesa menor.

Preços

gemini-3.1-flash-lite-image GPT Image 2 Δ
Entrada / 1M tokens $0.25 $5 0.05×
Saída / 1M tokens $30 $30 =

Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.

Onde eles se posicionam — preço de saída por 1M tokens entre todos os 8 modelos de geração de imagem nesta unidade de cobrança (escala logarítmica)

Especificações

gemini-3.1-flash-lite-image GPT Image 2
Modalidades de entrada texto imagem texto imagem
Modalidades de saída texto imagem imagem
Lançamento 2026-06-30 2026-04-21
Corte de conhecimento 2025-01
Tamanhos de saída 1K only (1:1 = 1024x1024)
  • 1024x1024
  • 1536x1024
  • 1024x1536
  • 2048x2048
  • 2048x1152
  • 3840x2160
  • 2160x3840
  • auto
  • arbitrary WxH (both divisible by 16, aspect ratio 1:3–3:1)
Modos de entrada text-to-image, interleaved generation + editing, up to 14 reference images text-to-image, image edit with mask inpainting
Imagens por requisição 10
Formatos png, jpeg, webp
Notas

1K (1024px) output only

10 aspect ratios (1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9) and up to 14 reference images

interleaved generation and editing with fast multi-turn local edits

sub-2s end-to-end latency

SynthID + C2PA watermarking always on

Flexible resolutions: edges up to 3840px in multiples of 16, ratio <=3:1, ~0.65-8.3MP total (incl. 4K 3840x2160)

editing with mask inpainting

all image inputs processed at high fidelity

significantly improved text rendering (precise placement can still struggle)

As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: gemini-3.1-flash-lite-image · GPT Image 2

Um prompt, ambos os modelos — medidos pelo gateway

PROMPT A weathered enamel diner mug on a steel counter, the words "OPEN 24H" stencilled on the mug in worn paint, low winter sun raking in from the left, shallow depth of field.

gemini-3.1-flash-lite-image

gemini-3.1-flash-lite-image: A weathered enamel diner mug on a steel counter, the words "OPEN 24H" stencilled on the mug in worn paint, low winter sun raking in from the left, shallow depth of field.

Retornado pelo modelo 1408×768 latência 3 s

GPT Image 2

GPT Image 2: A weathered enamel diner mug on a steel counter, the words "OPEN 24H" stencilled on the mug in worn paint, low winter sun raking in from the left, shallow depth of field.

Retornado pelo modelo 1402×1122 latência 18 s

Um prompt, uma requisição por modelo, sem novas tentativas e sem seleção a dedo — o primeiro resultado que cada modelo retornou. Nem o tamanho nem a duração foram fixados: cada modelo usou seu próprio padrão, porque uma requisição moldada para se ajustar a todos eles não favoreceria nenhum. Os arquivos aqui foram recodificados para a web, portanto, julgue a composição e a aderência ao prompt, não a compressão.

Alterne entre eles com uma linha

Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.images.generate(
    model="gemini-3.1-flash-lite-image",
    # model="gpt-image-2",  # descomente esta linha, comente a linha acima
    prompt="a watercolor lighthouse at dawn",
    size="1024x1024",
)
print(resp.data[0].b64_json[:80])

Obter uma chave de API →

FAQ

Qual é mais barato, gemini-3.1-flash-lite-image ou GPT Image 2?

gemini-3.1-flash-lite-image é mais barato em entrada / 1m tokens ($0.25 vs $5, com 20× de diferença). Outras linhas podem apontar para o outro lado — a tabela acima traz o quadro completo, e o custo real depende do seu mix.

Posso fazer um teste A/B de gemini-3.1-flash-lite-image contra GPT Image 2 sem duas integrações?

Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.

O preço muda com o tamanho da imagem?

Depende de como o modelo cobra. Modelos por imagem cobram o mesmo valor independentemente do prompt ou do tamanho da saída; modelos cobrados por token escalam de acordo com a resolução que você renderiza, então uma imagem 4K custa um múltiplo de uma pequena. A tabela acima mostra qual se aplica a cada um.

Comparações relacionadas

De nossos estudos medidos