gemini-3.1-flash-lite-image vs GPT Image 2
Qual usar, quando — veredito curado, não uma tabela de benchmark
Ambos são modelos de imagem que cobram os mesmos $30 por milhão de tokens de saída, então a verdadeira diferença está na entrada: o gemini-3.1-flash-lite-image aceita texto e imagens a $0.25 por milhão versus $5 do gpt-image-2, tornando 20x mais barato fornecer prompts e imagens de referência. Escolha o gemini-3.1-flash-lite-image para pipelines intensivos em prompts ou de imagem para imagem, onde o volume de entrada domina a fatura, e note que ele também pode retornar texto junto com as imagens, com um limite de saída de 4096 tokens e raciocínio que não pode ser desativado. Escolha o gpt-image-2 quando desejar um endpoint puramente de saída de imagem da OpenAI e o custo de entrada for um item de despesa menor.
Preços
| gemini-3.1-flash-lite-image | GPT Image 2 | Δ | |
|---|---|---|---|
| Entrada / 1M tokens | $0.25 | $5 | 0.05× |
| Saída / 1M tokens | $30 | $30 | = |
Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.
Onde eles se posicionam — preço de saída por 1M tokens entre todos os 8 modelos de geração de imagem nesta unidade de cobrança (escala logarítmica)
Especificações
| gemini-3.1-flash-lite-image | GPT Image 2 | |
|---|---|---|
| Modalidades de entrada | texto imagem | texto imagem |
| Modalidades de saída | texto imagem | imagem |
| Lançamento | 2026-06-30 | 2026-04-21 |
| Corte de conhecimento | 2025-01 | — |
| Tamanhos de saída | 1K only (1:1 = 1024x1024) |
|
| Modos de entrada | text-to-image, interleaved generation + editing, up to 14 reference images | text-to-image, image edit with mask inpainting |
| Imagens por requisição | — | 10 |
| Formatos | — | png, jpeg, webp |
| Notas | 1K (1024px) output only 10 aspect ratios (1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9) and up to 14 reference images interleaved generation and editing with fast multi-turn local edits sub-2s end-to-end latency SynthID + C2PA watermarking always on | Flexible resolutions: edges up to 3840px in multiples of 16, ratio <=3:1, ~0.65-8.3MP total (incl. 4K 3840x2160) editing with mask inpainting all image inputs processed at high fidelity significantly improved text rendering (precise placement can still struggle) |
As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: gemini-3.1-flash-lite-image · GPT Image 2
Um prompt, ambos os modelos — medidos pelo gateway
Um prompt, uma requisição por modelo, sem novas tentativas e sem seleção a dedo — o primeiro resultado que cada modelo retornou. Nem o tamanho nem a duração foram fixados: cada modelo usou seu próprio padrão, porque uma requisição moldada para se ajustar a todos eles não favoreceria nenhum. Os arquivos aqui foram recodificados para a web, portanto, julgue a composição e a aderência ao prompt, não a compressão.
Alterne entre eles com uma linha
Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.images.generate(
model="gemini-3.1-flash-lite-image",
# model="gpt-image-2", # descomente esta linha, comente a linha acima
prompt="a watercolor lighthouse at dawn",
size="1024x1024",
)
print(resp.data[0].b64_json[:80])import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.images.generate({
model: "gemini-3.1-flash-lite-image",
// model: "gpt-image-2", // descomente esta linha, comente a linha acima
prompt: "a watercolor lighthouse at dawn",
size: "1024x1024",
});
console.log(resp.data?.[0]?.b64_json?.slice(0, 80));curl https://synthorai.io/v1/images/generations \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-lite-image",
# "model": "gpt-image-2", # descomente esta linha, comente a linha acima
"prompt": "a watercolor lighthouse at dawn",
"size": "1024x1024"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Images.Generate(context.TODO(), openai.ImageGenerateParams{
Model: "gemini-3.1-flash-lite-image",
// Model: "gpt-image-2", // descomente esta linha, comente a linha acima
Prompt: "a watercolor lighthouse at dawn",
Size: "1024x1024",
})
fmt.Println(resp.Data[0].B64JSON[:80])
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.images.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ImagesResponse resp = client.images().generate(
ImageGenerateParams.builder()
.model("gemini-3.1-flash-lite-image")
// .model("gpt-image-2") // descomente esta linha, comente a linha acima
.prompt("a watercolor lighthouse at dawn")
.size("1024x1024")
.build());
System.out.println(resp.data().orElseThrow().get(0).b64Json().orElseThrow().substring(0, 80));FAQ
Qual é mais barato, gemini-3.1-flash-lite-image ou GPT Image 2?
gemini-3.1-flash-lite-image é mais barato em entrada / 1m tokens ($0.25 vs $5, com 20× de diferença). Outras linhas podem apontar para o outro lado — a tabela acima traz o quadro completo, e o custo real depende do seu mix.
Posso fazer um teste A/B de gemini-3.1-flash-lite-image contra GPT Image 2 sem duas integrações?
Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.
O preço muda com o tamanho da imagem?
Depende de como o modelo cobra. Modelos por imagem cobram o mesmo valor independentemente do prompt ou do tamanho da saída; modelos cobrados por token escalam de acordo com a resolução que você renderiza, então uma imagem 4K custa um múltiplo de uma pequena. A tabela acima mostra qual se aplica a cada um.