gemini-3.1-flash-lite-image vs GPT Image 2
Cuál usar y cuándo — veredicto seleccionado, no una tabla de benchmarks
Ambos son modelos de imagen que cobran los mismos $30 por millón de tokens de salida, por lo que la verdadera división está en la entrada: gemini-3.1-flash-lite-image acepta texto e imágenes a $0.25 por millón frente a $5 de gpt-image-2, haciéndolo 20x más barato para proporcionar prompts e imágenes de referencia. Elija gemini-3.1-flash-lite-image para pipelines intensivos en prompts o de imagen a imagen donde el volumen de entrada domine la factura, y tenga en cuenta que también puede devolver texto junto a las imágenes, con un límite de salida de 4096 tokens y un pensamiento que no se puede desactivar. Elija gpt-image-2 cuando desee un endpoint puramente de salida de imagen de OpenAI y el costo de entrada sea un gasto menor.
Precios
| gemini-3.1-flash-lite-image | GPT Image 2 | Δ | |
|---|---|---|---|
| Entrada / 1M tokens | $0.25 | $5 | 0.05× |
| Salida / 1M tokens | $30 | $30 | = |
Tarifas del catálogo en vivo en el momento de la compilación; la página de cada modelo incluye la ficha actualizada.
Dónde se sitúan — precio de salida por 1M de tokens en todos los 8 modelos de generación de imágenes en esta unidad de facturación (escala logarítmica)
Especificaciones
| gemini-3.1-flash-lite-image | GPT Image 2 | |
|---|---|---|
| Modalidades de entrada | texto imagen | texto imagen |
| Modalidades de salida | texto imagen | imagen |
| Lanzamiento | 2026-06-30 | 2026-04-21 |
| Límite de conocimiento | 2025-01 | — |
| Tamaños de salida | 1K only (1:1 = 1024x1024) |
|
| Modos de entrada | text-to-image, interleaved generation + editing, up to 14 reference images | text-to-image, image edit with mask inpainting |
| Imágenes por solicitud | — | 10 |
| Formatos | — | png, jpeg, webp |
| Notas | 1K (1024px) output only 10 aspect ratios (1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9) and up to 14 reference images interleaved generation and editing with fast multi-turn local edits sub-2s end-to-end latency SynthID + C2PA watermarking always on | Flexible resolutions: edges up to 3840px in multiples of 16, ratio <=3:1, ~0.65-8.3MP total (incl. 4K 3840x2160) editing with mask inpainting all image inputs processed at high fidelity significantly improved text rendering (precise placement can still struggle) |
Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica una fila, se omite en lugar de inferirse. Fuentes completas: gemini-3.1-flash-lite-image · GPT Image 2
Un prompt, ambos modelos — medido a través del gateway
Un prompt, una solicitud por modelo, sin reintentos y sin selección a dedo — el primer resultado que cada modelo devolvió. Ni el tamaño ni la duración se fijaron: cada modelo utilizó su propio valor por defecto, porque una solicitud diseñada para adaptarse a todos no favorecería a ninguno. Los archivos aquí están recodificados para la web, así que juzgue la composición y la adherencia al prompt, no la compresión.
Cambia entre ellos con una línea
Ambos IDs están en cada pestaña a continuación — el par de líneas resaltadas es la única edición. Mismo endpoint, misma clave, misma estructura de solicitud.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.images.generate(
model="gemini-3.1-flash-lite-image",
# model="gpt-image-2", # descomenta esta línea, comenta la de arriba
prompt="a watercolor lighthouse at dawn",
size="1024x1024",
)
print(resp.data[0].b64_json[:80])import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.images.generate({
model: "gemini-3.1-flash-lite-image",
// model: "gpt-image-2", // descomenta esta línea, comenta la de arriba
prompt: "a watercolor lighthouse at dawn",
size: "1024x1024",
});
console.log(resp.data?.[0]?.b64_json?.slice(0, 80));curl https://synthorai.io/v1/images/generations \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-lite-image",
# "model": "gpt-image-2", # descomenta esta línea, comenta la de arriba
"prompt": "a watercolor lighthouse at dawn",
"size": "1024x1024"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Images.Generate(context.TODO(), openai.ImageGenerateParams{
Model: "gemini-3.1-flash-lite-image",
// Model: "gpt-image-2", // descomenta esta línea, comenta la de arriba
Prompt: "a watercolor lighthouse at dawn",
Size: "1024x1024",
})
fmt.Println(resp.Data[0].B64JSON[:80])
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.images.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ImagesResponse resp = client.images().generate(
ImageGenerateParams.builder()
.model("gemini-3.1-flash-lite-image")
// .model("gpt-image-2") // descomenta esta línea, comenta la de arriba
.prompt("a watercolor lighthouse at dawn")
.size("1024x1024")
.build());
System.out.println(resp.data().orElseThrow().get(0).b64Json().orElseThrow().substring(0, 80));Preguntas frecuentes
¿Cuál es más barato, gemini-3.1-flash-lite-image o GPT Image 2?
gemini-3.1-flash-lite-image es más barato en entrada / 1m tokens ($0.25 vs $5, con una diferencia de 20×). Otras filas pueden indicar lo contrario — la tabla anterior muestra la ficha completa, y el costo real depende de su combinación.
¿Puedo hacer pruebas A/B de gemini-3.1-flash-lite-image frente a GPT Image 2 sin dos integraciones?
Sí. Ambos se sirven a través del mismo endpoint compatible con OpenAI con una clave API — el cambio es una modificación de una línea en la cadena del modelo, por lo que puede enrutar una fracción del tráfico a cada uno y comparar las facturas directamente.
¿Cambia el precio con el tamaño de la imagen?
Depende de cómo facture el modelo. Los modelos por imagen cobran lo mismo independientemente del prompt o del tamaño de salida; los modelos facturados por tokens escalan con la resolución que renderice, por lo que una imagen 4K cuesta un múltiplo de una pequeña. La tabla anterior muestra cuál aplica a cada uno.