Custo de API de geração de imagens: 5 modelos ($0.006–$0.039)
Conteúdo
Adicionamos geração de imagens a um gateway criado para LLMs de texto e medimos o impacto de quatro variáveis no custo: modelo, resolução, quantidade de imagens e qualidade. O maior fator é a qualidade, um parâmetro disponível na maioria das APIs de imagem e que quase sempre fica no valor padrão. Resolução, prompt caching e processamento em lote importam bem menos do que muitos imaginam.
TL;DR
- O controle
qualitydo gpt-image altera a conta em cerca de 36x na mesma resolução: 196 / 1,756 / 7,024 output tokens cobrados ($0.0060 / $0.053 / $0.211) para low/medium/high em 1024x1024. - A escolha do modelo representa uma diferença de 6.4x: $0.0060 por imagem com o gpt-image-2 em baixa qualidade, contra $0.0387 com o gemini-2.5-flash-image.
- A resolução quase não faz diferença: passar de 1024x1024 para 2048x2048 apenas dobrou o custo por imagem do gpt-image-2.
- Geração de imagens não oferece prompt caching, e
n=4cobra novamente o prompt quatro vezes; a cobrança por token vence abaixo de aproximadamente 1,000 output tokens, enquanto o preço fixo por imagem vence acima disso.
Diferenças entre os modelos de geração de imagens
Modelos de imagem não são intercambiáveis. Eles diferem em vários aspectos, e apenas um deles, a forma de cobrança, está diretamente ligado ao preço. Este é o catálogo ativo em resumo:
| Família | Cobrança | Controle quality | Lote n>1 | Resolução |
|---|---|---|---|---|
gpt-image (OpenAI) | por token | ✓ low/med/high | ✓ | até ≈2K |
gemini-image (Google) | por token | ✗ | ✗ 1/chamada | 1K (gemini-3: até 4K) |
qwen-image / wan2.7 (Alibaba) | preço fixo/imagem | ✗ | ✓ | 512²–2048² |
seedream (BytePlus) | preço fixo/imagem | ✗ | ✗ 1/chamada | ≥1920² (4.5/5.0) |
Estas diferenças causam problemas quando se pressupõe que todos os modelos funcionam da mesma forma:
- Forma de cobrança. Por token (
gpt-image,gemini) ou preço fixo por imagem (qwen,wan,seedream). É isso que determina a conta e será o tema da próxima seção. - O controle
quality. Apenas ogpt-imageoferece esse parâmetro (low/medium/high). No Gemini, a fidelidade muda conforme a categoria do modelo (flashapro) ou oimage_size; modelos com preço fixo não têm esse controle. Como esse único parâmetro altera a conta em cerca de 36×, ele é o principal fator de custo e será analisado abaixo. - Nem todos aceitam lotes (
n>1).gpt-image,qwenewanretornam várias imagens por chamada. Todos os modelos de imagem Gemini e Seedream retornam uma única imagem por chamada:n=2resulta em400, então é preciso enviar N requisições e coordenar o lote por conta própria. - Os limites de resolução restringem nos dois sentidos.
gemini-2.5-flash-imagechega no máximo a 1K (1 MP), enquanto ogemini-3alcança 2K/4K, com a conta praticamente dobrando de 1K para 4K. Seedream 4.5/5.0 exige uma resolução mínima de aproximadamente 1920² e rejeita valores menores.qwen-imageopera entre 512² e 2048². Nem sempre há resoluções mais altas disponíveis, e nem sempre é permitido reduzir a resolução para economizar. - Os controles e os recursos de imagem para imagem variam. Apenas alguns modelos aceitam
seed,negative_promptouguidance_scale. O limite de imagens de referência para edição vai de 3 (gemini-2.5) a 16 (gpt-image).
O controle quality tem uma característica pouco intuitiva. No gpt-image, um output token é uma unidade de cobrança, não uma medida do arquivo recebido. A OpenAI define essa quantidade em uma tabela pública de valores por (quality × size): 272 / 1,056 / 4,160 tokens para low / medium / high em 1024² no gpt-image-1. Portanto, a quantidade é determinada pelo quality, e não pelos bytes retornados. Confirmamos isso: com o mesmo prompt em 1024², os três níveis produziram PNGs idênticos de 1024×1024 e aproximadamente o mesmo tamanho, cerca de 0.9 MB, mas cobraram 196, 1,756 e 7,024 tokens. Mesma resolução, mesmo tamanho em bytes, custo 36× maior. A cobrança reflete o esforço de renderização, não a quantidade de pixels. Por isso, é preciso consultar usage, e não estimar pelo resultado visual.
Nenhum desses modelos oferece prompt caching, normalmente a primeira opção considerada para reduzir custos. A geração de imagens é stateless: não há conversa nem estado de KV para reutilizar, o objeto usage não contém campos de cache e, como medimos abaixo, o processamento em lote também não compartilha o prompt. Cache é um recurso de chat, não de imagem. Portanto, uma das suposições mais comuns para reduzir o custo de imagens não se aplica.
Fizemos as medições
Usamos o mesmo prompt de produto, no estilo de e-commerce, em gerações reais pelo gateway. O custo foi calculado com base no usage retornado e nas tarifas publicadas por cada modelo. Fizemos cinco análises independentes.
1. O custo está na imagem, não no prompt. Em texto para imagem, com um prompt de entrada e uma imagem de saída, os output tokens representam de 97–100% da conta: uma geração 1024² com gpt-image-2 usa 21 input tokens e 196 output tokens, cerca de $0.0001 mais $0.0059, enquanto o gemini-2.5-flash-image usa 10 tokens de entrada. O prompt escrito tem impacto insignificante, mas somente porque é texto. Ao enviar uma imagem, como em uma edição imagem para imagem do tipo “deixe esta caneca azul”, a tokenização da entrada aumenta muito:
| Modelo | Entrada t2i | Entrada i2i (1 ref.) | Saída |
|---|---|---|---|
gpt-image-2 (low) | 21 tok | 1,043 tok | 196 tok |
gemini-2.5-flash-image | 10 tok | 1,297 tok | 1,290 tok |
A entrada aumenta entre 50–130× e cresce linearmente: cada referência adicional acrescenta aproximadamente 1,025 tokens no gpt-image-2. Com 1, 2 e 3 referências, medimos 1,043, 2,068 e 3,093. Em baixa qualidade, esses input tokens superam em cinco vezes a saída gerada. A regra é a mesma nos dois casos: o custo está na imagem, seja ela gerada ou fornecida, e nunca no prompt. O restante deste artigo se limita a texto para imagem; a análise econômica completa de imagem para imagem ficará para outro artigo.
2. A escolha do modelo representa uma diferença de 6×. Mesma requisição 1024², com a qualidade padrão:
| Modelo | Cobrança | Custo / imagem |
|---|---|---|
gpt-image-2 | token · controle quality | $0.0060 |
gpt-image-1-mini | token · controle quality | $0.0085 |
seedream-4-0 | preço fixo por requisição | $0.030 |
qwen-image-2.0 | preço fixo por requisição | $0.035 |
gemini-2.5-flash-image | token · sem controle quality | $0.0387 |
A diferença entre a opção mais barata e a mais cara é de 6.4×, determinada exclusivamente pela quantidade de output tokens emitidos por cada modelo.
3. A resolução quase não altera o custo. Ao variar o gpt-image-2 de 1024² a 2048², o custo por imagem permaneceu praticamente estável, de $0.0060 a $0.0121; a quantidade de output tokens não é proporcional ao número de pixels. O gemini-2.5-flash-image retornou os mesmos 1,290 tokens para todos os tamanhos solicitados, pois só oferece 1K e o size altera apenas a proporção da imagem. Os modelos de imagem gemini-3 respeitam o image_size, com o custo praticamente dobrando de 1K para 4K, mas isso não ocorre no 2.5-flash-image, que é o modelo analisado aqui. Por definição, a resolução não altera o preço dos modelos com valor fixo por imagem. Até aqui, o modelo por token parece difícil de superar.
4. A qualidade define o ponto de equilíbrio. Variamos os níveis de qualidade do gpt-image-2:
| quality | 1024² | 2048² |
|---|---|---|
| low | $0.0060 (196 tok) | $0.0121 (397 tok) |
| medium | $0.053 (1,756 tok) | $0.107 (3,568 tok) |
| high | $0.211 (7,024 tok) | $0.428 (14,272 tok) |
A quantidade de output tokens cresce cerca de 9× de low para medium e aproximadamente 36× de low para high. Em baixa qualidade, o modelo por token é a opção mais barata; em média ou alta, ele ultrapassa o preço fixo por imagem ($0.03–0.035). O ponto de equilíbrio fica onde a conta indica, em torno de 1,000 output tokens ($0.03 ÷ $30/M): low fica abaixo e medium, acima. Isso também corrige uma conclusão anterior nossa. A afirmação de que “por token é sempre mais barato” foi resultado de testes apenas com a baixa qualidade padrão.

Mesmo prompt, gpt-image-2, 1024². low / medium / high cobram 196 / 1,756 / 7,024 output tokens, ou $0.006 / $0.053 / $0.215: uma diferença de 36× na mesma resolução. Para uma foto simples de produto como esta, é difícil distinguir as três, então o nível mais barato costuma ser suficiente. Defina quality de acordo com o uso em vez de adotar high como padrão.
5. Não é possível compartilhar o prompt entre imagens. Gerar n imagens em uma chamada não dilui o custo do prompt. O gpt-image-2 cobra o prompt N vezes: os input tokens passaram de 28 para 112 com n=4, e um prompt longo de identidade de marca passou de 499 para 1,996. O custo por imagem foi idêntico com n=1 e n=4. Sem cache, também não existe nenhum mecanismo de compartilhamento do custo do prompt na geração de imagens. Cada imagem de saída é cobrada separadamente, e o prompt volta a ser cobrado todas as vezes.
Regra de decisão
Para texto para imagem, a decisão depende da qualidade, não dos fatores que normalmente recebem mais atenção:
- Qualidade baixa / rascunho / miniatura: um modelo por token com controle de qualidade (
gpt-image, cerca de $0.006–0.012). É a opção mais barata em qualquer resolução até aproximadamente 2K. - Qualidade média / alta: preço fixo por requisição (
seedream/qwen, $0.03–0.035). O custo por token dispara, de $0.05–0.43 nos nossos testes, enquanto o preço fixo é mais barato e independe da qualidade. gemini(cerca de $0.039 em 1K padrão) raramente tem o melhor custo. Ogpt-imageé mais barato em baixa qualidade, e os modelos com preço fixo por requisição vencem em média e alta. Como não há controlequality, a escolha da categoria Pro ou de umimage_sizemaior deve ser feita pela qualidade de saída, não pelo preço.- A resolução altera o custo em cerca de 2× dentro do mesmo nível de qualidade, diferença insuficiente para mudar a escolha. A qualidade é o que muda o resultado.
n>1, cache e processamento em lote nunca reduzem o custo por imagem. Não há nada que possa ser compartilhado.- Imagem para imagem: comece pelos modelos com preço fixo por imagem. Uma imagem de referência faz parte da entrada, e apenas os modelos por token cobram um adicional, de aproximadamente 1,025 tokens por referência; nos modelos de preço fixo, ela está incluída sem custo extra. Para edição,
seedream/qwengeralmente vencem. Ogpt-imagecontinua mais barato apenas para edições de baixa qualidade e com poucas referências, chegando ao preço fixo por volta de 5. Ele perde conforme aumentam a qualidade ou a quantidade de referências.
E-commerce é o exemplo mais claro. Imagine que você gere fotos de produtos enviando o mesmo prompt longo de identidade de marca para cada item do catálogo, supondo que o cache desse prompt repetido reduzirá o custo. Isso falha por dois motivos: o prompt nunca foi o principal custo, a imagem é, e não existe cache para geração. Como imagens reais de produtos exigem qualidade média ou superior, a melhor escolha é um modelo de preço fixo por imagem. Ele é mais barato e mais previsível, independentemente do quanto os prompts se repetem.
As limitações de recursos apresentadas no início ainda podem mudar a decisão: modelos limitados a uma imagem por chamada, resoluções mínimas e máximas, restrições de residência de dados e os controles expostos pelo modelo (seed, negative_prompt, guidance_scale). Escolha pelo custo e depois confirme se os recursos atendem ao caso de uso.
Por que estes números são confiáveis
Os valores vêm do usage real e das tarifas publicadas por cada fornecedor, não de estimativas. No nosso gateway, a cobrança de imagens não depende de sessão: ela só é concluída em respostas 2xx, e uma geração com falha nunca é cobrada. Antes de qualquer gasto, o sistema verifica o pior custo possível. Se a resposta não tiver usage, cobra o teto em vez de registrar silenciosamente $0. Aplicamos o mesmo princípio em todo o gateway: confie no custo calculado, não em um número fornecido pelo próprio fornecedor. Foi esse o método usado para verificar se um gateway informa dados falsos sobre cache.
Conclusão
Geração de imagens parece apenas mais um endpoint, mas a unidade de cobrança é diferente. Em texto para imagem, o principal fator não é o prompt, pois não há cache nem compartilhamento em lote, nem a resolução. É a qualidade: gpt-image é mais barato em low, enquanto modelos com preço fixo por imagem (seedream / qwen) vencem em medium e high. O ponto de equilíbrio fica próximo de 1,000 output tokens. Defina a qualidade de forma intencional, escolha o modelo adequado e confira o custo. Ao passar da geração para a edição com uma imagem de referência, refaça a conta, porque a imagem de entrada passa a representar o custo.
Perguntas frequentes
Prompt caching reduz o custo da geração de imagens?
Não. A geração é stateless: o objeto usage não tem campos de cache, e o processamento em lote cobra novamente o prompt para cada imagem. O custo está na imagem de saída, não no texto.
O que é mais barato: cobrança por token ou por imagem?
Depende da qualidade. Para qualidade baixa ou rascunho, use um modelo com controle quality, como o gpt-image, por cerca de $0.006–0.012. Para média ou alta, use um modelo com preço fixo por imagem, como seedream/qwen ($0.03–0.035), pois o custo por token dispara. Em imagem para imagem, o preço fixo leva ainda mais vantagem: as imagens de referência são incluídas sem custo extra, enquanto os modelos por token acrescentam aproximadamente 1,025 tokens por referência.
Fontes
- OpenAI: API de geração de imagens
- OpenAI: preços por token do gpt-image
- Google: preços da API Gemini para output tokens de imagem
- OpenAI: prompt caching e por que ele não se aplica à geração de imagens
Todos os dados foram verificados em 2026-06-19. Isto não é aconselhamento financeiro; confirme os preços atuais antes de tomar qualquer decisão com base neles.