🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
Custo de API de geração de imagens: 5 modelos ($0.006–$0.039)

Custo de API de geração de imagens: 5 modelos ($0.006–$0.039)

Conteúdo
  1. Diferenças entre os modelos de geração de imagens
  2. Fizemos as medições
  3. Regra de decisão
  4. Por que estes números são confiáveis
  5. Conclusão
  6. Perguntas frequentes
  7. Fontes

Adicionamos geração de imagens a um gateway criado para LLMs de texto e medimos o impacto de quatro variáveis no custo: modelo, resolução, quantidade de imagens e qualidade. O maior fator é a qualidade, um parâmetro disponível na maioria das APIs de imagem e que quase sempre fica no valor padrão. Resolução, prompt caching e processamento em lote importam bem menos do que muitos imaginam.

TL;DR

  • O controle quality do gpt-image altera a conta em cerca de 36x na mesma resolução: 196 / 1,756 / 7,024 output tokens cobrados ($0.0060 / $0.053 / $0.211) para low/medium/high em 1024x1024.
  • A escolha do modelo representa uma diferença de 6.4x: $0.0060 por imagem com o gpt-image-2 em baixa qualidade, contra $0.0387 com o gemini-2.5-flash-image.
  • A resolução quase não faz diferença: passar de 1024x1024 para 2048x2048 apenas dobrou o custo por imagem do gpt-image-2.
  • Geração de imagens não oferece prompt caching, e n=4 cobra novamente o prompt quatro vezes; a cobrança por token vence abaixo de aproximadamente 1,000 output tokens, enquanto o preço fixo por imagem vence acima disso.

Diferenças entre os modelos de geração de imagens

Modelos de imagem não são intercambiáveis. Eles diferem em vários aspectos, e apenas um deles, a forma de cobrança, está diretamente ligado ao preço. Este é o catálogo ativo em resumo:

FamíliaCobrançaControle qualityLote n>1Resolução
gpt-image (OpenAI)por tokenlow/med/highaté ≈2K
gemini-image (Google)por token✗ 1/chamada1K (gemini-3: até 4K)
qwen-image / wan2.7 (Alibaba)preço fixo/imagem512²–2048²
seedream (BytePlus)preço fixo/imagem✗ 1/chamada≥1920² (4.5/5.0)

Estas diferenças causam problemas quando se pressupõe que todos os modelos funcionam da mesma forma:

  • Forma de cobrança. Por token (gpt-image, gemini) ou preço fixo por imagem (qwen, wan, seedream). É isso que determina a conta e será o tema da próxima seção.
  • O controle quality. Apenas o gpt-image oferece esse parâmetro (low/medium/high). No Gemini, a fidelidade muda conforme a categoria do modelo (flash a pro) ou o image_size; modelos com preço fixo não têm esse controle. Como esse único parâmetro altera a conta em cerca de 36×, ele é o principal fator de custo e será analisado abaixo.
  • Nem todos aceitam lotes (n>1). gpt-image, qwen e wan retornam várias imagens por chamada. Todos os modelos de imagem Gemini e Seedream retornam uma única imagem por chamada: n=2 resulta em 400, então é preciso enviar N requisições e coordenar o lote por conta própria.
  • Os limites de resolução restringem nos dois sentidos. gemini-2.5-flash-image chega no máximo a 1K (1 MP), enquanto o gemini-3 alcança 2K/4K, com a conta praticamente dobrando de 1K para 4K. Seedream 4.5/5.0 exige uma resolução mínima de aproximadamente 1920² e rejeita valores menores. qwen-image opera entre 512² e 2048². Nem sempre há resoluções mais altas disponíveis, e nem sempre é permitido reduzir a resolução para economizar.
  • Os controles e os recursos de imagem para imagem variam. Apenas alguns modelos aceitam seed, negative_prompt ou guidance_scale. O limite de imagens de referência para edição vai de 3 (gemini-2.5) a 16 (gpt-image).

O controle quality tem uma característica pouco intuitiva. No gpt-image, um output token é uma unidade de cobrança, não uma medida do arquivo recebido. A OpenAI define essa quantidade em uma tabela pública de valores por (quality × size): 272 / 1,056 / 4,160 tokens para low / medium / high em 1024² no gpt-image-1. Portanto, a quantidade é determinada pelo quality, e não pelos bytes retornados. Confirmamos isso: com o mesmo prompt em 1024², os três níveis produziram PNGs idênticos de 1024×1024 e aproximadamente o mesmo tamanho, cerca de 0.9 MB, mas cobraram 196, 1,756 e 7,024 tokens. Mesma resolução, mesmo tamanho em bytes, custo 36× maior. A cobrança reflete o esforço de renderização, não a quantidade de pixels. Por isso, é preciso consultar usage, e não estimar pelo resultado visual.

Nenhum desses modelos oferece prompt caching, normalmente a primeira opção considerada para reduzir custos. A geração de imagens é stateless: não há conversa nem estado de KV para reutilizar, o objeto usage não contém campos de cache e, como medimos abaixo, o processamento em lote também não compartilha o prompt. Cache é um recurso de chat, não de imagem. Portanto, uma das suposições mais comuns para reduzir o custo de imagens não se aplica.


Fizemos as medições

Usamos o mesmo prompt de produto, no estilo de e-commerce, em gerações reais pelo gateway. O custo foi calculado com base no usage retornado e nas tarifas publicadas por cada modelo. Fizemos cinco análises independentes.

1. O custo está na imagem, não no prompt. Em texto para imagem, com um prompt de entrada e uma imagem de saída, os output tokens representam de 97–100% da conta: uma geração 1024² com gpt-image-2 usa 21 input tokens e 196 output tokens, cerca de $0.0001 mais $0.0059, enquanto o gemini-2.5-flash-image usa 10 tokens de entrada. O prompt escrito tem impacto insignificante, mas somente porque é texto. Ao enviar uma imagem, como em uma edição imagem para imagem do tipo “deixe esta caneca azul”, a tokenização da entrada aumenta muito:

ModeloEntrada t2iEntrada i2i (1 ref.)Saída
gpt-image-2 (low)21 tok1,043 tok196 tok
gemini-2.5-flash-image10 tok1,297 tok1,290 tok

A entrada aumenta entre 50–130× e cresce linearmente: cada referência adicional acrescenta aproximadamente 1,025 tokens no gpt-image-2. Com 1, 2 e 3 referências, medimos 1,043, 2,068 e 3,093. Em baixa qualidade, esses input tokens superam em cinco vezes a saída gerada. A regra é a mesma nos dois casos: o custo está na imagem, seja ela gerada ou fornecida, e nunca no prompt. O restante deste artigo se limita a texto para imagem; a análise econômica completa de imagem para imagem ficará para outro artigo.

2. A escolha do modelo representa uma diferença de 6×. Mesma requisição 1024², com a qualidade padrão:

ModeloCobrançaCusto / imagem
gpt-image-2token · controle quality$0.0060
gpt-image-1-minitoken · controle quality$0.0085
seedream-4-0preço fixo por requisição$0.030
qwen-image-2.0preço fixo por requisição$0.035
gemini-2.5-flash-imagetoken · sem controle quality$0.0387

A diferença entre a opção mais barata e a mais cara é de 6.4×, determinada exclusivamente pela quantidade de output tokens emitidos por cada modelo.

3. A resolução quase não altera o custo. Ao variar o gpt-image-2 de 1024² a 2048², o custo por imagem permaneceu praticamente estável, de $0.0060 a $0.0121; a quantidade de output tokens não é proporcional ao número de pixels. O gemini-2.5-flash-image retornou os mesmos 1,290 tokens para todos os tamanhos solicitados, pois só oferece 1K e o size altera apenas a proporção da imagem. Os modelos de imagem gemini-3 respeitam o image_size, com o custo praticamente dobrando de 1K para 4K, mas isso não ocorre no 2.5-flash-image, que é o modelo analisado aqui. Por definição, a resolução não altera o preço dos modelos com valor fixo por imagem. Até aqui, o modelo por token parece difícil de superar.

4. A qualidade define o ponto de equilíbrio. Variamos os níveis de qualidade do gpt-image-2:

quality1024²2048²
low$0.0060 (196 tok)$0.0121 (397 tok)
medium$0.053 (1,756 tok)$0.107 (3,568 tok)
high$0.211 (7,024 tok)$0.428 (14,272 tok)

A quantidade de output tokens cresce cerca de 9× de low para medium e aproximadamente 36× de low para high. Em baixa qualidade, o modelo por token é a opção mais barata; em média ou alta, ele ultrapassa o preço fixo por imagem ($0.03–0.035). O ponto de equilíbrio fica onde a conta indica, em torno de 1,000 output tokens ($0.03 ÷ $30/M): low fica abaixo e medium, acima. Isso também corrige uma conclusão anterior nossa. A afirmação de que “por token é sempre mais barato” foi resultado de testes apenas com a baixa qualidade padrão.

O mesmo prompt renderizado pelo gpt-image-2 em qualidade baixa, média e alta: três fotos de produto igualmente nítidas em 1024², identificadas com 196 / 1,756 / 7,024 output tokens e $0.006 / $0.053 / $0.215.

Mesmo prompt, gpt-image-2, 1024². low / medium / high cobram 196 / 1,756 / 7,024 output tokens, ou $0.006 / $0.053 / $0.215: uma diferença de 36× na mesma resolução. Para uma foto simples de produto como esta, é difícil distinguir as três, então o nível mais barato costuma ser suficiente. Defina quality de acordo com o uso em vez de adotar high como padrão.

5. Não é possível compartilhar o prompt entre imagens. Gerar n imagens em uma chamada não dilui o custo do prompt. O gpt-image-2 cobra o prompt N vezes: os input tokens passaram de 28 para 112 com n=4, e um prompt longo de identidade de marca passou de 499 para 1,996. O custo por imagem foi idêntico com n=1 e n=4. Sem cache, também não existe nenhum mecanismo de compartilhamento do custo do prompt na geração de imagens. Cada imagem de saída é cobrada separadamente, e o prompt volta a ser cobrado todas as vezes.


Regra de decisão

Para texto para imagem, a decisão depende da qualidade, não dos fatores que normalmente recebem mais atenção:

  • Qualidade baixa / rascunho / miniatura: um modelo por token com controle de qualidade (gpt-image, cerca de $0.006–0.012). É a opção mais barata em qualquer resolução até aproximadamente 2K.
  • Qualidade média / alta: preço fixo por requisição (seedream / qwen, $0.03–0.035). O custo por token dispara, de $0.05–0.43 nos nossos testes, enquanto o preço fixo é mais barato e independe da qualidade.
  • gemini (cerca de $0.039 em 1K padrão) raramente tem o melhor custo. O gpt-image é mais barato em baixa qualidade, e os modelos com preço fixo por requisição vencem em média e alta. Como não há controle quality, a escolha da categoria Pro ou de um image_size maior deve ser feita pela qualidade de saída, não pelo preço.
  • A resolução altera o custo em cerca de 2× dentro do mesmo nível de qualidade, diferença insuficiente para mudar a escolha. A qualidade é o que muda o resultado.
  • n>1, cache e processamento em lote nunca reduzem o custo por imagem. Não há nada que possa ser compartilhado.
  • Imagem para imagem: comece pelos modelos com preço fixo por imagem. Uma imagem de referência faz parte da entrada, e apenas os modelos por token cobram um adicional, de aproximadamente 1,025 tokens por referência; nos modelos de preço fixo, ela está incluída sem custo extra. Para edição, seedream / qwen geralmente vencem. O gpt-image continua mais barato apenas para edições de baixa qualidade e com poucas referências, chegando ao preço fixo por volta de 5. Ele perde conforme aumentam a qualidade ou a quantidade de referências.

E-commerce é o exemplo mais claro. Imagine que você gere fotos de produtos enviando o mesmo prompt longo de identidade de marca para cada item do catálogo, supondo que o cache desse prompt repetido reduzirá o custo. Isso falha por dois motivos: o prompt nunca foi o principal custo, a imagem é, e não existe cache para geração. Como imagens reais de produtos exigem qualidade média ou superior, a melhor escolha é um modelo de preço fixo por imagem. Ele é mais barato e mais previsível, independentemente do quanto os prompts se repetem.

As limitações de recursos apresentadas no início ainda podem mudar a decisão: modelos limitados a uma imagem por chamada, resoluções mínimas e máximas, restrições de residência de dados e os controles expostos pelo modelo (seed, negative_prompt, guidance_scale). Escolha pelo custo e depois confirme se os recursos atendem ao caso de uso.


Por que estes números são confiáveis

Os valores vêm do usage real e das tarifas publicadas por cada fornecedor, não de estimativas. No nosso gateway, a cobrança de imagens não depende de sessão: ela só é concluída em respostas 2xx, e uma geração com falha nunca é cobrada. Antes de qualquer gasto, o sistema verifica o pior custo possível. Se a resposta não tiver usage, cobra o teto em vez de registrar silenciosamente $0. Aplicamos o mesmo princípio em todo o gateway: confie no custo calculado, não em um número fornecido pelo próprio fornecedor. Foi esse o método usado para verificar se um gateway informa dados falsos sobre cache.


Conclusão

Geração de imagens parece apenas mais um endpoint, mas a unidade de cobrança é diferente. Em texto para imagem, o principal fator não é o prompt, pois não há cache nem compartilhamento em lote, nem a resolução. É a qualidade: gpt-image é mais barato em low, enquanto modelos com preço fixo por imagem (seedream / qwen) vencem em medium e high. O ponto de equilíbrio fica próximo de 1,000 output tokens. Defina a qualidade de forma intencional, escolha o modelo adequado e confira o custo. Ao passar da geração para a edição com uma imagem de referência, refaça a conta, porque a imagem de entrada passa a representar o custo.


Perguntas frequentes

Prompt caching reduz o custo da geração de imagens? Não. A geração é stateless: o objeto usage não tem campos de cache, e o processamento em lote cobra novamente o prompt para cada imagem. O custo está na imagem de saída, não no texto.

O que é mais barato: cobrança por token ou por imagem? Depende da qualidade. Para qualidade baixa ou rascunho, use um modelo com controle quality, como o gpt-image, por cerca de $0.006–0.012. Para média ou alta, use um modelo com preço fixo por imagem, como seedream/qwen ($0.03–0.035), pois o custo por token dispara. Em imagem para imagem, o preço fixo leva ainda mais vantagem: as imagens de referência são incluídas sem custo extra, enquanto os modelos por token acrescentam aproximadamente 1,025 tokens por referência.


Fontes

Todos os dados foram verificados em 2026-06-19. Isto não é aconselhamento financeiro; confirme os preços atuais antes de tomar qualquer decisão com base neles.

← Voltar ao blog