🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
Quantos tokens tem uma imagem? 15 APIs, de 6 a 1.298

Quantos tokens tem uma imagem? 15 APIs, de 6 a 1.298

Conteúdo
  1. Como os fornecedores dizem que uma imagem é cobrada?
  2. Quantos tokens custa uma imagem?
  3. O que determina quantos tokens uma imagem custa?
  4. Quais são os três esquemas de cobrança?
  5. Onde ficam exatamente os limites de redução?
  6. A proporção, o conteúdo ou o formato do arquivo alteram a cobrança?
  7. O que realmente reduz os custos de entrada de imagens?
  8. Perguntas frequentes

A mesma imagem de 1024x1024 custa 693 tokens de entrada no GPT-5.6, 988 no Qwen 3.8 Max, 1.089 no Gemini e 1.372 no Claude. Aplicando a tarifa de entrada de cada provedor, uma imagem custa entre $0.00005 e $0.0137 nos 15 modelos com visão. Essa diferença vem quase toda da tarifa de entrada de cada modelo, não do tokenizer de imagem. Cinco fornecedores publicam regras de cobrança para imagens, mas nossas medições contradizem três delas. Este estudo complementa nossa análise de tokenizers de texto: enviamos os mesmos PNGs gerados localmente a todos os modelos com visão do catálogo e calculamos o custo da imagem subtraindo os tokens do prompt sem imagem dos tokens do prompt com imagem. Testamos seis tamanhos, cinco proporções, três tipos de conteúdo, três formatos de arquivo e conjuntos de uma a quatro imagens.

TL;DR

  • Uma imagem de 1024x1024: 693 tokens no GPT-5.6, 1.089 no Gemini e 1.372 no Claude; o custo varia de $0.00005 (qwen3-vl-flash) a $0.0137 (claude-fable-5).
  • Há três esquemas: fórmulas por patch (Qwen: (lado/32)²+2, exatamente), tiles com limite (GPT para em 693) e tarifa fixa (Gemini cobra 1.089 em qualquer tamanho, inclusive thumbnails).
  • Três regras documentadas não batem com as medições: os Claude de ponta reduzem a imagem a partir de ≈1.920px, não 1.568; o Gemini cobra 1.089 fixos onde a documentação diz 258; e a grade do Qwen usa 32px, não 28.
  • O formato do arquivo e o conteúdo não alteraram nem um token: a cobrança depende apenas da geometria.

Como os fornecedores dizem que uma imagem é cobrada?

Cinco das sete famílias publicam uma regra, e três dessas cinco não resistem às medições. A tabela abaixo resume o artigo. As seções seguintes apresentam os dados por trás de cada divergência ou comportamentos de custo que a documentação sequer menciona:

FamíliaO que diz a documentaçãoO que medimos
OpenAIpatches de 32px com um orçamento de patches por modelo (documentação)o comportamento confere: 6 tokens em 64px, com limite rígido de 693 tokens
Anthropic(w x h)/750, com redução quando o maior lado passa de 1.568px (documentação)fórmula exata entre 512 e 1.024px; o limite de 1.568 vale apenas no Haiku, enquanto os modelos de ponta continuam cobrando até ≈1.920px
Googleimagens de até 384px cobram 258 tokens; acima disso, 258 por tile de 768px (documentação)1.089 fixos em qualquer tamanho, inclusive para um ícone de 64px; nenhuma variação documentada de media_resolution funcionou na interface que medimos
Alibabaum token por 28x28px, com mínimo de 4 (documentação)uma grade de 32px reproduz exatamente os tokens no qwen3-vl ((lado/32)²+2), com piso de 66 e limite em 1.600px
Moonshottokens dinâmicos, sem fórmula publicada; aceita imagens de até 4K (documentação)consistente: crescimento quadrático, sem limite encontrado até 3.072px (11.674 tokens)
MiniMax / ByteDancenão encontramos uma fórmula públicacrescimento quadrático com limite em 2.048px; 1.298 fixos por imagem

A coluna da direita revela um padrão: todas as regras documentadas tratam de geometria, seja por patches, tiles ou divisores. Como a geometria pode ser medida, foi isso que fizemos. Quando as colunas divergem, o erro vai parar na sua planilha de orçamento. Um pipeline com Claude de ponta dimensionado para o limite documentado de 1.568px subestima em cerca de 45% o orçamento para imagens grandes. Já um pipeline com Gemini que espera 258 tokens por thumbnail paga 4,2x esse valor por ícone.

Quantos tokens custa uma imagem?

Em nossa matriz, o valor ficou entre 6 e 5.486, dependendo do modelo e do tamanho. A quantidade de tokens, porém, representa apenas metade da conta. Esta é a mesma imagem PNG de 1024x1024 em todos os modelos com visão do catálogo, já com a tarifa de entrada de cada modelo aplicada:

ModeloTokens (1024²)≈ palavras em inglês× o preço de entrada do modelo por 1K tokensTarifa de entrada /1MCusto por imagem
qwen3-vl-flash1.026≈7701.03x$0.05$0.00005
qwen3-vl-plus1.026≈7701.03x$0.20$0.0002
minimax-m31.371≈1.0301.37x$0.30$0.0004
Dola-Seed-2.0-pro1.298≈9701.30x$0.50$0.0006
gpt-5.6-luna693≈5200.69x$1.00$0.0007
gemini-3.7-flash1.089≈8201.09x$0.75$0.0008
claude-haiku-4-51.373≈1.0301.37x$1.00$0.0014
gemini-3.6-flash1.089≈8201.09x$1.50$0.0016
qwen3.8-max988≈7400.99x$2.00$0.0020
gemini-3.1-pro-preview1.089≈8201.09x$2.00$0.0022
claude-sonnet-51.372≈1.0301.37x$2.00 promocional$0.0027
kimi-k31.379≈1.0301.38x$3.00$0.0041
claude-opus-51.372≈1.0301.37x$5.00$0.0069
claude-fable-51.372≈1.0301.37x$10.00$0.0137

Há três conclusões. Primeiro, a comparação com texto é literal: considerando 0,75 palavra em inglês por token, uma imagem de 1024px ocupa no contexto o equivalente a um documento de 520 a 1.030 palavras. Por isso, conversas com muitas imagens esgotam a janela de contexto e o orçamento muito mais rápido que texto. Segundo, o custo em dólares depende quase todo da tarifa. As contagens ficam agrupadas em uma faixa inferior a 2x, de 693 a 1.379. Em qualquer modelo, uma imagem custa entre 0,69x e 1,38x o valor cobrado por 1.000 tokens de entrada. A coluna em dólares basicamente reproduz a tarifa de entrada de cada modelo. Terceiro, as famílias compartilham exatamente o mesmo tokenizer: as duas versões do qwen3-vl, as duas variantes do GPT-5.6, os três Geminis e os quatro modelos Claude retornaram contagens idênticas ou quase idênticas para todas as imagens quadradas. É o mesmo padrão de um tokenizer por família que medimos em texto.

O que determina quantos tokens uma imagem custa?

Cinco fatores alteram a cobrança; outros três, embora muita gente suponha o contrário, não fazem diferença. O restante do estudo aprofunda cada linha desta tabela:

FatorEfeitoOnde se aplica
Esquema de cobrançafórmula por patch vs tiles com limite vs tarifa fixatabela de esquemas abaixo
Resolução (área)principal fator, com crescimento aproximadamente quadráticotodos os modelos, exceto os dois de tarifa fixa
Limite de reduçãopixels além do limite nunca são cobrados1.600px (Qwen), ≈1.920px (Claude de ponta), 1.568px (Haiku), limite de 693 tokens (GPT); Kimi não tem limite
Proporçãoefeito secundário: grades delimitadoras encarecem faixas, enquanto limites do maior lado barateiam casos extremosGPT +84% em 3:1 e depois -11% em 8:1; Haiku -71% em 8:1
Quantidade de imagensestritamente aditivo, sem desconto por volumetodos os 15 modelos
Conteúdo (foto vs texto vs imagem vazia)sem efeitotodos os modelos medidos
Formato do arquivo (PNG/JPEG/WebP)sem efeitotodos os modelos medidos
Tamanho do arquivo em bytessem efeitotodos os modelos medidos

Vale esclarecer os três fatores sem efeito porque os dois mitos são comuns: nenhuma API desta matriz usa a taxa de compressão ou a complexidade visual da imagem para calcular a cobrança. Entra geometria, saem tokens.

Quais são os três esquemas de cobrança?

Fórmulas por patch, tiles com limite e tarifas fixas. Cada um cobra imagens pequenas de forma completamente diferente. Executamos uma sequência de seis tamanhos, com quadrados de 64px a 2.048px:

Modelo64px128px256px512px1.024px2.048pxEsquema
qwen3-vl (ambos)6666662581.0262.502patch: (lado/32)²+2, mínimo de 8x8, limite em 1.600px
qwen3.8-max2828282209882.464patch, piso menor
gpt-5.6 (ambos)62178309693693tiles, limite rígido de 693
gemini (todos os três)1.0891.0891.0891.0891.0891.089tarifa fixa, qualquer tamanho
Dola-Seed-2.0-pro1.2981.2981.2981.2981.2981.298tarifa fixa, qualquer tamanho
kimi-k317331083691.3795.486quadrático, sem limite encontrado
minimax-m318271023631.3715.186quadrático, com limite em 2.048px
claude (todos os quatro)12281033641.3724.764(w x h)/750, com limite de redução

Gráfico de linhas dos tokens de entrada por tamanho da imagem para oito famílias de modelos: Kimi e MiniMax sobem rapidamente e passam de 5.000 tokens em 2.048px, Claude chega a 4.764, as duas curvas do Qwen ficam perto de 2.500, GPT-5.6 se estabiliza em 693, enquanto Gemini e ByteDance Seed permanecem em linhas horizontais de 1.089 e 1.298, cobrando o mesmo por qualquer tamanho

A fórmula do Qwen é precisa o suficiente para entrar direto no orçamento: um quadrado de 1.024px cobra (1024/32)² + 2 = 1.026, confirmado token por token. Há um mínimo preenchido de 8x8 patches (66) e um limite de redução em 1.600px. Todos os tamanhos entre 1.600 e 1.920px cobraram exatamente 2.502. O GPT usa tiles até chegar a 693 e nunca passa disso: imagens de 1.024px e 2.048px custam o mesmo. A dupla de tarifa fixa é uma armadilha para tráfego de thumbnails. O Gemini cobra 1.089 tokens tanto por um ícone de 64px quanto por um screenshot 4K depois da redução; o Seed cobra 1.298. No outro extremo, o Kimi K3 continuou crescendo além do limite de todos os demais: um quadrado de 3.072px cobrou 11.674 tokens. Foi o único modelo da matriz em que não observamos redução.

Onde ficam exatamente os limites de redução?

Todas as famílias, exceto Kimi, redimensionam imagens grandes antes da cobrança. Os limites ficam onde as medições mostram, não onde diz a documentação. O limite do Claude merece atenção porque afeta diretamente o custo no claude-sonnet-5 e superiores: 1.568px cobra 3.139 tokens, 1.728px cobra 3.847, 1.920px cobra 4.764 e para por aí. Imagens de 2.048px e 2.304px também cobram 4.764. Os três modelos de ponta continuam cobrando pixels reais cerca de 45% além do limite documentado; o claude-haiku-4-5 é o único que se comporta conforme a documentação. Se você controla o pipeline de upload, redimensione para o limite medido de cada modelo antes de codificar. Pixels além desse ponto custam mais no Kimi ou são descartados silenciosamente nos demais. Imagens maiores que o necessário só consomem banda.

A proporção, o conteúdo ou o formato do arquivo alteram a cobrança?

Dois fatores explicam todos os efeitos de proporção que medimos, e nenhum deles é o tamanho do arquivo: se o modelo conta área ou uma grade delimitadora e onde fica o limite de redução do maior lado. Já o conteúdo e o formato não alteraram nada. Em todos os modelos, uma imagem de 512px com cor sólida, ruído ou texto cobrou o mesmo. O resultado também foi idêntico para a mesma imagem com 243KB (PNG), 176KB (JPEG) e 174KB (WebP).

O teste mantém a área constante em um megapixel e alonga a imagem:

Modelo1:12:13:14:18:1 (maior lado com 2.896px)
gpt-5.6 (ambos)6931.2711.2781.230616
trio Claude de ponta1.3721.3551.4111.4091.107
claude-haiku-4-51.3731.3561.068788396
minimax-m31.3711.3521.4101.298650
kimi-k31.3791.3611.4171.4151.361
qwen3-vl (ambos)1.0261.0379921.026992
gemini (todos os três)1.0891.0811.0831.0561.034
Dola-Seed-2.0-pro1.2981.2771.3041.2981.315

As linhas refletem esses dois fatores. Qwen, Kimi, Gemini e Seed permanecem estáveis: consideram apenas a área ou cobram uma tarifa fixa, sem componente de proporção. O GPT é o único que cobra por grade delimitadora. Faixas chegam a custar 84% mais que uma imagem quadrada com a mesma quantidade de pixels. Em 8:1, porém, a imagem ultrapassa o limite do maior lado e a redução elimina o acréscimo: 616 tokens, menos que a imagem quadrada. A família com limite de redução apresenta o mesmo ponto de virada no limite próprio de cada modelo. O Haiku começa a ficar mais barato em 3:1, quando o maior lado chega a 1.774 e ultrapassa seu limite de 1.568: cobra 1.068, depois 788 e 396. Os Claude de ponta só reduzem o custo em 8:1, quando 2.896 ultrapassa seu limite aproximado de 1.920px: cobram 1.107. O MiniMax também muda em 8:1, além de seu limite de 2.048: cobra 650. Para tráfego com documentos largos e screenshots, divida ou reduza as faixas antes de enviá-las ao GPT. No Haiku, formatos extremos acabam sendo os pixels mais baratos oferecidos pelo Claude.

O que realmente reduz os custos de entrada de imagens?

Há três medidas, em ordem de impacto. Primeiro, redimensione para o limite do modelo. Cada pixel além do limite é cobrado no Kimi, que não tem limite, e desperdiçado nos demais. Segundo, use detail: "low" no GPT. Em 512px, isso não muda nada: todos os modos cobram 309. Já em 2.048px, low fixa a imagem em 309 tokens, contra 693 em high ou auto, uma redução de 55%. Foi o único controle por request para custo de imagem que encontramos em qualquer modelo. Terceiro, escolha o esquema adequado à carga de trabalho. Modelos de tarifa fixa, como Gemini e Seed, são uma escolha ruim para thumbnails e ícones, mas fazem sentido para lotes de scans sempre grandes. Modelos por patch ou tile cobram imagens pequenas de forma proporcional: um ícone de 64px usa 6 tokens no GPT e 17 no Kimi.

Requests com várias imagens não recebem desconto em nenhum modelo. Ao empilhar 1, 2 e 4 cópias na mesma mensagem, os 15 modelos cobraram de forma estritamente aditiva, pelo preço integral de cada imagem. Essa conta penaliza mais os esquemas de tarifa fixa: quatro thumbnails de 256px em um request do Gemini custam 4.356 tokens de imagem; as mesmas quatro no qwen3-vl-flash custam 264.

Perguntas frequentes

Quantos tokens tem uma imagem de 1024x1024?

Usando o mesmo PNG: 693 no GPT-5.6, 988 no Qwen 3.8 Max, 1.026 no qwen3-vl, 1.089 no Gemini, 1.298 no ByteDance Seed, 1.371 no MiniMax, 1.372 no Claude e 1.379 no Kimi K3. A variação de 2x nos tokens importa menos que a tarifa aplicada: o custo em dólares vai de $0.00005 (qwen3-vl-flash) a $0.0137 (claude-fable-5).

O formato ou a compressão da imagem afetam o custo em tokens?

Não, em nenhum modelo medido. A mesma imagem de 512px em PNG (243KB), JPEG (176KB) e WebP (174KB) cobrou a mesma quantidade de tokens. Imagens com cor sólida, ruído e muito texto também cobraram o mesmo. A cobrança depende apenas das dimensões em pixels; comprima para economizar banda, não tokens.

detail: "low" reduz os tokens da imagem?

No GPT-5.6, sim, mas apenas acima do limite para imagens pequenas. Uma imagem de 2.048px cobrou 309 tokens em low, contra 693 em high ou auto, uma redução de 55%. Em 512px, as três configurações cobraram 309. Nenhum outro modelo da matriz ofereceu um controle funcional por request para o custo de imagem.

Fica mais barato enviar várias imagens no mesmo request?

Não. Em todos os modelos, 1, 2 e 4 cópias da mesma imagem foram cobradas de forma estritamente aditiva, cada uma pelo preço integral. O agrupamento reduz overhead de requests e latência, não tokens de imagem. Em modelos de tarifa fixa, como Gemini e Seed, enviar muitas imagens pequenas no mesmo request é o cenário mais caro.

Medido em 2026-08-13/14 pelo gateway da Synthorai em 17 modelos, sendo 15 com visão e 2 controles somente de texto: PNGs gerados localmente com dimensões exatas; custo da imagem calculado pelos tokens do prompt com imagem menos uma baseline com o mesmo texto e um salt; sequência de seis tamanhos (64-2.048px); testes de limite até 3.072px; seis proporções de 1MP (de 1:1 a 8:1, mais uma imagem vertical de 1:4); três tipos de conteúdo; PNG/JPEG/WebP; detail low/high/auto no GPT; conjuntos de 1/2/4 imagens; e uma verificação visual com palavra-código em todos os modelos. Os valores em dólares multiplicam os tokens medidos pela tarifa de entrada publicada na página de cada modelo na data da medição (Sonnet 5 com sua tarifa promocional de $2). As regras de cobrança para visão mudam sem aviso; repita a sequência de tamanhos antes de depender de qualquer valor isolado.

← Voltar ao blog