🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
API Qwen-Image 3.0: 9 cenas em uma imagem por $0.03

API Qwen-Image 3.0: 9 cenas em uma imagem por $0.03

Conteúdo
  1. Como funciona a cobrança do Qwen-Image 3.0?
  2. A promessa de “nove imagens de uma vez” é real?
  3. A promessa de texto com 10 pixels resiste ao zoom?
  4. Para que serve a janela de prompt de 4.500 tokens?
  5. Qual é a posição dele entre os modelos de geração de imagens?
  6. Perguntas frequentes

O Qwen-Image 3.0 custa $0.03 por imagem gerada, abaixo dos $0.035 do antecessor, e o prompt não é cobrado: nos nossos testes, um prompt com cerca de 5.000 tokens custou exatamente o mesmo que outro com onze palavras. Só isso já o diferencia dos concorrentes que cobram por token e torna economicamente viável o recurso mais chamativo do modelo: peça nove cenas diferentes em uma grade 3x3 e você receberá todas elas, com a cobrança de uma única imagem. Testamos o qwen-image-3.0 no dia em que ele chegou a uma rota de API comercial. O lançamento veio sem tabela de preços, benchmarks, pesos ou relatório técnico. Por isso, analisamos o modelo de cobrança, a promessa de nove cenas em uma imagem, a alegação de texto com 10 pixels, incluindo a controvérsia sobre as letras miúdas em japonês, a janela de prompt de 4.500 tokens e a posição do modelo em relação ao próprio antecessor e às demais opções de geração de imagens.

TL;DR

  • O qwen-image-3.0 cobra $0.03 por imagem gerada, abaixo dos $0.035 do antecessor; prompts não foram cobrados em nenhum dos tamanhos testados.
  • A promessa de “nove imagens de uma vez” funciona como uma grade em uma única imagem: as 9 cenas foram geradas, com cobrança de uma imagem; o limite de lote da API é n=4.
  • Letras miúdas ditadas no prompt são o ponto fraco: a nota de rodapé saiu com erro nas 3 execuções em inglês; textos inventados pelo próprio modelo foram renderizados corretamente.
  • A geração é lenta: 58-85 segundos no uso normal, contra 10 segundos do qwen-image-2.0; prompts longos chegaram a 241 segundos.

Como funciona a cobrança do Qwen-Image 3.0?

A cobrança é por imagem e por faixa de resolução; o prompt não entra na conta. Cada resposta traz um bloco de uso com a quantidade de imagens e a faixa de resolução, sem campos de tokens. Uma solicitação em 1024x1024 ou com outra proporção equivalente é cobrada como uma imagem na faixa 1K. Uma solicitação em 2048x2048 entra na faixa 2K. O prompt não aparece na contabilização. Enviamos a mesma cena com um prompt de onze palavras e com textos de preenchimento estimados em 1.000, 4.200 e 5.000 tokens. A cobrança foi idêntica em todos os casos. A tabela de preços publicada pela DashScope após a semana de lançamento confirma exatamente esse modelo: $0.03 por imagem gerada em qualquer uma das faixas do qwen-image-3.0, $0.003 por imagem de entrada em fluxos de edição e limite entre as faixas fixado em 2.250.000 pixels de área de saída. Apenas a SKU pro diferencia os preços: $0.04 para saídas da classe 1K e $0.075 para 2K. O mais incomum é a direção do preço: o qwen-image-3.0 custa $0.03, menos que os $0.035 do qwen-image-2.0. É uma redução de preço acompanhada de mais recursos, em um lançamento para o qual todos esperavam um valor mais alto.

A diferença em relação às APIs de imagem cobradas por token é estrutural. O gpt-image-2 cobra os tokens do prompt e os tokens da imagem de saída. Nem mesmo a quantidade de tokens de saída é estável: o mesmo prompt de onze palavras gerou uma cobrança de 215 tokens em uma execução e 744 em outra, uma variação de 3,5 vezes no custo medido de solicitações idênticas. Na cobrança fixa por imagem, essa variação não existe; o custo previsto é o custo final. Essa mesma relação de troca apareceu no nosso estudo de custos com cinco modelos: cobrar por imagem é previsível, e previsibilidade é uma vantagem no orçamento.

A promessa de “nove imagens de uma vez” é real?

Sim, mas não da forma que a frase sugere, e a implementação real é melhor para o custo. O parâmetro de lote da API rejeita qualquer valor acima de quatro (n must be between 1 and 4), portanto não é possível obter nove arquivos separados em uma única chamada. As demonstrações do lançamento mostram, na verdade, uma composição: peça uma grade 3x3 com nove cenas diferentes dentro de uma única imagem e o modelo entrega. Nosso teste pediu um farol ao entardecer, uma partida de xadrez, uma tigela de ramen, um tsuru de papel, uma plataforma de metrô, um cacto na chuva, um violino, uma raposa-das-neves e um balão de ar quente:

Uma única imagem gerada com as nove cenas solicitadas em uma grade 3x3, todas distintas e detalhadas

As nove cenas saíram corretas e coerentes, com cobrança de uma imagem: $0.03 pela folha inteira, ou $0.0033 por célula aproveitável. As demonstrações da própria Alibaba exploram ainda mais o mesmo mecanismo, reunindo nove infográficos completos com textos e fórmulas em uma única grade. Para fluxos que precisam de miniaturas, painéis de referência ou folhas de opções, e não de nove arquivos independentes, há uma economia real: uma geração com preço fixo substitui nove, e separar as células exige apenas um recorte de uma linha.

A promessa de texto com 10 pixels resiste ao zoom?

Só pela metade, e a metade que falha é justamente a que iria para produção. A alegação cobre a renderização de texto com apenas 10 pixels. No layout, o modelo supera a expectativa: nosso teste de ficha técnica trouxe barras laterais inventadas, diagramas de portas, linhas com o conteúdo da embalagem e selos de segurança. Eram dezenas de rótulos pequenos, todos legíveis e escritos corretamente. O problema estava na única frase que fornecemos literalmente. Em três execuções, a nota de rodapé solicitada, “All measurements at 25 degrees Celsius”, apareceu como “Celkaus”, “Celuse” e “Celsue”: nenhum acerto, sempre no menor texto da página.

Ficha técnica gerada com layout detalhado e correto e uma tabela de recursos inventada; a nota de rodapé traz Celuse no lugar de Celsius

O comportamento em japonês é o mesmo, o que resolve uma controvérsia da semana de lançamento: testes independentes apontaram que as letras miúdas em japonês pareciam “um pouco estranhas” em comparação com as demonstrações oficiais, e nossas execuções reproduziram o problema. Em três tentativas com um rótulo em japonês e um aviso de armazenamento com duas linhas, uma saiu totalmente correta, outra deformou um caractere e a terceira trocou dois caracteres (読 virou 認, 保管 virou 保宜), embora o restante do rótulo minimalista estivesse impecável:

Rótulo de produto em japonês gerado com design limpo e dois caracteres trocados nas letras miúdas ditadas

O padrão é consistente e bastante específico: o texto criado pelo próprio modelo sai correto; os glifos falham quando o modelo precisa transcrever exatamente o texto ditado. Uma execução com prompt em chinês confirmou o outro lado desse comportamento ao inventar três rótulos para caixas (加急, 普通, 存档), todos em hanzi perfeito e sem que isso tivesse sido solicitado:

Cena gerada a partir de um prompt em chinês: um robô separando envelopes em três caixas que o próprio modelo rotulou corretamente em hanzi

O texto criado pelo modelo funcionou em todos os idiomas testados. Para mockups, storyboards e estudos de layout, a renderização de texto já serve para produção. Quando a correspondência exata da frase for indispensável, como em avisos de conformidade, valores técnicos ou textos jurídicos, revise cada glifo ou aplique o texto real depois, em uma composição separada.

Para que serve a janela de prompt de 4.500 tokens?

Ela oferece espaço sem custo adicional, mas aumenta o tempo de espera. A principal novidade desta versão é o volume de instruções: prompts 4,5 vezes maiores que na geração anterior. Nossa sequência de testes não encontrou uma barreira. Prompts de preenchimento estimados em 4.200 e até 5.000 tokens foram aceitos sem erro. Portanto, o limite documentado não foi aplicado na fronteira que conseguimos testar, e o tamanho adicional não alterou o preço da imagem. Prompts longos afetam a latência, embora de forma irregular: as gerações normais com prompts curtos levaram 58-85 segundos; duas execuções com 1.000 tokens demoraram 85 e 120 segundos; o teste com 4.200 tokens levou 241 segundos; e o de 5.000 tokens terminou em apenas 88 segundos. A tendência é de alta, mas a variação é grande. Ao usar toda a janela, planeje o tempo de execução, não um custo maior.

Qual é a posição dele entre os modelos de geração de imagens?

É o modelo mais lento do catálogo, com ampla diferença. Esse é o custo real do posicionamento “útil, não apenas bonito”. Estes foram os tempos medidos no mesmo dia e com o mesmo prompt em todo o catálogo:

ModeloSegundos por imagem (2 execuções)CobrançaPreço de tabela por imagem
qwen-image-2.09.8 / 10.2por imagem$0.035
qwen-image-2.0-pro13.4 / 14.2por imagem$0.075
wan2.7-image20.4 / 23.0por imagem-
seedream-5-030.8 / 34.1por imagem-
gpt-image-232.3 / 35.1por token$0.007-$0.023 medidos
qwen-image-3.058-85 normalmentepor imagem$0.03

Dois pontos ajudam a posicioná-lo. Primeiro, o antecessor ainda tem seu lugar: o qwen-image-2.0 gera em um sexto do tempo e continua sendo a melhor opção para grandes volumes de imagens simples. O 3.0 justifica a espera em trabalhos com layouts complexos, muito texto e instruções detalhadas que o 2.0 não consegue seguir. Segundo, a Alibaba agora mantém duas linhas de geração de imagens em paralelo: Qwen-Image e wan2.7-image, da família Tongyi Wanxiang. O modelo irmão é três vezes mais rápido. Quem já usa o ecossistema da Alibaba e prioriza estética em vez de documentos deve comparar também essa outra linha.

A capacidade ainda é limitada como em uma versão beta, e isso precisa entrar no plano de implantação: atingimos as cotas de taxa do upstream após cerca de doze gerações durante o estudo, e relatos sobre o plano gratuito descrevem os mesmos erros 429 em chamadas consecutivas. Há ainda uma ressalva sobre a verificação dos resultados: o lançamento veio sem benchmarks, pesos ou relatório técnico, e a tabela de preços só apareceu depois da semana de lançamento. Assim, não existem referências oficiais para conferir a maioria das alegações. Todos os resultados acima vieram das nossas próprias medições e testes. Os preços por imagem podem variar entre provedores; confira a primeira fatura em vez de confiar em estimativas de terceiros.

Perguntas frequentes

Quanto custa cada imagem no Qwen-Image 3.0?

$0.03 por imagem gerada em qualquer uma das faixas de resolução, segundo os preços publicados pela DashScope. Imagens de entrada, usadas em fluxos de edição, custam $0.003, e prompts de texto não são cobrados, independentemente do tamanho. O valor fica abaixo dos $0.035 do qwen-image-2.0. A SKU pro diferencia as faixas: $0.04 para saídas da classe 1K e $0.075 para 2K.

O Qwen-Image 3.0 realmente gera 9 imagens de uma vez?

Como uma única imagem, sim: um prompt para uma grade 3x3 produziu as nove cenas solicitadas de forma distinta, com cobrança de uma única imagem na faixa 1K. Como lote da API, não: n está limitado a 4, e cada imagem do lote é cobrada separadamente. A grade é a opção mais econômica para gerar uma folha de contatos, em vez de arquivos independentes.

O texto pequeno do Qwen-Image 3.0 pode ser usado em produção?

Quando o próprio modelo cria o texto, sim: rótulos e frases inventados por ele saíram corretamente em nossas execuções em inglês, chinês e japonês. Para frases ditadas, não: a nota de rodapé exata que especificamos apareceu com erro nas 3 execuções em inglês, e 2 das 3 execuções em japonês alteraram pelo menos um caractere. Revise as letras miúdas ditadas ou aplique o texto real em uma composição posterior.

Devo migrar do Qwen-Image 2.0?

Apenas para trabalhos que o 2.0 não consegue executar: layouts densos, páginas com estrutura de documento, instruções longas com várias partes e texto dentro da imagem. O 2.0 gera uma cena normal em cerca de 10 segundos, contra 58-85 segundos do 3.0, usando o mesmo modelo de cobrança por imagem. Fluxos orientados a throughput devem continuar no 2.0. Use o 3.0 como especialista em gerações com muitas instruções, não como substituto direto.

Medições realizadas entre 2026-08-05 e 2026-08-06 pelo gateway da Synthorai, no dia em que qwen-image-3.0 chegou a esta rota comercial; a faixa -pro ainda não estava disponível. Os testes cobriram o modelo de cobrança e as faixas de tamanho, o limite de lote e a composição em grade, uma sequência de aceitação de prompts longos (volumes de preenchimento estimados em 1.000 / 4.200 / 5.000 tokens pela contagem de palavras; a API de imagens não informa a quantidade de tokens do prompt), prompts em chinês e japonês, renderizações repetidas de texto pequeno e medições no mesmo dia, com o mesmo prompt, em seis modelos do catálogo. As imagens exibidas são saídas originais dos testes, sem edição. Os valores em dólares usam a tabela de preços da DashScope, publicada após a semana de lançamento e compatível com a estrutura de contabilização que medimos; a faixa de preço por imagem do gpt-image-2 foi calculada a partir das quantidades de tokens observadas e das tarifas verificadas no nosso estudo anterior sobre geração de imagens. O comportamento pode mudar à medida que a versão beta amadurece.

← Voltar ao blog