🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
API de Qwen-Image 3.0: 9 escenas en una imagen de $0.03

API de Qwen-Image 3.0: 9 escenas en una imagen de $0.03

Contenido
  1. ¿Cómo funciona realmente la facturación de Qwen-Image 3.0?
  2. ¿Son reales las «nueve imágenes a la vez»?
  3. ¿Se sostiene al ampliar la imagen la promesa del texto de 10 píxeles?
  4. ¿Qué aporta realmente la ventana de prompt de 4,500 tokens?
  5. ¿Dónde queda frente al resto de modelos de generación de imágenes?
  6. Preguntas frecuentes

Qwen-Image 3.0 cuesta $0.03 por imagen generada, menos que los $0.035 de su predecesor. El prompt es gratis: en nuestras pruebas, uno de unos 5,000 tokens costó exactamente lo mismo que otro de once palabras. Este dato lo separa de sus competidores con facturación por token y convierte su función más llamativa en una ventaja económica real: si pides nueve escenas distintas en una cuadrícula de 3x3, obtienes las nueve y solo pagas una imagen. Probamos qwen-image-3.0 el mismo día en que llegó a una ruta de API comercial. El lanzamiento no incluía tarifas, benchmarks, pesos ni informe técnico, así que analizamos el modelo de facturación, la promesa de nueve imágenes en una, la generación de texto de 10 píxeles —incluida la polémica sobre la letra pequeña en japonés—, la ventana de prompt de 4,500 tokens y su posición frente a su propio predecesor y el resto de modelos de generación de imágenes.

TL;DR

  • qwen-image-3.0 factura $0.03 por imagen generada, frente a los $0.035 de su predecesor; los prompts no se cobran, independientemente de la longitud que probamos.
  • La promesa de «nueve imágenes a la vez» se cumple como una cuadrícula dentro de una única imagen: generó las 9 escenas y cobró una sola imagen; el límite de batch de la API es n=4.
  • La letra pequeña dictada es su punto débil: la nota al pie salió mal escrita en las 3 pruebas en inglés; el texto inventado por el propio modelo se renderiza correctamente.
  • La generación es lenta: 58-85 segundos en condiciones normales, frente a los 10 de qwen-image-2.0; con prompts largos llegó a 241 segundos.

¿Cómo funciona realmente la facturación de Qwen-Image 3.0?

Se cobra por imagen y nivel de resolución; el prompt va incluido sin coste. Cada respuesta contiene un bloque de uso con el número de imágenes y el nivel, en lugar de campos de tokens. Una solicitud de 1024x1024 o con otra relación de aspecto se factura como una imagen del nivel 1K. Una de 2048x2048 se factura en el nivel 2K. El prompt no aparece en ningún punto del cálculo de uso. Enviamos la misma escena con un prompt de once palabras y con relleno estimado en 1,000, 4,200 y 5,000 tokens. La factura fue idéntica en todos los casos. Las tarifas que DashScope publicó después de la semana de lanzamiento confirman exactamente este modelo: $0.03 por imagen generada en ambos niveles para qwen-image-3.0, $0.003 por imagen de entrada en flujos de edición y un límite entre niveles fijado en 2,250,000 píxeles de superficie de salida. Solo el SKU pro aplica precios distintos según el nivel: $0.04 para salidas de clase 1K y $0.075 para 2K. Lo más llamativo es la dirección del precio: los $0.03 rebajan los $0.035 de qwen-image-2.0. Es una mejora de capacidades acompañada de una reducción de precio, cuando todo apuntaba a un lanzamiento más caro.

La diferencia frente a las API de generación de imágenes que cobran por token es estructural. gpt-image-2 factura tanto los tokens del prompt como los de la imagen de salida, y estos últimos ni siquiera son estables: el mismo prompt de once palabras consumió 215 tokens de salida en una ejecución y 744 en otra. Es una variación de 3.5x en el coste medido para solicitudes idénticas. Con una tarifa fija por imagen no hay esa variabilidad: pagas lo que habías previsto. Este mismo compromiso apareció en nuestro análisis de costes de cinco modelos: cobrar por imagen es aburrido, y para un presupuesto eso es una ventaja.

¿Son reales las «nueve imágenes a la vez»?

Sí, aunque no como sugiere la frase. La implementación real resulta mejor para la factura. El parámetro de batch de la API rechaza valores superiores a cuatro (n must be between 1 and 4), así que una llamada no puede devolver nueve archivos independientes. Las demos del lanzamiento muestran en realidad una composición: se pide una cuadrícula de 3x3 con nueve escenas distintas dentro de una sola imagen y el modelo la genera. Nuestra prueba solicitó un faro al anochecer, una partida de ajedrez, un bol de ramen, una grulla de papel, un andén de metro, un cactus bajo la lluvia, un violín, un zorro ártico y un globo aerostático:

Una única imagen generada con las nueve escenas solicitadas en una cuadrícula de 3x3, todas distintas y detalladas

Acertó las nueve escenas, cada celda era coherente y solo facturó una imagen: $0.03 por la lámina, o $0.0033 por celda utilizable. Las demos de Alibaba llevan el mismo mecanismo más lejos y colocan nueve infografías completas con texto y fórmulas en una cuadrícula. Si tu flujo necesita miniaturas, mood boards o láminas de opciones en vez de nueve archivos independientes, el ahorro es real: una generación con tarifa fija sustituye a nueve, y dividir la cuadrícula solo requiere una línea de código para recortarla.

¿Se sostiene al ampliar la imagen la promesa del texto de 10 píxeles?

Solo a medias, y falla justo en la parte que acabaría en producción. La promesa incluye renderizar texto de hasta 10 píxeles. En composición, el modelo incluso supera las expectativas: nuestra prueba con una ficha técnica generó barras laterales, diagramas de puertos, filas con el contenido del paquete e insignias de seguridad. Había decenas de etiquetas pequeñas, todas legibles y bien escritas. El fallo apareció en la única cadena que dictamos literalmente. En tres ejecuciones, la nota solicitada, “All measurements at 25 degrees Celsius”, terminó como “Celkaus”, “Celuse” y “Celsue”: ningún resultado correcto y todos los errores concentrados en el texto más pequeño de la página.

Ficha técnica generada con una composición detallada y correcta, y una tabla de funciones inventada; la nota dictada muestra Celuse en vez de Celsius

Con japonés ocurre lo mismo, lo que resuelve una polémica de la semana del lanzamiento: unas pruebas independientes señalaron que la letra pequeña en japonés se veía «algo poco natural» frente a las demos oficiales, y nuestras ejecuciones lo reproducen. En tres pruebas con etiquetas en japonés que incluían una advertencia de almacenamiento de dos líneas, una salió completamente correcta, otra deformó un carácter y otra sustituyó dos caracteres (読 pasó a ser 認 y 保管 pasó a ser 保宜), pese a que el resto de la etiqueta minimalista era impecable:

Etiqueta de producto generada en japonés, con un diseño limpio, pero con dos caracteres dictados sustituidos en la letra pequeña

El patrón es constante y muy específico: el texto que el modelo redacta por su cuenta sale limpio; los glifos fallan cuando debe transcribir texto dictado. Una ejecución con un prompt en chino mostró el caso contrario: el modelo inventó tres etiquetas para contenedores (加急, 普通, 存档) con hanzi perfectos, sin que se las pidiéramos:

Escena generada a partir de un prompt en chino: un robot clasifica sobres en tres contenedores que el propio modelo etiquetó con hanzi correctos

El texto creado por el propio modelo funcionó en todos los idiomas que probamos. Para mockups, storyboards y propuestas de composición, la generación de texto tiene calidad de producción. Si una cadena dictada debe ser exacta —un aviso normativo, un valor técnico o una línea legal—, revisa cada glifo o añade después el texto real mediante composición.

¿Qué aporta realmente la ventana de prompt de 4,500 tokens?

Espacio gratis, a cambio de más segundos. La principal novedad de esta versión es el volumen de instrucciones: admite prompts 4.5x más largos que la generación anterior. Nuestra prueba incremental no encontró un límite estricto. Los prompts de relleno estimados en 4,200 e incluso 5,000 tokens se aceptaron sin errores. Por tanto, el límite documentado no se aplica mediante un error en ningún umbral que pudiéramos detectar, y la facturación por imagen no añade coste por esa longitud. Los prompts largos sí penalizan la latencia, aunque de forma irregular. Las generaciones normales con prompts cortos tardaron entre 58 y 85 segundos. Dos ejecuciones de 1,000 tokens terminaron en 85 y 120 segundos; la prueba de 4,200 tokens tardó 241, y la de 5,000 solo 88. La tendencia es ascendente, pero la dispersión es amplia. Al aprovechar esta ventana, presupuesta tiempo de espera, no dinero.

¿Dónde queda frente al resto de modelos de generación de imágenes?

Es el más lento del catálogo con mucha diferencia, el precio real de su enfoque en «ser útil, no solo bonito». Estos son los tiempos obtenidos el mismo día y con el mismo prompt en todo el catálogo:

ModeloSegundos por imagen (2 ejecuciones)FacturaciónPrecio de lista por imagen
qwen-image-2.09.8 / 10.2por imagen$0.035
qwen-image-2.0-pro13.4 / 14.2por imagen$0.075
wan2.7-image20.4 / 23.0por imagen-
seedream-5-030.8 / 34.1por imagen-
gpt-image-232.3 / 35.1por token$0.007-$0.023 medidos
qwen-image-3.058-85 habitualespor imagen$0.03

Hay dos matices importantes sobre su posición. Primero, su predecesor no ha quedado obsoleto: qwen-image-2.0 genera en una sexta parte del tiempo y sigue ganando en throughput para activos sencillos y de gran volumen. Los segundos adicionales de 3.0 se justifican en trabajos con composiciones densas, mucho texto e instrucciones complejas que 2.0 no puede seguir. Segundo, Alibaba mantiene ahora dos familias de generación de imágenes en paralelo: Qwen-Image y wan2.7-image, de la familia Tongyi Wanxiang. Este último es tres veces más rápido. Si ya usas el ecosistema de Alibaba y buscas estética en lugar de documentos, conviene compararlos.

La capacidad sigue siendo propia de una beta y debe contemplarse en cualquier plan de despliegue: tras unas doce generaciones durante el estudio, empezamos a toparnos con las cuotas del proveedor upstream. Los informes sobre el nivel gratuito describen los mismos errores 429 al encadenar llamadas. Una aclaración metodológica sustituye aquí a la tabla de benchmarks habitual: el lanzamiento llegó sin benchmarks, pesos ni informe técnico, y las tarifas no se publicaron hasta después de la primera semana. La mayoría de las afirmaciones, por tanto, no tienen una referencia oficial con la que contrastarse. Todo lo anterior procede de nuestras mediciones y pruebas. Las tarifas por imagen de tu proveedor pueden variar; consúltalas en tu primera factura, no en estimaciones de terceros.

Preguntas frecuentes

¿Cuánto cuesta Qwen-Image 3.0 por imagen?

$0.03 por imagen generada en ambos niveles de resolución según las tarifas publicadas por DashScope. Las imágenes de entrada en flujos de edición cuestan $0.003 y los prompts de texto no se facturan, independientemente de su longitud. Es menos que los $0.035 de qwen-image-2.0. El SKU pro separa los precios por nivel: $0.04 para salidas de clase 1K y $0.075 para 2K.

¿Puede Qwen-Image 3.0 generar realmente 9 imágenes a la vez?

Como una sola imagen, sí: un prompt que pedía una cuadrícula de 3x3 devolvió las nueve escenas solicitadas, bien diferenciadas, y se facturó como una única imagen del nivel 1K. Como batch de API, no: n está limitado a 4 y cada imagen del batch se cobra por separado. La cuadrícula es la opción más económica cuando necesitas una lámina de contactos en lugar de archivos independientes.

¿Puede usarse en producción el texto pequeño de Qwen-Image 3.0?

Sí, cuando el modelo redacta el texto. Las etiquetas y textos inventados por el propio modelo salieron correctamente en nuestras pruebas en inglés, chino y japonés. No cuando se dictan cadenas exactas: la nota al pie que especificamos apareció mal escrita en las 3 ejecuciones en inglés, y 2 de las 3 ejecuciones en japonés alteraron al menos un carácter. Revisa la letra pequeña dictada o añádela después con tipografía real.

¿Debería actualizar desde Qwen-Image 2.0?

Solo para los trabajos que 2.0 no puede resolver: composiciones densas, páginas con aspecto de documento, instrucciones largas con varias partes y texto dentro de la imagen. Con el mismo modelo de facturación por imagen, 2.0 genera una escena estándar en unos 10 segundos, frente a los 58-85 de 3.0. Las cargas de trabajo donde prima el throughput deberían mantenerse en 2.0. Conviene tratar 3.0 como un especialista para generaciones con muchas instrucciones, no como un sustituto directo.

Mediciones realizadas entre 2026-08-05 y 2026-08-06 a través del gateway de Synthorai, el mismo día en que qwen-image-3.0 llegó a esta ruta comercial —el nivel -pro aún no estaba disponible—: pruebas del modelo de facturación y los niveles de tamaño, el límite de batch y la composición en cuadrícula, una secuencia de aceptación de prompts largos —longitudes de relleno estimadas en 1,000 / 4,200 / 5,000 tokens según el número de palabras; la API de imágenes no devuelve el número de tokens del prompt—, prompts en chino y japonés, varias ejecuciones de generación de texto pequeño y mediciones comparables, realizadas el mismo día y con el mismo prompt, en seis modelos del catálogo. Las imágenes generadas que se muestran son resultados sin editar de las pruebas. Las cifras en dólares proceden de las tarifas de DashScope, publicadas después de la semana de lanzamiento, y coinciden con la estructura de contabilización de uso que medimos. El intervalo de coste por imagen de gpt-image-2 se calculó a partir de sus tokens medidos y de las tarifas verificadas en nuestro estudio anterior sobre generación de imágenes. El comportamiento puede cambiar a medida que madure la beta.

← Volver al blog