¿Cuántos tokens cuesta una imagen? 15 APIs: de 6 a 1,298
Contenido
- ¿Cómo dicen los proveedores que se factura una imagen?
- ¿Cuántos tokens cuesta una imagen?
- ¿Qué determina el coste en tokens de una imagen?
- ¿Cuáles son los tres esquemas de facturación?
- ¿Dónde están exactamente los límites de reducción?
- ¿La forma, el contenido o el formato cambian la factura?
- ¿Qué medidas reducen de verdad el coste de entrada de imágenes?
- Preguntas frecuentes
Una misma imagen de 1024x1024 cuesta 693 tokens de entrada en GPT-5.6, 988 en Qwen 3.8 Max, 1,089 en Gemini y 1,372 en Claude. Al aplicar la tarifa de entrada de cada proveedor, el coste por imagen varía entre $0.00005 y $0.0137 en 15 modelos con visión. La diferencia se debe casi por completo a la tarifa de entrada de cada modelo, no a su tokenizador de imágenes. Cinco proveedores publican una regla para facturar imágenes; nuestras mediciones contradicen tres de ellas. Este artículo complementa nuestro estudio sobre tokenizadores de texto. Enviamos los mismos PNG generados localmente a todos los modelos con visión del catálogo y calculamos el coste de la imagen restando a los tokens del prompt con imagen los tokens del mismo prompt sin ella. Probamos seis tamaños, cinco relaciones de aspecto, tres tipos de contenido, tres formatos de archivo y grupos de entre una y cuatro imágenes.
TL;DR
- Una imagen de 1024x1024: 693 tokens en GPT-5.6, 1,089 en Gemini y 1,372 en Claude; el coste va de $0.00005 (qwen3-vl-flash) a $0.0137 (claude-fable-5).
- Hay tres esquemas: fórmulas por patches (Qwen: (lado/32)²+2 exactos), tiles con un límite (GPT se detiene en 693) y tarifa fija (Gemini cobra 1,089 para cualquier tamaño, incluidas las miniaturas).
- Tres reglas documentadas no coinciden con las mediciones: los modelos principales de Claude reducen la imagen a partir de ≈1,920px, no de 1,568; Gemini cobra 1,089 fijos donde la documentación indica 258; la cuadrícula de Qwen es de 32px, no de 28.
- Ni el formato del archivo ni el contenido cambiaron un solo token: la facturación depende únicamente de la geometría.
¿Cómo dicen los proveedores que se factura una imagen?
Cinco de las siete familias publican una regla, y tres de esas cinco no resisten una comprobación empírica. Esta tabla resume todo el artículo. Las secciones siguientes aportan las mediciones que demuestran cada discrepancia o analizan comportamientos de coste que la documentación ni siquiera menciona:
| Familia | Lo que dice la documentación | Lo que medimos |
|---|---|---|
| OpenAI | patches de 32px con un presupuesto de patches por modelo (documentación) | el patrón coincide: 6 tokens a 64px y un límite rígido de 693 tokens |
| Anthropic | (w x h)/750; reduce la imagen cuando el lado largo supera 1,568px (documentación) | la fórmula es exacta entre 512 y 1,024px; el límite de 1,568 solo se cumple en Haiku; los modelos principales siguen facturando hasta ≈1,920px |
| las imágenes de hasta 384px cuestan 258 tokens; las mayores, 258 por cada tile de 768px (documentación) | 1,089 fijos para cualquier tamaño, incluso para un icono de 64px; ninguna variante del parámetro documentado media_resolution funcionó en la interfaz que medimos | |
| Alibaba | un token por cada 28x28px, con un mínimo de 4 (documentación) | en qwen3-vl encaja exactamente una cuadrícula de 32px ((lado/32)²+2), con un mínimo de 66 y un límite de 1,600px |
| Moonshot | tokens dinámicos, sin fórmula publicada; admite imágenes de hasta 4K (documentación) | comportamiento consistente: crecimiento cuadrático, sin límite detectado hasta 3,072px (11,674 tokens) |
| MiniMax / ByteDance | no encontramos ninguna fórmula pública | crecimiento cuadrático con un límite de 2,048px; 1,298 fijos por imagen |
El patrón de la columna derecha tiene nombre: las reglas documentadas dependen de la geometría, ya sea mediante patches, tiles o divisores. La geometría se puede medir, así que eso hicimos. Cuando ambas columnas no coinciden, el error acaba en la hoja de cálculo del presupuesto. Un pipeline para los modelos principales de Claude dimensionado según el límite documentado de 1,568px infravalora el coste de las imágenes grandes en torno a un 45%. Un pipeline de Gemini que espere pagar 258 tokens por miniatura termina pagando 4.2x en cada icono.
¿Cuántos tokens cuesta una imagen?
En nuestra matriz, entre 6 y 5,486 según el modelo y el tamaño. Además, el número de tokens solo representa la mitad de la factura. Esta es la misma imagen PNG de 1024x1024 en todos los modelos con visión del catálogo, aplicando la tarifa de entrada de cada uno:
| Modelo | Tokens (1024²) | ≈ palabras de texto en inglés | × precio de entrada del modelo por 1K tokens | Tarifa de entrada /1M | Coste por imagen |
|---|---|---|---|---|---|
| qwen3-vl-flash | 1,026 | ≈770 | 1.03x | $0.05 | $0.00005 |
| qwen3-vl-plus | 1,026 | ≈770 | 1.03x | $0.20 | $0.0002 |
| minimax-m3 | 1,371 | ≈1,030 | 1.37x | $0.30 | $0.0004 |
| Dola-Seed-2.0-pro | 1,298 | ≈970 | 1.30x | $0.50 | $0.0006 |
| gpt-5.6-luna | 693 | ≈520 | 0.69x | $1.00 | $0.0007 |
| gemini-3.7-flash | 1,089 | ≈820 | 1.09x | $0.75 | $0.0008 |
| claude-haiku-4-5 | 1,373 | ≈1,030 | 1.37x | $1.00 | $0.0014 |
| gemini-3.6-flash | 1,089 | ≈820 | 1.09x | $1.50 | $0.0016 |
| qwen3.8-max | 988 | ≈740 | 0.99x | $2.00 | $0.0020 |
| gemini-3.1-pro-preview | 1,089 | ≈820 | 1.09x | $2.00 | $0.0022 |
| claude-sonnet-5 | 1,372 | ≈1,030 | 1.37x | $2.00 promocional | $0.0027 |
| kimi-k3 | 1,379 | ≈1,030 | 1.38x | $3.00 | $0.0041 |
| claude-opus-5 | 1,372 | ≈1,030 | 1.37x | $5.00 | $0.0069 |
| claude-fable-5 | 1,372 | ≈1,030 | 1.37x | $10.00 | $0.0137 |
La tabla permite extraer tres conclusiones. La primera es que la comparación con documentos de texto es literal: usando 0.75 palabras en inglés por token, una imagen de 1024px consume tanto contexto como un documento de entre 520 y 1,030 palabras. Por eso las conversaciones con muchas imágenes agotan el contexto y el presupuesto mucho más rápido que las de texto. La segunda es que el coste en dólares depende casi por completo de la tarifa. Los recuentos de tokens se concentran en un margen inferior a 2x, de 693 a 1,379. En cualquier modelo, una imagen cuesta entre 0.69x y 1.38x de lo que cobre por 1,000 tokens de entrada. La columna de coste refleja, sobre todo, la tarifa de entrada de cada modelo. La tercera es que las familias comparten exactamente el tokenizador: las dos versiones de qwen3-vl, las dos variantes de GPT-5.6, los tres modelos Gemini y los cuatro modelos Claude devolvieron recuentos idénticos o casi idénticos para todas las imágenes cuadradas. Es el mismo patrón de un tokenizador por familia que medimos con texto.
¿Qué determina el coste en tokens de una imagen?
Cinco factores modifican la factura; otros tres, aunque se suele dar por hecho lo contrario, no influyen. El resto del estudio analiza en detalle cada fila de esta tabla:
| Factor | Efecto | Dónde se aplica |
|---|---|---|
| Esquema de facturación | fórmula por patches, tiles con límite o tarifa fija | tabla de esquemas siguiente |
| Resolución (área) | principal factor, con crecimiento aproximadamente cuadrático | todos los modelos salvo los dos de tarifa fija |
| Límite de reducción | los píxeles que superan el límite nunca se facturan | 1,600px (Qwen), ≈1,920px (modelos principales de Claude), 1,568px (Haiku), límite de 693 tokens (GPT); Kimi no tiene límite |
| Relación de aspecto | efecto secundario: las cuadrículas envolventes encarecen las franjas y los límites del lado largo abaratan las formas extremas | GPT +84% en 3:1 y después -11% en 8:1; Haiku -71% en 8:1 |
| Número de imágenes | suma estrictamente lineal, sin descuento por volumen | los 15 modelos |
| Contenido (foto, texto o imagen vacía) | sin efecto | todos los modelos medidos |
| Formato del archivo (PNG/JPEG/WebP) | sin efecto | todos los modelos medidos |
| Tamaño del archivo en bytes | sin efecto | todos los modelos medidos |
Conviene dejar claros los tres factores que no influyen porque circulan ambos mitos: ninguna API de esta matriz incorpora a la factura ni la relación de compresión ni la complejidad de la imagen. Entra geometría, salen tokens.
¿Cuáles son los tres esquemas de facturación?
Fórmulas por patches, tiles con límite y tarifas fijas. Cada esquema trata las imágenes pequeñas de forma muy distinta. Probamos seis tamaños de imágenes cuadradas, desde 64px hasta 2,048px:
| Modelo | 64px | 128px | 256px | 512px | 1,024px | 2,048px | Esquema |
|---|---|---|---|---|---|---|---|
| qwen3-vl (ambos) | 66 | 66 | 66 | 258 | 1,026 | 2,502 | patches: (lado/32)²+2, mínimo 8x8, límite de 1,600px |
| qwen3.8-max | 28 | 28 | 28 | 220 | 988 | 2,464 | patches, mínimo inferior |
| gpt-5.6 (ambos) | 6 | 21 | 78 | 309 | 693 | 693 | tiles, límite rígido de 693 |
| gemini (los tres) | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | tarifa fija para cualquier tamaño |
| Dola-Seed-2.0-pro | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | tarifa fija para cualquier tamaño |
| kimi-k3 | 17 | 33 | 108 | 369 | 1,379 | 5,486 | cuadrático, sin límite detectado |
| minimax-m3 | 18 | 27 | 102 | 363 | 1,371 | 5,186 | cuadrático, límite en 2,048px |
| claude (los cuatro) | 12 | 28 | 103 | 364 | 1,372 | 4,764 | (w x h)/750, con límite de reducción |

La fórmula de Qwen es lo bastante exacta para presupuestar con ella: una imagen cuadrada de 1,024px cuesta (1024/32)² + 2 = 1,026 tokens, comprobados uno por uno. Aplica un mínimo rellenado de 8x8 patches (66) y un límite de reducción de 1,600px: todas las imágenes entre 1,600 y 1,920px dieron exactamente 2,502 tokens. GPT divide en tiles hasta llegar a 693 y nunca supera esa cifra: una imagen de 1,024px y otra de 2,048px cuestan lo mismo. Los dos modelos de tarifa fija son una trampa para cargas de miniaturas. Gemini cobra 1,089 tokens por un icono de 64px, lo mismo que por una captura 4K después de reducirla; Seed cobra 1,298. En el otro extremo, Kimi K3 siguió creciendo más allá de los límites de todos los demás: una imagen cuadrada de 3,072px costó 11,674 tokens. Fue el único modelo de la matriz en el que nunca observamos una reducción.
¿Dónde están exactamente los límites de reducción?
Todas las familias salvo Kimi redimensionan las imágenes grandes antes de facturarlas. Los límites reales son los que muestra el contador, no los de la documentación. Merece la pena detallar el caso de Claude porque afecta directamente al coste de claude-sonnet-5 y de los modelos superiores: 1,568px cuesta 3,139 tokens; 1,728px, 3,847; 1,920px, 4,764. Ahí se detiene: las imágenes de 2,048px y 2,304px también cuestan 4,764. El trío de modelos principales sigue facturando píxeles reales hasta aproximadamente un 45% más allá del límite documentado. claude-haiku-4-5 es el único modelo que se comporta como indica la documentación. Si controlas el pipeline de subida, redimensiona las imágenes al límite medido de cada modelo antes de codificarlas. Los píxeles que lo superan o bien se facturan aparte, como en Kimi, o bien se descartan sin avisar, como en el resto. Enviar imágenes sobredimensionadas solo consume ancho de banda.
¿La forma, el contenido o el formato cambian la factura?
Dos factores explican todos los efectos relacionados con la forma que medimos, y ninguno es el tamaño del archivo: si el modelo contabiliza el área o una cuadrícula envolvente, y dónde fija el límite de reducción del lado largo. El contenido y el formato no cambiaron nada en ningún modelo. Una imagen de 512px de color uniforme, otra con ruido y una página de texto costaron exactamente lo mismo en todos los modelos. También ocurrió con la misma imagen en archivos de 243KB (PNG), 176KB (JPEG) y 174KB (WebP).
La prueba mantiene el área constante en un megapíxel y va alargando la forma:
| Modelo | 1:1 | 2:1 | 3:1 | 4:1 | 8:1 (lado largo de 2,896px) |
|---|---|---|---|---|---|
| gpt-5.6 (ambos) | 693 | 1,271 | 1,278 | 1,230 | 616 |
| trío principal de claude | 1,372 | 1,355 | 1,411 | 1,409 | 1,107 |
| claude-haiku-4-5 | 1,373 | 1,356 | 1,068 | 788 | 396 |
| minimax-m3 | 1,371 | 1,352 | 1,410 | 1,298 | 650 |
| kimi-k3 | 1,379 | 1,361 | 1,417 | 1,415 | 1,361 |
| qwen3-vl (ambos) | 1,026 | 1,037 | 992 | 1,026 | 992 |
| gemini (los tres) | 1,089 | 1,081 | 1,083 | 1,056 | 1,034 |
| Dola-Seed-2.0-pro | 1,298 | 1,277 | 1,304 | 1,298 | 1,315 |
Las filas se entienden a partir de esos dos factores. Qwen, Kimi, Gemini y Seed se mantienen planos: usan el área pura o una tarifa fija, sin un componente asociado a la forma. GPT es el único que factura mediante una cuadrícula envolvente. Cobra hasta un 84% más por las franjas que por una imagen cuadrada con el mismo número de píxeles. Al llegar a 8:1, la imagen supera el límite del lado largo y la reducción elimina ese sobrecoste: 616 tokens, menos que la imagen cuadrada. La familia basada en umbrales de reducción muestra el mismo punto de inflexión en el límite propio de cada modelo. Haiku empieza a abaratar en 3:1, cuando el lado largo de 1,774 supera su límite de 1,568: pasa a 1,068, después a 788 y finalmente a 396. Los modelos principales de Claude no lo hacen hasta 8:1, cuando 2,896 supera su límite aproximado de 1,920px: 1,107. MiniMax también cambia en 8:1, al superar su límite de 2,048: 650. Para tráfico de documentos panorámicos y capturas de pantalla, la conclusión es sencilla: en GPT, divide las franjas o redúcelas tú mismo; en Haiku, las formas extremas resultan ser los píxeles más baratos de Claude.
¿Qué medidas reducen de verdad el coste de entrada de imágenes?
Hay tres, por orden de impacto. Primero, redimensionar al límite del modelo: todos los píxeles que superan el umbral se facturan en Kimi, que no tiene límite, y se desperdician en los demás. Segundo, usar detail: "low" en GPT: a 512px no cambia nada, pues los tres modos cuestan 309, pero a 2,048px fija el coste en 309 tokens frente a los 693 de high o auto, una reducción del 55%. Es el único ajuste por petición para imágenes que encontramos en todos los modelos. Tercero, elegir el esquema según la carga de trabajo: los modelos de tarifa fija, Gemini y Seed, son una mala opción para miniaturas e iconos, pero encajan bien si se procesan escaneos siempre grandes. Los modelos por patches y tiles cobran de forma proporcional por las imágenes pequeñas: un icono de 64px cuesta 6 tokens en GPT y 17 en Kimi.
Las peticiones con varias imágenes no tienen descuentos: al agrupar 1, 2 y 4 copias en un mismo mensaje, los 15 modelos sumaron estrictamente el coste de cada imagen completa. Esta aritmética penaliza especialmente los esquemas de tarifa fija: cuatro miniaturas de 256px en una petición a Gemini cuestan 4,356 tokens de imagen; las mismas cuatro en qwen3-vl-flash cuestan 264.
Preguntas frecuentes
¿Cuántos tokens cuesta una imagen de 1024x1024?
Usando el mismo PNG: 693 en GPT-5.6, 988 en Qwen 3.8 Max, 1,026 en qwen3-vl, 1,089 en Gemini, 1,298 en ByteDance Seed, 1,371 en MiniMax, 1,372 en Claude y 1,379 en Kimi K3. La diferencia de 2x entre recuentos de tokens importa menos que la tarifa aplicada: el coste en dólares va de $0.00005 (qwen3-vl-flash) a $0.0137 (claude-fable-5).
¿El formato o la compresión de la imagen afectan al coste en tokens?
No, en ninguno de los modelos medidos. La misma imagen de 512px en PNG (243KB), JPEG (176KB) y WebP (174KB) costó exactamente los mismos tokens. Tampoco hubo diferencias entre contenido de color uniforme, ruido y texto denso. La facturación depende únicamente de las dimensiones en píxeles. Comprime para ahorrar ancho de banda, no tokens.
¿detail: "low" reduce los tokens de una imagen?
Sí en GPT-5.6, pero solo por encima del umbral de imagen pequeña: una imagen de 2,048px costó 309 tokens con low, frente a 693 con high o auto, un 55% menos. A 512px, los tres ajustes costaron 309. Ningún otro modelo de la matriz ofrecía un parámetro funcional por petición para controlar el coste de las imágenes.
¿Las imágenes salen más baratas si agrupo varias en una petición?
No. En todos los modelos, 1, 2 y 4 copias de la misma imagen se sumaron de forma estrictamente lineal, con cada imagen a precio completo. Agruparlas reduce el overhead y la latencia de las peticiones, pero no los tokens de imagen. En modelos de tarifa fija como Gemini y Seed, incluir muchas imágenes pequeñas en una petición es la opción más cara.
Mediciones realizadas el 2026-08-13/14 mediante el gateway de Synthorai en 17 modelos (15 con visión y 2 controles de solo texto): PNG generados localmente con dimensiones exactas; coste de la imagen calculado como los tokens del prompt con imagen menos una referencia con el mismo texto y un salt; seis tamaños entre 64 y 2,048px; pruebas de límites hasta 3,072px; seis formas de 1MP, desde 1:1 hasta 8:1 más una vertical de 1:4; tres tipos de contenido; PNG/JPEG/WebP; detail low/high/auto en GPT; grupos de 1/2/4 imágenes; y una comprobación visual con una palabra en código en todos los modelos. Las cifras en dólares se obtuvieron multiplicando los tokens medidos por la tarifa de entrada publicada en la página de cada modelo en la fecha de la medición (Sonnet 5 con su tarifa promocional de $2). Las reglas de facturación de visión pueden cambiar sin previo aviso. Repite la batería de tamaños antes de basar una decisión en una celda concreta.