Facturación de API de IA: 17 unidades, de tokens a PTU-horas
Contenido
- ¿Qué unidades utilizan las API de IA para facturar?
- ¿Qué unidades miden lo que consumes?
- ¿Qué unidades cobran por reservar tiempo o capacidad?
- ¿Qué cambia la tarifa sin cambiar la unidad?
- ¿Qué son los créditos y las CCU?
- ¿Qué reglas de redondeo y mínimos dan problemas?
- ¿Cómo se comparan los costes entre unidades?
- Cómo normaliza un gateway todas estas unidades
- Preguntas frecuentes
Las API de IA miden el uso con al menos 17 unidades distintas: tokens de texto, tokens de razonamiento, tokens en caché, tokens de entrada multimedia, tokens de audio en tiempo real, caracteres, minutos y segundos de contenido multimedia, objetos de salida, solicitudes, páginas, GPU-segundos, horas de contenedor, GB-días, token-horas, PTU-horas, tokens de entrenamiento y créditos sintéticos. Para estimar el coste de un producto que trabaja con más de una modalidad hay que convertir varias de estas unidades. Los presupuestos suelen fallar precisamente en esas reglas de conversión. Esta guía explica cada unidad, cómo se mide y qué detalle puede romper el cálculo.
TL;DR
- Las API de IA facturan con al menos 17 unidades distintas repartidas en cuatro capas: consumo, tiempo y capacidad, modificadores de tarifa y envoltorios sintéticos.
- Un minuto de audio puede facturarse de dos formas: entre $0.0020 y $0.0164 por minuto de audio en servicios específicos de transcripción, o 1 token de audio por cada 100 ms escuchados en gpt-realtime-2.1.
- Solo el almacenamiento ya tiene dos contadores: la búsqueda de archivos de OpenAI cobra $0.10 por GB-día; el almacenamiento de contexto en caché de Gemini cobra $0.50 por millón de tokens y hora.
- Los modificadores cambian las tarifas, no las unidades: batch cuesta la mitad, el horario valle de DeepSeek vuelve a reducir el precio a la mitad y la inferencia de Claude fijada en EE. UU. cuesta 1.1x.
¿Qué unidades utilizan las API de IA para facturar?
Son diecisiete, en el orden de las secciones siguientes: unidades de consumo (1 a 10), unidades de tiempo y capacidad (11 a 16) y envoltorios sintéticos (17), además de una capa de modificadores que altera las tarifas sin cambiar las unidades. La tabla sirve como referencia; cada fila enlaza con el análisis detallado.
| # | Unidad | Dónde aparece | El detalle problemático |
|---|---|---|---|
| 1 | Tokens de texto | Todas las API de chat | Un mismo texto produce recuentos distintos según el tokenizer; alrededor de un 30% más de tokens de una generación de tokenizer a la siguiente |
| 2 | Tokens de razonamiento | Modelos de razonamiento | Se facturan como salida que nunca ves; entre el 88% y el 99.3% de algunas respuestas |
| 3 | Tokens en caché | Prompt caching | Recargo de escritura según TTL, descuento de lectura y mínimos específicos de cada proveedor |
| 4 | Tokens de entrada multimedia | Entrada de visión, audio y PDF | Tres esquemas de conversión para una sola imagen; los PDF se facturan con tarifas de imagen |
| 5 | Tokens de audio en tiempo real | Voz a voz | 1 token por cada 100 ms escuchados y 1 por cada 50 ms hablados |
| 6 | Caracteres | TTS, guardrails | El habla en chino cuesta entre 3 y 7 veces menos que en inglés por minuto de audio |
| 7 | Minutos/segundos multimedia | Transcripción, generación de vídeo y música | Diferencia de precio de 8x por minuto de audio entre modelos con una precisión casi idéntica |
| 8 | Objetos de salida | Generación de imágenes, evaluación humana | El ajuste de calidad cambia 36x el coste de una imagen con la misma resolución |
| 9 | Solicitudes | Búsqueda web, grounding, búsqueda de archivos | $0.01 por búsqueda más los tokens inyectados, cobrados a la tarifa de entrada del modelo |
| 10 | Páginas | OCR, IA documental | Mistral cobra por cada 1,000 páginas, además de aplicar descuentos por batch y caché |
| 11 | GPU-segundos | Hosts serverless de modelos | La tarifa depende de la tarjeta, desde $0.000225/s (T4) hasta $0.001525/s (H100) |
| 12 | Horas de contenedor/sesión | Ejecución de código, agentes gestionados | Mínimo de 5 minutos y facturación por precarga de archivos, aunque la herramienta no llegue a ejecutarse |
| 13 | GB-días | Almacenamiento de archivos y vectores | $0.10 por GB-día después del primer gigabyte gratuito |
| 14 | Token-horas | Almacenamiento de contexto en caché | Gemini cobra $0.50 por millón de tokens y hora, el doble a partir de 2027 |
| 15 | PTU-horas/horas de unidad de modelo | Capacidad aprovisionada | Los tokens en caché no consumen capacidad; la salida pesa más que la entrada |
| 16 | Tokens de entrenamiento | Fine-tuning | Las épocas multiplican la factura; algunos modelos cobran $100 por hora en su lugar |
| 17 | Créditos/CCU | Marketplaces, suscripciones | Un factor aplicado a la tabla de tarifas real; 100 CCU = $1.00 en AWS Marketplace |
¿Qué unidades miden lo que consumes?
Diez de las diecisiete son unidades de consumo: el contador avanza cuando utilizas el servicio y cada modalidad cuenta algo distinto.
La familia de tokens (unidades 1 a 5). Los tokens de texto son la referencia, pero no forman una unidad uniforme: cada familia de modelos utiliza un tokenizer distinto, por lo que un mismo texto genera recuentos diferentes. Anthropic documenta que su tokenizer de la versión 4.7 en adelante produce alrededor de un 30% más de tokens para el mismo texto que el anterior. Los tokens de razonamiento son tokens de salida que normalmente no puedes leer; medimos 81 tokens facturados para una respuesta de 10 tokens, de los cuales el 88% correspondía al razonamiento. El precio de los tokens en caché depende de la operación y de la duración de la caché (TTL): en la API de Claude, escribir en una caché de 5 minutos cuesta 1.25x la entrada base, escribir en una de 1 hora cuesta 2x y leer cuesta 0.1x. Las entradas multimedia se convierten en tokens mediante fórmulas específicas de cada proveedor: una imagen de 1024x1024 factura 693, 1,089 y 1,372 tokens en GPT-5.6, Gemini y Claude, respectivamente. Gemini calcula el audio a 25 tokens por segundo y el vídeo 720p a 5,792 tokens por segundo, y factura los PDF con la tarifa de tokens de imagen. La voz en tiempo real utiliza su propio token: gpt-realtime-2.1 cobra exactamente 1 token de audio por cada 100 ms de voz del usuario y 1 por cada 50 ms de voz del modelo.
Caracteres y tiempo (unidades 6 y 7). La conversión de texto a voz (TTS) se factura por carácter (OpenAI publica entre $15 y $30 por millón de caracteres). Por eso el chino hablado cuesta entre 3 y 7 veces menos que el inglés por minuto de audio: el mismo tiempo de habla requiere menos caracteres. Los guardrails de Bedrock definen su propia unidad de caracteres, una “unidad de texto” de hasta 1,000 caracteres. Los modelos específicos de transcripción cobran por minuto de audio, entre $0.0020 y $0.0164 en los modelos que medimos; la generación de vídeo se cobra por segundo y resolución; Gemini tarifa la música por canción.
Objetos, solicitudes y páginas (unidades 8 a 10). La generación de imágenes se factura por imagen y nivel, o por token de salida. Ambos modelos de precio se cruzan: por debajo de unos 1,000 tokens de salida conviene pagar por token; por encima, la tarifa fija por imagen. Las herramientas del servidor cobran por solicitud: la búsqueda web cuesta $0.01 por búsqueda en las tres interfaces que medimos, y los resultados vuelven a facturarse como tokens de entrada (entre 1,500 y 3,100 por búsqueda). El grounding con búsqueda de Gemini (que permite al modelo consultar Google Search durante la solicitud) añade una cuota escalonada: 5,000 solicitudes gratuitas al mes y después $14 por cada 1,000. El OCR se factura por página. La evaluación de modelos de Bedrock cobra $0.21 por tarea humana completada, la única unidad de esta lista denominada en personas.
¿Qué unidades cobran por reservar tiempo o capacidad?
Seis unidades facturan por mantener recursos reservados, circulen tokens o no. Esta capa es la que más suele desviar las estimaciones de coste, porque el contador sigue avanzando mientras tu código no hace nada.
- GPU-segundos. Los hosts serverless cobran el tiempo de ejecución del modelo según la clase de hardware: en Replicate, una T4 cuesta $0.000225 por segundo y una H100, $0.001525. La unidad pone precio a la tarjeta, no al resultado.
- Horas de contenedor y sesión. La ejecución de código de Anthropic cobra $0.05 por hora de contenedor después de 1,550 horas gratuitas al mes, con un mínimo de 5 minutos por ejecución. El intérprete de código de OpenAI cobra por sesión de 20 minutos según el tamaño de memoria, desde $0.03 por 1 GB hasta $1.92 por 64 GB. Los agentes gestionados de Claude cobran $0.08 por hora de sesión, medidos al milisegundo y solo mientras están en ejecución.
- GB-días y token-horas. Son dos formas de medir la misma idea de almacenamiento. El almacenamiento para búsqueda de archivos de OpenAI cuesta $0.10 por GB-día, con 1 GB gratuito. El almacenamiento explícito de contexto en caché de Gemini cuesta $0.50 por millón de tokens y hora, y subirá a $1.00 en 2027. Una caché que olvidas borrar se convierte en una suscripción que no sabías que tenías.
- PTU-horas y unidades de modelo. La capacidad aprovisionada se cobra por unidad y hora, sin importar el tráfico. Las unidades de rendimiento aprovisionado (PTU) de Azure son cuota independiente del modelo, con tamaños mínimos de despliegue para cada modelo. Los tokens de salida consumen más capacidad que los de entrada y los tokens en caché no consumen ninguna, por lo que una tasa alta de aciertos de caché reduce el número de PTU necesarias. Bedrock vende el mismo esquema como unidades de modelo con compromisos de 1 o 6 meses.
- Tokens de entrenamiento. El fine-tuning se factura por token de datos de entrenamiento multiplicado por el número de épocas, salvo cuando se cobra por tiempo real: algunos modelos de OpenAI publican $100 por hora de entrenamiento.
¿Qué cambia la tarifa sin cambiar la unidad?
Hay siete factores que cambian el precio de una unidad sin modificarla: modalidad batch, nivel de servicio, hora, longitud del contexto, ubicación geográfica, ajustes de calidad y cuotas gratuitas. El código de facturación que guarda un único precio por modelo calcula mal todos estos casos, porque un mismo token tiene precios distintos según cómo, cuándo y dónde se procese.
| Modificador | Efecto | Ejemplo |
|---|---|---|
| Modalidad batch | 50% de descuento en entrada y salida | API batch de Anthropic y OpenAI; también Mistral OCR |
| Nivel de servicio | Recargo por velocidad | Nivel rápido de OpenAI a 2x las tarifas estándar; nivel flex con descuento |
| Hora | Descuento en horario valle | DeepSeek: el horario valle cuesta la mitad que el horario punta; las horas punta son de 01:00-04:00 y 06:00-10:00 UTC entre semana |
| Longitud del contexto | La tarifa cambia al superar un umbral | Las tarifas de Gemini cambian por encima de 200k tokens de prompt; Claude 4.6+ mantiene una tarifa fija en toda la ventana de 1M |
| Ubicación geográfica | Recargo por residencia | Claude inference_geo: "us" aplica 1.1x a todas las categorías de tokens; los endpoints regionales para modelos Claude en Bedrock y Google Cloud tienen un recargo del 10% frente a los globales |
| Ajustes de calidad | Misma unidad, distinto consumo | La calidad de gpt-image mueve el consumo entre 196 y 7,024 tokens facturados para una imagen de 1024x1024 |
| Cuotas gratuitas | Salto de tarifa al superar un umbral | Grounding: 5,000 solicitudes gratuitas/mes; ejecución de código: 1,550 horas gratuitas/mes |
Los multiplicadores se acumulan. Anthropic documenta que los multiplicadores de caché se combinan con el descuento por batch y el recargo por residencia. Por tanto, un token en caché, procesado por batch y fijado en EE. UU. lleva tres factores simultáneos.
¿Qué son los créditos y las CCU?
Son envoltorios sintéticos sobre los contadores reales, utilizados cuando la factura necesita una única partida. Cuando Claude factura a través de AWS o Azure Marketplace, el uso se valora en dólares con los precios normales por unidad y después se convierte en Claude Consumption Units a razón de 100 CCU por dólar. Los descuentos se reflejan en menos CCU medidas, no en una CCU más barata. Los productos por suscripción hacen lo mismo con créditos, y la separación puede existir dentro de una misma empresa: ElevenLabs mide sus planes de suscripción en créditos, pero indica que el uso de la API se factura en dólares estadounidenses, no en créditos. Ante una unidad sintética, hay que averiguar qué contador de consumo o capacidad hay debajo y cuál es su conversión.
¿Qué reglas de redondeo y mínimos dan problemas?
Estas son las reglas de cuantización, reunidas aquí porque cada una aparece en un documento distinto:
- Los contenedores de ejecución de código facturan un mínimo de 5 minutos, e incluir archivos en una solicitud genera tiempo de ejecución facturable aunque la herramienta nunca se invoque.
- Las sesiones del intérprete de código se cuantizan en bloques de 20 minutos según el nivel de RAM.
- La voz en tiempo real se cuantiza en 100 ms escuchados / 50 ms hablados por token de audio; 60 segundos de silencio no generaron coste con la detección de actividad de voz del servidor (VAD), y cancelar una respuesta hablada a los 2 segundos facturó 4 segundos.
- En la generación de imágenes,
n=4vuelve a facturar el prompt cuatro veces; esa interfaz no admite prompt caching. - Los tokens de vídeo incluyen un fotograma adicional en la fórmula y dimensiones codificadas distintas de las anunciadas: 720p se factura como 1248x704.
- Las cachés de prompts tienen longitudes mínimas almacenables específicas de cada proveedor; por debajo del mínimo pagas el recargo de escritura y no se almacena nada.
- Las unidades de texto de los guardrails redondean hacia arriba por cada 1,000 caracteres.
- Las definiciones de herramientas se facturan como entrada antes de cualquier llamada: el prompt de sistema para uso de herramientas de Anthropic añade entre 286 y 804 tokens según el modelo y la herramienta elegida, y un conjunto completo de herramientas de uso del ordenador añade unos 4,500.
¿Cómo se comparan los costes entre unidades?
Normaliza el coste a dólares por interacción del usuario, porque es la única unidad a la que pueden convertirse todos los contadores.
Nuestro estudio sobre agentes de voz siguió este método: una arquitectura en cascada que facturaba minutos de audio (transcripción), tokens (LLM) y caracteres (TTS) costaba entre $0.0037 y $0.025 por minuto de conversación, frente a $0.057 para gpt-realtime-2.1 y $0.016 para su versión mini. Así, el recargo del tiempo real y la mejora de latencia quedan expresados en una única cifra comparable. El procedimiento se aplica a cualquier caso: define la interacción (un ticket de soporte, un documento o un minuto de conversación), mide cada paso en su unidad nativa, aplica el precio vigente y solo entonces compara. Comparar directamente $/1M tokens con $/minuto de audio mezcla categorías incompatibles; comparar $/interacción es simple aritmética.
Cómo normaliza un gateway todas estas unidades
Synthorai aplica la tarifa al procesar la solicitud y conserva la unidad nativa junto al importe en dólares. Cada solicitud genera un registro de uso que incluye las lecturas de los contadores nativos (tokens por clase, segundos, caracteres y número de solicitudes), la versión de precios resuelta y el coste calculado. Así, cualquier partida de la factura puede descomponerse en unidad por tarifa. Es la misma conversión que realiza una CCU en el límite del marketplace, pero se hace por registro y queda disponible para inspección. También es compatible con el modo de retención cero: el registro de uso solo necesita las lecturas de los contadores y un hash del contenido, nunca el payload. Cuando un proveedor cambia el precio, la versión de precios conserva la tabla de tarifas aplicada a cada registro histórico. Gracias a ello, la conciliación de fin de mes es una auditoría y no una discusión.
Preguntas frecuentes
¿Los tokens de audio son iguales que los tokens de texto?
No. Los tokens de audio en tiempo real tienen un contador y unos precios independientes: en gpt-realtime-2.1, un token cubre 100 ms de voz escuchada o 50 ms de voz hablada, lo que equivale a $0.0192 por minuto de escucha y $0.0768 por minuto de habla. Los contadores de audio y texto tienen tablas de tarifas distintas incluso dentro del mismo modelo.
¿Por qué una misma imagen factura cantidades distintas de tokens según el proveedor?
Porque cambia el esquema de conversión, no la imagen: coexisten fórmulas por patches, tiles con límite y tarifas fijas. Una imagen de 1024x1024 generó 693 tokens en GPT-5.6, 1,089 en Gemini y 1,372 en Claude. Ni el formato del archivo ni el contenido modificaron el recuento en un solo token.
¿Los tokens en caché cuentan como tokens de entrada?
Se miden por separado y su precio depende de la operación: las escrituras en caché tienen un recargo sobre la entrada base (1.25x o 2x según el TTL en la API de Claude), mientras que las lecturas tienen descuento (0.1x). En la capacidad aprovisionada, la distinción importa por partida doble: los tokens en caché no consumen capacidad PTU, por lo que la caché reduce tanto la factura como la capacidad que debes reservar.
¿Para voz es más barato cobrar por carácter o por minuto?
Depende del idioma. La facturación por carácter en TTS hace que el chino hablado cueste entre 3 y 7 veces menos por minuto de audio que el inglés, porque el chino concentra más habla en menos caracteres. La facturación por minuto no depende del idioma. En transcripción, los modelos por minuto que medimos costaban entre $0.0020 y $0.0164 por minuto de audio, con una precisión casi idéntica en voz limpia.
Las definiciones de unidades y tarifas proceden de las páginas de precios de los proveedores consultadas el 2026-08-30 y de nuestros estudios enlazados en cada sección. Los precios cambian; la estructura de las unidades lo hace más despacio, pero comprueba la fuente enlazada antes de incorporar cualquier cifra al código de facturación.
Estudios relacionados con mediciones: anatomía de los tokens, prompt caching, mínimos de caché, tokens de entrada de imagen, generación de imágenes, transcripción, conversión de voz a texto, voz en tiempo real, generación de vídeo, búsqueda web, agentes de voz, tokenizers, coste por idioma.