Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Facturación de API de IA: 17 unidades, de tokens a PTU-horas

Facturación de API de IA: 17 unidades, de tokens a PTU-horas

Contenido
  1. ¿Qué unidades utilizan las API de IA para facturar?
  2. ¿Qué unidades miden lo que consumes?
  3. ¿Qué unidades cobran por reservar tiempo o capacidad?
  4. ¿Qué cambia la tarifa sin cambiar la unidad?
  5. ¿Qué son los créditos y las CCU?
  6. ¿Qué reglas de redondeo y mínimos dan problemas?
  7. ¿Cómo se comparan los costes entre unidades?
  8. Cómo normaliza un gateway todas estas unidades
  9. Preguntas frecuentes

Las API de IA miden el uso con al menos 17 unidades distintas: tokens de texto, tokens de razonamiento, tokens en caché, tokens de entrada multimedia, tokens de audio en tiempo real, caracteres, minutos y segundos de contenido multimedia, objetos de salida, solicitudes, páginas, GPU-segundos, horas de contenedor, GB-días, token-horas, PTU-horas, tokens de entrenamiento y créditos sintéticos. Para estimar el coste de un producto que trabaja con más de una modalidad hay que convertir varias de estas unidades. Los presupuestos suelen fallar precisamente en esas reglas de conversión. Esta guía explica cada unidad, cómo se mide y qué detalle puede romper el cálculo.

TL;DR

  • Las API de IA facturan con al menos 17 unidades distintas repartidas en cuatro capas: consumo, tiempo y capacidad, modificadores de tarifa y envoltorios sintéticos.
  • Un minuto de audio puede facturarse de dos formas: entre $0.0020 y $0.0164 por minuto de audio en servicios específicos de transcripción, o 1 token de audio por cada 100 ms escuchados en gpt-realtime-2.1.
  • Solo el almacenamiento ya tiene dos contadores: la búsqueda de archivos de OpenAI cobra $0.10 por GB-día; el almacenamiento de contexto en caché de Gemini cobra $0.50 por millón de tokens y hora.
  • Los modificadores cambian las tarifas, no las unidades: batch cuesta la mitad, el horario valle de DeepSeek vuelve a reducir el precio a la mitad y la inferencia de Claude fijada en EE. UU. cuesta 1.1x.

¿Qué unidades utilizan las API de IA para facturar?

Son diecisiete, en el orden de las secciones siguientes: unidades de consumo (1 a 10), unidades de tiempo y capacidad (11 a 16) y envoltorios sintéticos (17), además de una capa de modificadores que altera las tarifas sin cambiar las unidades. La tabla sirve como referencia; cada fila enlaza con el análisis detallado.

Mapa de las unidades de facturación de API de IA: diez unidades de consumo, desde tokens de texto hasta páginas; seis unidades de tiempo y capacidad, desde GPU-segundos hasta tokens de entrenamiento; créditos y CCU como envoltorios sintéticos; y un panel lateral de modificadores de tarifa, desde descuentos por batch hasta saltos al agotar cuotas gratuitas

#UnidadDónde apareceEl detalle problemático
1Tokens de textoTodas las API de chatUn mismo texto produce recuentos distintos según el tokenizer; alrededor de un 30% más de tokens de una generación de tokenizer a la siguiente
2Tokens de razonamientoModelos de razonamientoSe facturan como salida que nunca ves; entre el 88% y el 99.3% de algunas respuestas
3Tokens en cachéPrompt cachingRecargo de escritura según TTL, descuento de lectura y mínimos específicos de cada proveedor
4Tokens de entrada multimediaEntrada de visión, audio y PDFTres esquemas de conversión para una sola imagen; los PDF se facturan con tarifas de imagen
5Tokens de audio en tiempo realVoz a voz1 token por cada 100 ms escuchados y 1 por cada 50 ms hablados
6CaracteresTTS, guardrailsEl habla en chino cuesta entre 3 y 7 veces menos que en inglés por minuto de audio
7Minutos/segundos multimediaTranscripción, generación de vídeo y músicaDiferencia de precio de 8x por minuto de audio entre modelos con una precisión casi idéntica
8Objetos de salidaGeneración de imágenes, evaluación humanaEl ajuste de calidad cambia 36x el coste de una imagen con la misma resolución
9SolicitudesBúsqueda web, grounding, búsqueda de archivos$0.01 por búsqueda más los tokens inyectados, cobrados a la tarifa de entrada del modelo
10PáginasOCR, IA documentalMistral cobra por cada 1,000 páginas, además de aplicar descuentos por batch y caché
11GPU-segundosHosts serverless de modelosLa tarifa depende de la tarjeta, desde $0.000225/s (T4) hasta $0.001525/s (H100)
12Horas de contenedor/sesiónEjecución de código, agentes gestionadosMínimo de 5 minutos y facturación por precarga de archivos, aunque la herramienta no llegue a ejecutarse
13GB-díasAlmacenamiento de archivos y vectores$0.10 por GB-día después del primer gigabyte gratuito
14Token-horasAlmacenamiento de contexto en cachéGemini cobra $0.50 por millón de tokens y hora, el doble a partir de 2027
15PTU-horas/horas de unidad de modeloCapacidad aprovisionadaLos tokens en caché no consumen capacidad; la salida pesa más que la entrada
16Tokens de entrenamientoFine-tuningLas épocas multiplican la factura; algunos modelos cobran $100 por hora en su lugar
17Créditos/CCUMarketplaces, suscripcionesUn factor aplicado a la tabla de tarifas real; 100 CCU = $1.00 en AWS Marketplace

¿Qué unidades miden lo que consumes?

Diez de las diecisiete son unidades de consumo: el contador avanza cuando utilizas el servicio y cada modalidad cuenta algo distinto.

La familia de tokens (unidades 1 a 5). Los tokens de texto son la referencia, pero no forman una unidad uniforme: cada familia de modelos utiliza un tokenizer distinto, por lo que un mismo texto genera recuentos diferentes. Anthropic documenta que su tokenizer de la versión 4.7 en adelante produce alrededor de un 30% más de tokens para el mismo texto que el anterior. Los tokens de razonamiento son tokens de salida que normalmente no puedes leer; medimos 81 tokens facturados para una respuesta de 10 tokens, de los cuales el 88% correspondía al razonamiento. El precio de los tokens en caché depende de la operación y de la duración de la caché (TTL): en la API de Claude, escribir en una caché de 5 minutos cuesta 1.25x la entrada base, escribir en una de 1 hora cuesta 2x y leer cuesta 0.1x. Las entradas multimedia se convierten en tokens mediante fórmulas específicas de cada proveedor: una imagen de 1024x1024 factura 693, 1,089 y 1,372 tokens en GPT-5.6, Gemini y Claude, respectivamente. Gemini calcula el audio a 25 tokens por segundo y el vídeo 720p a 5,792 tokens por segundo, y factura los PDF con la tarifa de tokens de imagen. La voz en tiempo real utiliza su propio token: gpt-realtime-2.1 cobra exactamente 1 token de audio por cada 100 ms de voz del usuario y 1 por cada 50 ms de voz del modelo.

Caracteres y tiempo (unidades 6 y 7). La conversión de texto a voz (TTS) se factura por carácter (OpenAI publica entre $15 y $30 por millón de caracteres). Por eso el chino hablado cuesta entre 3 y 7 veces menos que el inglés por minuto de audio: el mismo tiempo de habla requiere menos caracteres. Los guardrails de Bedrock definen su propia unidad de caracteres, una “unidad de texto” de hasta 1,000 caracteres. Los modelos específicos de transcripción cobran por minuto de audio, entre $0.0020 y $0.0164 en los modelos que medimos; la generación de vídeo se cobra por segundo y resolución; Gemini tarifa la música por canción.

Objetos, solicitudes y páginas (unidades 8 a 10). La generación de imágenes se factura por imagen y nivel, o por token de salida. Ambos modelos de precio se cruzan: por debajo de unos 1,000 tokens de salida conviene pagar por token; por encima, la tarifa fija por imagen. Las herramientas del servidor cobran por solicitud: la búsqueda web cuesta $0.01 por búsqueda en las tres interfaces que medimos, y los resultados vuelven a facturarse como tokens de entrada (entre 1,500 y 3,100 por búsqueda). El grounding con búsqueda de Gemini (que permite al modelo consultar Google Search durante la solicitud) añade una cuota escalonada: 5,000 solicitudes gratuitas al mes y después $14 por cada 1,000. El OCR se factura por página. La evaluación de modelos de Bedrock cobra $0.21 por tarea humana completada, la única unidad de esta lista denominada en personas.

¿Qué unidades cobran por reservar tiempo o capacidad?

Seis unidades facturan por mantener recursos reservados, circulen tokens o no. Esta capa es la que más suele desviar las estimaciones de coste, porque el contador sigue avanzando mientras tu código no hace nada.

¿Qué cambia la tarifa sin cambiar la unidad?

Hay siete factores que cambian el precio de una unidad sin modificarla: modalidad batch, nivel de servicio, hora, longitud del contexto, ubicación geográfica, ajustes de calidad y cuotas gratuitas. El código de facturación que guarda un único precio por modelo calcula mal todos estos casos, porque un mismo token tiene precios distintos según cómo, cuándo y dónde se procese.

ModificadorEfectoEjemplo
Modalidad batch50% de descuento en entrada y salidaAPI batch de Anthropic y OpenAI; también Mistral OCR
Nivel de servicioRecargo por velocidadNivel rápido de OpenAI a 2x las tarifas estándar; nivel flex con descuento
HoraDescuento en horario valleDeepSeek: el horario valle cuesta la mitad que el horario punta; las horas punta son de 01:00-04:00 y 06:00-10:00 UTC entre semana
Longitud del contextoLa tarifa cambia al superar un umbralLas tarifas de Gemini cambian por encima de 200k tokens de prompt; Claude 4.6+ mantiene una tarifa fija en toda la ventana de 1M
Ubicación geográficaRecargo por residenciaClaude inference_geo: "us" aplica 1.1x a todas las categorías de tokens; los endpoints regionales para modelos Claude en Bedrock y Google Cloud tienen un recargo del 10% frente a los globales
Ajustes de calidadMisma unidad, distinto consumoLa calidad de gpt-image mueve el consumo entre 196 y 7,024 tokens facturados para una imagen de 1024x1024
Cuotas gratuitasSalto de tarifa al superar un umbralGrounding: 5,000 solicitudes gratuitas/mes; ejecución de código: 1,550 horas gratuitas/mes

Los multiplicadores se acumulan. Anthropic documenta que los multiplicadores de caché se combinan con el descuento por batch y el recargo por residencia. Por tanto, un token en caché, procesado por batch y fijado en EE. UU. lleva tres factores simultáneos.

¿Qué son los créditos y las CCU?

Son envoltorios sintéticos sobre los contadores reales, utilizados cuando la factura necesita una única partida. Cuando Claude factura a través de AWS o Azure Marketplace, el uso se valora en dólares con los precios normales por unidad y después se convierte en Claude Consumption Units a razón de 100 CCU por dólar. Los descuentos se reflejan en menos CCU medidas, no en una CCU más barata. Los productos por suscripción hacen lo mismo con créditos, y la separación puede existir dentro de una misma empresa: ElevenLabs mide sus planes de suscripción en créditos, pero indica que el uso de la API se factura en dólares estadounidenses, no en créditos. Ante una unidad sintética, hay que averiguar qué contador de consumo o capacidad hay debajo y cuál es su conversión.

¿Qué reglas de redondeo y mínimos dan problemas?

Estas son las reglas de cuantización, reunidas aquí porque cada una aparece en un documento distinto:

¿Cómo se comparan los costes entre unidades?

Normaliza el coste a dólares por interacción del usuario, porque es la única unidad a la que pueden convertirse todos los contadores.

Diagrama de flujo de una llamada de voz: la arquitectura en cascada factura la transcripción en minutos de audio, el LLM en tokens y la conversión de texto a voz en caracteres, con un total de $0.0037 a $0.025 por minuto de conversación; la arquitectura en tiempo real solo factura tokens de audio y queda entre $0.016 y $0.057 Nuestro estudio sobre agentes de voz siguió este método: una arquitectura en cascada que facturaba minutos de audio (transcripción), tokens (LLM) y caracteres (TTS) costaba entre $0.0037 y $0.025 por minuto de conversación, frente a $0.057 para gpt-realtime-2.1 y $0.016 para su versión mini. Así, el recargo del tiempo real y la mejora de latencia quedan expresados en una única cifra comparable. El procedimiento se aplica a cualquier caso: define la interacción (un ticket de soporte, un documento o un minuto de conversación), mide cada paso en su unidad nativa, aplica el precio vigente y solo entonces compara. Comparar directamente $/1M tokens con $/minuto de audio mezcla categorías incompatibles; comparar $/interacción es simple aritmética.

Cómo normaliza un gateway todas estas unidades

Synthorai aplica la tarifa al procesar la solicitud y conserva la unidad nativa junto al importe en dólares. Cada solicitud genera un registro de uso que incluye las lecturas de los contadores nativos (tokens por clase, segundos, caracteres y número de solicitudes), la versión de precios resuelta y el coste calculado. Así, cualquier partida de la factura puede descomponerse en unidad por tarifa. Es la misma conversión que realiza una CCU en el límite del marketplace, pero se hace por registro y queda disponible para inspección. También es compatible con el modo de retención cero: el registro de uso solo necesita las lecturas de los contadores y un hash del contenido, nunca el payload. Cuando un proveedor cambia el precio, la versión de precios conserva la tabla de tarifas aplicada a cada registro histórico. Gracias a ello, la conciliación de fin de mes es una auditoría y no una discusión.

Preguntas frecuentes

¿Los tokens de audio son iguales que los tokens de texto?

No. Los tokens de audio en tiempo real tienen un contador y unos precios independientes: en gpt-realtime-2.1, un token cubre 100 ms de voz escuchada o 50 ms de voz hablada, lo que equivale a $0.0192 por minuto de escucha y $0.0768 por minuto de habla. Los contadores de audio y texto tienen tablas de tarifas distintas incluso dentro del mismo modelo.

¿Por qué una misma imagen factura cantidades distintas de tokens según el proveedor?

Porque cambia el esquema de conversión, no la imagen: coexisten fórmulas por patches, tiles con límite y tarifas fijas. Una imagen de 1024x1024 generó 693 tokens en GPT-5.6, 1,089 en Gemini y 1,372 en Claude. Ni el formato del archivo ni el contenido modificaron el recuento en un solo token.

¿Los tokens en caché cuentan como tokens de entrada?

Se miden por separado y su precio depende de la operación: las escrituras en caché tienen un recargo sobre la entrada base (1.25x o 2x según el TTL en la API de Claude), mientras que las lecturas tienen descuento (0.1x). En la capacidad aprovisionada, la distinción importa por partida doble: los tokens en caché no consumen capacidad PTU, por lo que la caché reduce tanto la factura como la capacidad que debes reservar.

¿Para voz es más barato cobrar por carácter o por minuto?

Depende del idioma. La facturación por carácter en TTS hace que el chino hablado cueste entre 3 y 7 veces menos por minuto de audio que el inglés, porque el chino concentra más habla en menos caracteres. La facturación por minuto no depende del idioma. En transcripción, los modelos por minuto que medimos costaban entre $0.0020 y $0.0164 por minuto de audio, con una precisión casi idéntica en voz limpia.

Las definiciones de unidades y tarifas proceden de las páginas de precios de los proveedores consultadas el 2026-08-30 y de nuestros estudios enlazados en cada sección. Los precios cambian; la estructura de las unidades lo hace más despacio, pero comprueba la fuente enlazada antes de incorporar cualquier cifra al código de facturación.

Estudios relacionados con mediciones: anatomía de los tokens, prompt caching, mínimos de caché, tokens de entrada de imagen, generación de imágenes, transcripción, conversión de voz a texto, voz en tiempo real, generación de vídeo, búsqueda web, agentes de voz, tokenizers, coste por idioma.

← Volver al blog