🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Precios de la API de Seedance, medidos: la fórmula de tokens de vídeo, resuelta

Precios de la API de Seedance, medidos: la fórmula de tokens de vídeo, resuelta

Contenido
  1. ¿Qué hace cada modelo Seedance?
  2. ¿Cómo se llama a la API de Seedance?
  3. ¿Qué es exactamente un token de video?
  4. ¿Cuánto cuesta realmente Seedance por segundo?
  5. ¿El 4k sale más barato? La tarifa dice que sí, la factura dice que no
  6. ¿Qué cambia generate_audio?
  7. ¿Cómo se comporta la facturación de vídeo asíncrono?
  8. Preguntas frecuentes

Seedance factura el vídeo por tokens, y la fórmula que realmente cuadra con el contador es encoded_width × encoded_height × (24 × seconds + 1) / 1024. Dos partes de esa fórmula no aparecen en ninguna documentación que hayamos encontrado: el fotograma +1 y el hecho de que las dimensiones codificadas no son las nominales (720p factura como 1248×704, no 1280×720). Hicimos 27 generaciones repartidas entre cinco modelos Seedance y todos los niveles de resolución, y cada conteo de tokens facturado cuadra con esa fórmula hasta el token. Este post traza el mapa de la familia, muestra la API de dos peticiones y luego da la fórmula resuelta, la escala de precio por segundo que se deriva de ella y los dos puntos donde la tarifa engaña.

TL;DR

  • Tokens de vídeo de Seedance = ancho codificado × alto × (24 × segundos + 1) / 1024; el fotograma +1 y las dimensiones codificadas están medidos, no documentados.
  • 720p factura como 1248×704 y 1080p como 1920×1088; la relación de aspecto no cambia nada.
  • El mismo clip de 4 segundos facturó tokens idénticos en todos los niveles desde 1.5-pro hacia arriba; las tarifas van de $1.0 a $7.0 por millón.
  • La tarifa de $4.0/M de 4k queda por debajo de los $7.7/M de 1080p pero cuesta $0.78 por segundo frente a $0.38, 2,1x más.
  • generate_audio deja los tokens sin cambios y duplica la tarifa en 1.5-pro.

Todo lo de abajo se midió el 2026-07-22 a través del endpoint /v1/videos del gateway de Synthorai, donde la familia Seedance está disponible a los precios de lista de ByteDance; los registros brutos por tarea respaldan cada número.

¿Qué hace cada modelo Seedance?

La elección del nivel cambia la tarifa, nunca el contador: elige por capacidad y deja que las secciones siguientes pongan el precio. El mismo prompt de 480p a 4 segundos facturó tokens idénticos en Seedance 2.0, 2.0-fast, 2.0-mini y 1.5-pro (40.594 cada uno; 1.0-pro-fast facturó 39.285 sobre su cuadrícula de píxeles algo más pequeña). Lo que pagas al subir por la escala es capacidad, y la familia la reparte de forma desigual:

ResolucionesDuraciónAudioImagen de entradaseed / camera_fixedTarifa ($/M tokens)
2.0480p-4k4-15s (+auto)✓ nativoprimer + último fotograma$7.0 (1080p $7.7 · 4k $4.0)
2.0-fast480p-720p4-15s (+auto)primer + último fotograma$5.6
2.0-mini480p-720p4-15s (+auto)primer + último fotograma$3.5
1.5-pro480p-1080p4-12s (+auto)toggle ($1.2 / $2.4)primer + último fotograma$1.2-2.4
1.0-pro-fast480p-1080p2-12ssolo primer fotograma$1.0

Tres rarezas que conviene conocer antes de elegir. La reproducibilidad va al revés: seed y camera_fixed solo existen en los modelos 1.x, así que los niveles más baratos son los controlables y el buque insignia no. Los campos de capacidad están bloqueados por modelo: enviar generate_audio a un modelo 1.0 devuelve un 400 con nombre (extension_not_supported), así que construye las peticiones a partir de la lista de capacidades de cada modelo y no de una forma compartida. Y solo 1.0-pro-fast baja a clips de 2 segundos, por eso las mediciones de la fórmula de abajo se apoyan en él; todo lo más reciente arranca en 4 segundos. Más allá de la tabla, los modelos 2.0 también aceptan archivos de referencia como entrada (hasta 9 imágenes, 3 clips de vídeo y 3 archivos de audio) donde la plataforma lo exponga.

¿Cómo se llama a la API de Seedance?

La generación de video es una API de trabajos asíncronos: un solo POST crea la tarea y devuelve en unos dos segundos, y a partir de ahí haces polling a la URL de la tarea hasta que termina. El flujo completo en Python:

import os, time, requests

BASE = "https://synthorai.io/v1"
auth = {"Authorization": f"Bearer {os.environ['SYNTHORAI_API_KEY']}"}

task = requests.post(f"{BASE}/videos", headers=auth, json={
    "model": "seedance-1-5-pro-251215",
    "prompt": "A paper boat drifting across a rain puddle, cinematic",
    "resolution": "720p", "ratio": "16:9",
    "duration": 5, "generate_audio": True,
}).json()                                    # returns in ~2s: {"id": "vid_...", "status": "queued", ...}

while task["status"] not in ("completed", "failed", "cancelled"):
    time.sleep(8)
    task = requests.get(f"{BASE}/videos/{task['id']}", headers=auth).json()

print(task["data"][0]["url"])                # signed MP4, valid 24h
print(task["usage"]["total_tokens"])         # the billing meter this post is about

Si prefieres bloquear en lugar de hacer polling, envía la cabecera Prefer: wait=60 en la creación y la respuesta se mantiene abierta hasta que el clip esté listo o expire la ventana; después degrada al objeto de polling. En nuestras pruebas, la generación tardó entre 20 segundos y algo más de dos minutos para los clips de 480p y 720p. El campo usage.total_tokens de la tarea completada es el medidor de facturación, y el resto de este post trata de qué lo determina.

¿Qué es exactamente un token de video?

Un token de video es una porción fija de píxeles de salida a lo largo del tiempo: el conteo facturado es W × H × frames / 1024, donde el número de frames es 24 × segundos + 1 y W×H son las dimensiones reales del encoder, no la etiqueta del nivel de resolución. Recuperamos ambos términos del propio medidor. Los conteos de tokens facturados en tres duraciones para cada resolución encajan en una línea recta sin residuo; la pendiente de la línea da los tokens por segundo, y su intercepto, en todas las resoluciones, es exactamente el equivalente a un frame en tokens (405 en 480p, 858 en 720p, 2.040 en 1080p). Al despejar las pendientes para W×H se obtienen las rejillas reales codificadas:

Nivel nominalDimensiones codificadas (medidas)Tokens por segundoUn frame extra
480p864×480 (serie 1.0) / 864×496 (serie 1.5/2.0)9.720 / 10.044405 / 418
720p1248×704 (no 1280×720)20.592858
1080p1920×1088 (no 1920×1080)48.9602.040
4k3840×2160 (nominal = codificado)194.4008.100

Una comprobación cruzada independiente: el ejemplo resuelto de ByteDance para 2.0, muy difundido, un clip de 15 segundos con unos 308.880 tokens, es exactamente 15 veces nuestra tasa medida de 720p, así que la rejilla de 720p se sostiene más allá de la serie 1.0 sobre la que la ajustamos (y su cálculo de marketing omite el frame +1).

Dos consecuencias prácticas. El aspect ratio no cambia la factura: 16:9 y 9:16 facturaron tokens idénticos en las nueve corridas emparejadas, así que la salida vertical no es una decisión de coste. Y la aproximación tan citada W × H × 24 × duration / 1024 se queda corta por un frame y usa las dimensiones equivocadas, que es la razón por la que las estimaciones de terceros se desvían un pequeño porcentaje respecto a las facturas reales.

¿Cuánto cuesta realmente Seedance por segundo?

Multiplica las tasas de tokens medidas por la tarifa de lista de cada nivel y todo el catálogo se reduce a una sola escalera:

Modelo @ resolución$/segundo (tokens medidos × tarifa de lista)
seedance-1.0-pro-fast @ 480p$0.0097
seedance-1.5-pro @ 480p, sin audio$0.0121
seedance-1.0-pro-fast @ 720p$0.0206
seedance-1.5-pro @ 480p, con audio$0.0241
seedance-2.0-mini @ 480p$0.0352
seedance-1.0-pro-fast @ 1080p$0.0490
seedance-2.0-fast @ 480p$0.0563
seedance-2.0 @ 480p$0.0703
seedance-2.0 @ 4k$0.778

Para poner esto en contexto frente a las tarifas de lista de julio de 2026 de quienes facturan por segundo (según los agregan los trackers públicos de precios): Kling ronda los $0.07/s, Sora 2 los $0.10/s y Veo 3.1 los $0.40/s. Seedance 2.0 a 480p se ubica en el precio de Kling e incluye audio multipista nativo, y el nivel 1.0-fast genera 480p mirables a más o menos un séptimo de la tarifa de Kling. Un clip de 15 segundos a 720p en la 2.0 sale alrededor de $2.17; el mismo clip en 1.0-pro-fast cuesta $0.31.

¿El 4k sale más barato? La tarifa dice que sí, la factura dice que no

El 4k tiene la tarifa por token más baja de Seedance 2.0, $4.0 por millón frente a los $7.7 de 1080p, y aun así es lo más caro del menú. La razón está en la fórmula: el 4k emite unas cuatro veces los tokens por segundo de 1080p (194,400 frente a 48,960), así que la tarifa más barata te compra 2.1x el coste por segundo, $0.778/s frente a $0.377/s. Nuestro ancla de 4 segundos en 4k facturó 785,700 tokens, $3.14 por cuatro segundos de vídeo. Lee cualquier tarifa por token con los tokens por segundo de esa resolución al lado; en vídeo facturado por tokens, el precio de la etiqueta y la factura pueden apuntar en direcciones opuestas.

¿Qué cambia generate_audio?

La tarifa, no los tokens. En 1.5-pro el mismo clip de 5 segundos facturó 50,638 tokens con audio activado y 50,638 con audio desactivado; la tarifa de lista se duplica de $1.2/M en silencio a $2.4/M con audio, así que la salida con banda sonora cuesta exactamente 2x, limpio, sin recargo oculto de tokens. En la serie 2.0 el audio es parte de la tarifa única del modelo, así que no hay ninguna aritmética de toggle que hacer. Si tu pipeline añade su propia música de todas formas, 1.5-pro en silencio a $0.0121/s es la ganga discreta del catálogo.

¿Cómo se comporta la facturación de vídeo asíncrono?

La facturación se engancha al ciclo de vida de la tarea que viste arriba: el cargo cae una sola vez, cuando la tarea reporta completed por primera vez, sin importar cuántas veces hagas polling. La cancelación es honesta con la física: una tarea en cola se cancela limpiamente y no factura nada, pero una vez que la tarea está corriendo el upstream rechaza el borrado (409) y toca esperar el resultado. Las generaciones fallidas no se facturan.

Tres notas operativas de correr 27 tareas. Primera, las respuestas de vídeo traen el uso de tokens pero ningún campo de coste, a diferencia del usage.cost del chat; presupuesta como tokens × la tarifa de tu nivel. Segunda, la salida llega como una URL firmada con un tiempo de vida de 24 horas; muévela a tu propio almacenamiento cuanto antes. Tercera, regula el ritmo de tus creates: la plataforma permite 6 tareas de vídeo por workspace por minuto, y como cada tarea pendiente reserva el coste del peor caso contra tu balance, disparar creates en ráfaga durante una ralentización del upstream puede rebotar contra una respuesta temporal de cuota insuficiente aunque el gasto final quede bien.

Preguntas frecuentes

¿La API de Seedance 2.0 está disponible de verdad?

Sí. Lo que se contaba a principios de 2026 (credenciales chinas, listas de espera, despliegue por fases) ya quedó desactualizado: toda la familia, incluida la 2.0, está disponible en el endpoint /v1/videos del gateway de Synthorai a los precios de lista de ByteDance (páginas de los modelos: Seedance 2.0, 1.5-pro, 1.0-pro-fast), y varias otras plataformas también la ofrecen. Si una página te dice que Seedance 2.0 solo funciona con cuota de prueba, es anterior al despliegue de la API.

¿Por qué los precios de Seedance varían tanto entre proveedores?

Porque la mayoría de los revendedores convierte la facturación por tokens en un precio plano por segundo o por clip, con su propio margen y redondeo, y esa conversión esconde el cálculo de tokens que depende de la resolución y la duración. La fórmula de este post es la verdad de fondo detrás de cada cotización: calcula W × H × (24s + 1) / 1024 con las dimensiones codificadas y multiplícalo por la tarifa oficial, y podrás calcular con precisión el margen de cualquier proveedor.

¿La relación de aspecto o el formato vertical cuestan más?

No. En todas las pruebas, 16:9 y 9:16 facturaron los mismos tokens a cualquier resolución y duración. La resolución y la duración son las únicas palancas que mueven el contador, y la duración es exactamente lineal.

¿Y Seedance 2.5?

Anunciada, pero todavía no disponible en las APIs que seguimos. Lo que probablemente se mantendrá es la fórmula de tokens y la estructura de tier frente a tarifa; cuando llegue, repetiremos las mismas pruebas.

Medido el 22 y 23 de julio de 2026: 27 generaciones completadas en cinco modelos de Seedance vía /v1/videos, conteos de tokens tomados de los registros de uso por tarea, tarifas de la lista de ByteDance y la matriz de capacidades del catálogo en vivo /v1/videos/models. Las cifras por segundo de la competencia son precios de lista, no mediciones. Los ajustes de la fórmula son exactos en cada punto medido; las dimensiones codificadas se recuperan del contador, así que vuelve a verificarlas si ByteDance cambia de encoder. Para el resto de la serie sobre modalidades: generación de imágenes, speech-to-text, sesiones de voz y tokens de texto.

← Volver al blog