Precios de la API de Seedance, medidos: resolvemos la fórmula de tokens de vídeo
Contenido
- ¿Qué hace cada modelo de Seedance?
- ¿Cómo se llama a la API de Seedance?
- ¿Qué es exactamente un token de vídeo?
- ¿Cuánto cuesta realmente Seedance por segundo?
- ¿Es más barato 4k? La tarifa dice que sí, la factura dice que no
- ¿Qué cambia generate_audio?
- ¿Cómo funciona la facturación asíncrona de vídeo?
- Preguntas frecuentes
Seedance factura la generación de vídeo por tokens. La fórmula que cuadra con el contador es encoded_width × encoded_height × (24 × seconds + 1) / 1024. Hay dos detalles que no aparecen en la documentación que hemos encontrado: el frame adicional, +1, y que las dimensiones codificadas no coinciden con las nominales. Por ejemplo, 720p se factura como 1248×704, no como 1280×720. Ejecutamos 27 generaciones con cinco modelos de Seedance y todos los niveles de resolución. Todos los recuentos facturados cuadraron con la fórmula hasta el último token. En este artículo repasamos la familia, mostramos la API de dos peticiones y explicamos la fórmula, la escala de precios por segundo que se deriva de ella y los dos puntos en los que la tabla de tarifas resulta engañosa.
TL;DR
- Tokens de vídeo de Seedance = ancho codificado × alto codificado × (24 × segundos + 1) / 1024; tanto el frame adicional como las dimensiones codificadas proceden de mediciones, no de la documentación.
- 720p se factura como 1248×704 y 1080p como 1920×1088; la relación de aspecto no cambia nada.
- El mismo clip de 4 segundos consumió exactamente los mismos tokens en todos los niveles desde 1.5-pro en adelante; las tarifas van de $1.0 a $7.0 por millón.
- Aunque la tarifa de 4k, $4.0/M, es menor que la de 1080p, $7.7/M, su coste es de $0.78 por segundo frente a $0.38: 2.1x más.
generate_audiono modifica los tokens y duplica la tarifa en 1.5-pro.
Todas las mediciones siguientes se realizaron el 2026-07-22 mediante el endpoint /v1/videos del gateway de Synthorai, donde la familia Seedance está disponible con los precios de catálogo de ByteDance. Cada cifra está respaldada por los registros sin procesar de cada tarea.
¿Qué hace cada modelo de Seedance?
El nivel elegido cambia la tarifa, pero nunca el contador. Elige según las prestaciones y calcula después el precio con las secciones siguientes. El mismo prompt de 4 segundos a 480p consumió idéntico número de tokens en Seedance 2.0, 2.0-fast, 2.0-mini y 1.5-pro: 40,594 en cada uno. 1.0-pro-fast consumió 39,285 porque utiliza una cuadrícula de píxeles ligeramente menor. Al subir de nivel pagas por más prestaciones, pero su distribución dentro de la familia es desigual:
| Resoluciones | Duración | Audio | Imagen de entrada | seed / camera_fixed | Tarifa ($/M tokens) | |
|---|---|---|---|---|---|---|
| 2.0 | 480p-4k | 4-15s (+automática) | ✓ nativo | primer y último frame | ✗ | $7.0 (1080p $7.7 · 4k $4.0) |
| 2.0-fast | 480p-720p | 4-15s (+automática) | ✓ | primer y último frame | ✗ | $5.6 |
| 2.0-mini | 480p-720p | 4-15s (+automática) | ✓ | primer y último frame | ✗ | $3.5 |
| 1.5-pro | 480p-1080p | 4-12s (+automática) | conmutable ($1.2 / $2.4) | primer y último frame | ✓ | $1.2-2.4 |
| 1.0-pro-fast | 480p-1080p | 2-12s | ✗ | solo el primer frame | ✓ | $1.0 |
Conviene conocer tres particularidades antes de elegir. La reproducibilidad funciona al revés de lo esperable: seed y camera_fixed solo están disponibles en los modelos 1.x. Por tanto, los niveles más baratos son los controlables y el modelo principal no lo es. Cada modelo restringe estrictamente los campos admitidos. Enviar generate_audio a un modelo 1.0 devuelve un error 400 identificado como extension_not_supported, así que debes construir las peticiones a partir de la lista de prestaciones de cada modelo, no reutilizar una estructura común. Además, solo 1.0-pro-fast permite clips de 2 segundos. Por eso lo utilizamos ampliamente en las mediciones de la fórmula; todos los modelos posteriores parten de 4 segundos. Los modelos 2.0 también aceptan upstream archivos de referencia, con un máximo de 9 imágenes, 3 clips de vídeo y 3 archivos de audio, cuando la plataforma ofrece esa opción.
¿Cómo se llama a la API de Seedance?
La generación de vídeo utiliza una API de trabajos asíncronos: un POST crea la tarea y responde en unos dos segundos; después consultas periódicamente la URL de la tarea hasta que finaliza. Este es el flujo completo en Python:
import os, time, requests
BASE = "https://synthorai.io/v1"
auth = {"Authorization": f"Bearer {os.environ['SYNTHORAI_API_KEY']}"}
task = requests.post(f"{BASE}/videos", headers=auth, json={
"model": "seedance-1-5-pro-251215",
"prompt": "A paper boat drifting across a rain puddle, cinematic",
"resolution": "720p", "ratio": "16:9",
"duration": 5, "generate_audio": True,
}).json() # returns in ~2s: {"id": "vid_...", "status": "queued", ...}
while task["status"] not in ("completed", "failed", "cancelled"):
time.sleep(8)
task = requests.get(f"{BASE}/videos/{task['id']}", headers=auth).json()
print(task["data"][0]["url"]) # signed MP4, valid 24h
print(task["usage"]["total_tokens"]) # the billing meter this post is about
Si prefieres bloquear la petición en lugar de hacer polling, incluye el header Prefer: wait=60 al crear la tarea. La respuesta esperará hasta que termine el clip o se agote ese plazo; si vence, devolverá el objeto que permite continuar con polling. En nuestras pruebas, la generación de los clips a 480p y 720p tardó entre 20 segundos y algo más de dos minutos. El campo usage.total_tokens de la tarea completada contiene el contador de facturación. El resto del artículo analiza qué factores lo determinan.
¿Qué es exactamente un token de vídeo?
Un token de vídeo representa una porción fija de píxeles de salida a lo largo del tiempo. El recuento facturado es W × H × frames / 1024, donde el número de frames es 24 × seconds + 1. W×H corresponde a las dimensiones reales del encoder, no a la etiqueta del nivel de resolución. Obtuvimos ambos valores a partir del propio contador. En cada resolución, los tokens facturados para tres duraciones distintas forman una recta con residuo cero. Su pendiente indica los tokens por segundo y su intercepto equivale exactamente, en todas las resoluciones, a los tokens de un frame: 405 a 480p, 858 a 720p y 2,040 a 1080p. Al despejar W×H a partir de las pendientes se obtienen las cuadrículas codificadas reales:
| Nivel nominal | Dimensiones codificadas (medidas) | Tokens por segundo | Un frame adicional |
|---|---|---|---|
| 480p | 864×480 (serie 1.0) / 864×496 (series 1.5/2.0) | 9,720 / 10,044 | 405 / 418 |
| 720p | 1248×704 (no 1280×720) | 20,592 | 858 |
| 1080p | 1920×1088 (no 1920×1080) | 48,960 | 2,040 |
| 4k | 3840×2160 (nominal = codificada) | 194,400 | 8,100 |
Hay una comprobación independiente. El ejemplo de cálculo de 2.0 ampliamente difundido por ByteDance, un clip de 15 segundos con unos 308,880 tokens, equivale exactamente a 15 veces nuestra tasa medida para 720p. Por tanto, la cuadrícula de 720p también se mantiene más allá de la serie 1.0 utilizada para ajustar la fórmula. El cálculo comercial de ByteDance omite el frame adicional.
Esto tiene dos consecuencias prácticas. La relación de aspecto no afecta a la factura: 16:9 y 9:16 consumieron idéntico número de tokens en las nueve pruebas emparejadas, así que el formato vertical no cambia el coste. Además, la aproximación habitual W × H × 24 × duration / 1024 se queda corta en un frame y utiliza dimensiones incorrectas. De ahí que las estimaciones de terceros se desvíen unos puntos porcentuales respecto a las facturas reales.
¿Cuánto cuesta realmente Seedance por segundo?
Al multiplicar las tasas de tokens medidas por la tarifa de catálogo de cada nivel, todo el catálogo queda resumido en esta escala:
| Modelo y resolución | $/segundo (tokens medidos × tarifa de catálogo) |
|---|---|
| seedance-1.0-pro-fast @ 480p | $0.0097 |
| seedance-1.5-pro @ 480p, sin audio | $0.0121 |
| seedance-1.0-pro-fast @ 720p | $0.0206 |
| seedance-1.5-pro @ 480p, con audio | $0.0241 |
| seedance-2.0-mini @ 480p | $0.0352 |
| seedance-1.0-pro-fast @ 1080p | $0.0490 |
| seedance-2.0-fast @ 480p | $0.0563 |
| seedance-2.0 @ 480p | $0.0703 |
| seedance-2.0 @ 4k | $0.778 |
Como referencia frente a los servicios que facturan por segundo, según sus precios de catálogo de julio de 2026 recopilados por rastreadores públicos de precios, Kling cuesta unos $0.07/s, Sora 2 unos $0.10/s y Veo 3.1 unos $0.40/s. Seedance 2.0 a 480p se sitúa al mismo precio que Kling e incluye audio multipista nativo. El nivel 1.0-fast genera vídeo utilizable a 480p por aproximadamente una séptima parte de la tarifa de Kling. Un clip de 15 segundos a 720p cuesta unos $2.17 con 2.0; el mismo clip cuesta $0.31 con 1.0-pro-fast.
¿Es más barato 4k? La tarifa dice que sí, la factura dice que no
4k tiene la tarifa por token más baja de Seedance 2.0, $4.0 por millón frente a $7.7 en 1080p, pero aun así es la opción más cara del catálogo. La fórmula explica por qué: 4k genera aproximadamente cuatro veces más tokens por segundo que 1080p, 194,400 frente a 48,960. Por tanto, la tarifa inferior termina costando 2.1x más por segundo: $0.778/s frente a $0.377/s. Nuestra prueba de referencia de 4 segundos a 4k consumió 785,700 tokens, es decir, $3.14 por cuatro segundos de vídeo. Al leer una tabla de tarifas por token, hay que colocar al lado los tokens por segundo de cada resolución. En vídeo facturado por tokens, el precio anunciado y el coste real pueden indicar cosas opuestas.
¿Qué cambia generate_audio?
Cambia la tarifa, no los tokens. En 1.5-pro, el mismo clip de 5 segundos consumió 50,638 tokens tanto con audio como sin él. La tarifa de catálogo se duplica: pasa de $1.2/M sin audio a $2.4/M con audio. Por tanto, la salida con banda sonora cuesta exactamente 2x, sin recargos ocultos de tokens. En la serie 2.0, el audio forma parte de la tarifa única del modelo, así que no hay que calcular ningún extra por activarlo o desactivarlo. Si tu pipeline añade su propia música, 1.5-pro sin audio, a $0.0121/s, es la opción económica del catálogo.
¿Cómo funciona la facturación asíncrona de vídeo?
La facturación está vinculada al ciclo de vida de la tarea descrito antes. El cargo se aplica una sola vez, cuando la tarea aparece por primera vez como completada, independientemente de cuántas veces hagas polling. La cancelación respeta el estado real del trabajo: una tarea en cola se cancela correctamente y no se factura, pero si ya está en ejecución, el upstream rechaza la eliminación con un 409 y hay que esperar al resultado. Las generaciones fallidas no se facturan.
Al ejecutar 27 tareas observamos tres detalles operativos. Primero, las respuestas de vídeo incluyen el consumo de tokens, pero no incluyen ningún campo de coste, a diferencia de usage.cost en chat. Para presupuestar, multiplica los tokens por la tarifa de tu nivel. Segundo, el resultado se entrega mediante una URL firmada que caduca a las 24 horas; cópialo cuanto antes a tu propio almacenamiento. Tercero, limita el ritmo de creación de tareas. La plataforma admite 6 tareas de vídeo por workspace y minuto. Como cada tarea pendiente reserva en tu saldo el coste máximo posible, una ráfaga de creaciones durante una ralentización del upstream puede provocar temporalmente una respuesta de cuota insuficiente, aunque el gasto final sea asumible.
Preguntas frecuentes
¿Está realmente disponible la API de Seedance 2.0?
Sí. La situación de acceso de principios de 2026, con credenciales chinas, listas de espera y un despliegue por fases, ya está desactualizada. Toda la familia, incluido 2.0, está disponible en el endpoint /v1/videos del gateway de Synthorai con los precios de catálogo de ByteDance. Estas son las páginas de los modelos: Seedance 2.0, 1.5-pro y 1.0-pro-fast. También la ofrecen otras plataformas. Si una página afirma que Seedance 2.0 solo está disponible mediante una cuota de prueba, es anterior al lanzamiento de la API.
¿Por qué varían tanto los precios de Seedance entre proveedores?
La mayoría de los revendedores convierten la facturación por tokens en precios fijos por segundo o por clip, aplicando su propio margen y redondeo. Esa conversión oculta el cálculo de tokens, que depende de la resolución y la duración. La fórmula de este artículo es la base de cualquier presupuesto: calcula W × H × (24s + 1) / 1024 con las dimensiones codificadas y multiplícalo por la tarifa oficial. Así puedes determinar con precisión el margen aplicado por cualquier proveedor.
¿La relación de aspecto o el formato vertical cuestan más?
No. 16:9 y 9:16 consumieron idéntico número de tokens en todas las resoluciones y duraciones probadas. Solo la resolución y la duración modifican el contador, y la duración lo hace de forma exactamente lineal.
¿Y Seedance 2.5?
Está anunciado, pero aún no se ofrece en las API que seguimos. Es probable que mantenga la fórmula de tokens y la estructura de niveles y tarifas. Cuando esté disponible, repetiremos las mismas pruebas.
Mediciones realizadas el 2026-07-22/23: 27 generaciones completadas con cinco modelos de Seedance mediante /v1/videos; recuentos de tokens obtenidos de los registros de uso de cada tarea; tarifas tomadas del catálogo de ByteDance; y matriz de prestaciones extraída del catálogo activo /v1/videos/models. Las cifras por segundo de los competidores son precios de catálogo, no mediciones. La fórmula encaja exactamente con todos los puntos medidos. Las dimensiones codificadas se obtuvieron a partir del contador, por lo que conviene verificarlas de nuevo si ByteDance cambia los encoders. Otros artículos de la serie por modalidad: generación de imágenes, transcripción de voz a texto, sesiones de voz y tokens de texto.