Preços da API Seedance, medidos: a fórmula dos tokens de vídeo
Conteúdo
A Seedance cobra pela geração de vídeo em tokens. A fórmula que bate exatamente com o medidor é encoded_width × encoded_height × (24 × seconds + 1) / 1024. Não encontramos dois detalhes dessa fórmula em nenhuma documentação: o frame adicional, representado por +1, e o fato de as dimensões codificadas não serem as nominais. Em 720p, por exemplo, a cobrança usa 1248×704, não 1280×720. Executamos 27 gerações em cinco modelos Seedance e em todas as faixas de resolução. Em todos os casos, a quantidade faturada bateu com a fórmula até o último token. Este artigo apresenta a família de modelos e a API de duas requisições, deriva a fórmula, calcula os preços por segundo e explica os dois pontos em que a tabela de tarifas induz ao erro.
TL;DR
- Tokens de vídeo da Seedance = largura codificada × altura codificada × (24 × segundos + 1) / 1024; tanto o frame adicional quanto as dimensões codificadas foram medidos e não constam na documentação.
- 720p é faturado como 1248×704 e 1080p como 1920×1088; a proporção de tela não altera o custo.
- O mesmo clipe de 4 segundos consumiu a mesma quantidade de tokens em todas as faixas a partir da 1.5-pro; as tarifas variam de $1.0 a $7.0 por milhão.
- Embora a tarifa de 4k, $4.0/M, seja menor que a de 1080p, $7.7/M, o custo por segundo é $0.78 contra $0.38, ou 2.1x mais.
generate_audionão altera a quantidade de tokens e dobra a tarifa na 1.5-pro.
Todas as medições abaixo foram feitas em 2026-07-22 pelo endpoint /v1/videos do gateway da Synthorai, onde a família Seedance está disponível pelos preços de tabela da ByteDance. Cada número pode ser conferido nos registros brutos por tarefa.
O que cada modelo Seedance faz?
A faixa escolhida altera a tarifa, mas não o medidor. Escolha primeiro pelos recursos; as próximas seções mostram quanto cada opção custa. O mesmo prompt de 4 segundos em 480p consumiu a mesma quantidade de tokens no Seedance 2.0, 2.0-fast, 2.0-mini e 1.5-pro: 40,594 em cada um. O 1.0-pro-fast consumiu 39,285 por usar uma grade de pixels um pouco menor. Subir de faixa significa pagar por recursos adicionais, mas eles não estão distribuídos de maneira uniforme pela família:
| Resoluções | Duração | Áudio | Imagem de entrada | seed / camera_fixed | Tarifa ($/M tokens) | |
|---|---|---|---|---|---|---|
| 2.0 | 480p-4k | 4-15s (+automática) | ✓ nativo | primeiro + último frame | ✗ | $7.0 (1080p $7.7 · 4k $4.0) |
| 2.0-fast | 480p-720p | 4-15s (+automática) | ✓ | primeiro + último frame | ✗ | $5.6 |
| 2.0-mini | 480p-720p | 4-15s (+automática) | ✓ | primeiro + último frame | ✗ | $3.5 |
| 1.5-pro | 480p-1080p | 4-12s (+automática) | ativável ($1.2 / $2.4) | primeiro + último frame | ✓ | $1.2-2.4 |
| 1.0-pro-fast | 480p-1080p | 2-12s | ✗ | somente o primeiro frame | ✓ | $1.0 |
Há três particularidades que afetam a escolha. A reprodutibilidade está disponível justamente nos modelos mais baratos: seed e camera_fixed existem apenas na linha 1.x, enquanto o modelo principal não oferece esses controles. Os campos aceitos também são restritos por modelo. Enviar generate_audio para um modelo 1.0 retorna um erro 400 identificado como extension_not_supported. Portanto, monte a requisição com base na lista de recursos de cada modelo, em vez de reutilizar o mesmo formato para todos. Além disso, somente o 1.0-pro-fast aceita clipes de 2 segundos. Por isso, as medições da fórmula abaixo usam esse modelo com mais frequência; todos os modelos mais novos começam em 4 segundos. Além dos recursos da tabela, os modelos 2.0 também aceitam arquivos de referência no serviço upstream, com até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio, quando a plataforma expõe esse recurso.
Como chamar a API Seedance?
A geração de vídeo usa uma API assíncrona de jobs. Um POST cria a tarefa e retorna em cerca de dois segundos. Depois, basta consultar a URL da tarefa até a conclusão. O fluxo completo em Python é este:
import os, time, requests
BASE = "https://synthorai.io/v1"
auth = {"Authorization": f"Bearer {os.environ['SYNTHORAI_API_KEY']}"}
task = requests.post(f"{BASE}/videos", headers=auth, json={
"model": "seedance-1-5-pro-251215",
"prompt": "A paper boat drifting across a rain puddle, cinematic",
"resolution": "720p", "ratio": "16:9",
"duration": 5, "generate_audio": True,
}).json() # returns in ~2s: {"id": "vid_...", "status": "queued", ...}
while task["status"] not in ("completed", "failed", "cancelled"):
time.sleep(8)
task = requests.get(f"{BASE}/videos/{task['id']}", headers=auth).json()
print(task["data"][0]["url"]) # signed MP4, valid 24h
print(task["usage"]["total_tokens"]) # the billing meter this post is about
Se preferir aguardar em vez de fazer polling, envie o header Prefer: wait=60 na criação. A resposta fica aberta até o clipe terminar ou o prazo expirar. Se expirar, ela volta ao objeto usado para polling. Nas nossas execuções, a geração dos clipes em 480p e 720p levou de 20 segundos a pouco mais de dois minutos. O campo usage.total_tokens da tarefa concluída é o medidor usado para cobrança. O restante deste artigo explica o que determina esse valor.
O que é exatamente um token de vídeo?
Um token de vídeo representa uma porção fixa de pixels de saída ao longo do tempo. A quantidade faturada é W × H × frames / 1024, em que o número de frames é 24 × seconds + 1. W×H corresponde às dimensões reais do encoder, não ao rótulo da faixa de resolução. Derivamos os dois termos diretamente do medidor. Em cada resolução, as quantidades faturadas para três durações formam uma linha reta com resíduo zero. A inclinação da linha fornece os tokens por segundo. O intercepto corresponde, em todas as resoluções, a exatamente um frame em tokens: 405 em 480p, 858 em 720p e 2,040 em 1080p. Ao resolver as inclinações para W×H, chegamos às grades reais de codificação:
| Faixa nominal | Dimensões codificadas (medidas) | Tokens por segundo | Um frame adicional |
|---|---|---|---|
| 480p | 864×480 (linha 1.0) / 864×496 (linhas 1.5/2.0) | 9,720 / 10,044 | 405 / 418 |
| 720p | 1248×704 (não 1280×720) | 20,592 | 858 |
| 1080p | 1920×1088 (não 1920×1080) | 48,960 | 2,040 |
| 4k | 3840×2160 (nominal = codificada) | 194,400 | 8,100 |
Há uma validação independente. O exemplo de cálculo da ByteDance amplamente divulgado para a 2.0, um clipe de 15 segundos com cerca de 308,880 tokens, equivale exatamente a 15 vezes nossa taxa medida em 720p. Isso confirma que a grade de 720p também vale fora da linha 1.0 usada no ajuste, embora o cálculo de marketing omita o frame adicional.
Disso saem duas consequências práticas. A proporção de tela não altera a cobrança: 16:9 e 9:16 consumiram a mesma quantidade de tokens nos nove pares testados. Portanto, gerar vídeo vertical não custa mais. Além disso, a aproximação muito citada W × H × 24 × duration / 1024 fica um frame abaixo e usa dimensões incorretas. É por isso que estimativas de terceiros se afastam alguns pontos percentuais das faturas reais.
Quanto a Seedance realmente custa por segundo?
Multiplicando as taxas de tokens medidas pela tarifa de cada faixa, todo o catálogo se resume à tabela abaixo:
| Modelo @ resolução | $/segundo (tokens medidos × tarifa de tabela) |
|---|---|
| seedance-1.0-pro-fast @ 480p | $0.0097 |
| seedance-1.5-pro @ 480p, sem áudio | $0.0121 |
| seedance-1.0-pro-fast @ 720p | $0.0206 |
| seedance-1.5-pro @ 480p, com áudio | $0.0241 |
| seedance-2.0-mini @ 480p | $0.0352 |
| seedance-1.0-pro-fast @ 1080p | $0.0490 |
| seedance-2.0-fast @ 480p | $0.0563 |
| seedance-2.0 @ 480p | $0.0703 |
| seedance-2.0 @ 4k | $0.778 |
Para comparar com os preços de tabela de julho de 2026 dos serviços que cobram por segundo, conforme compilado por rastreadores públicos de preços: Kling custa cerca de $0.07/s, Sora 2 cerca de $0.10/s e Veo 3.1 cerca de $0.40/s. A Seedance 2.0 em 480p fica no mesmo patamar da Kling, incluindo áudio multifaixa nativo. A faixa 1.0-fast gera vídeo 480p assistível por cerca de um sétimo da tarifa da Kling. Um clipe de 15 segundos em 720p custa aproximadamente $2.17 na 2.0; o mesmo clipe sai por $0.31 na 1.0-pro-fast.
4k é mais barato? A tabela diz que sim, mas a fatura diz que não
Na Seedance 2.0, 4k tem a menor tarifa por token: $4.0 por milhão, contra $7.7 em 1080p. Mesmo assim, é a opção mais cara do catálogo. O motivo está na fórmula. 4k gera cerca de quatro vezes mais tokens por segundo que 1080p, 194,400 contra 48,960. Assim, a tarifa menor resulta em um custo por segundo 2.1x maior: $0.778/s contra $0.377/s. Nossa medição de referência em 4k, com 4 segundos, consumiu 785,700 tokens e custou $3.14. Ao analisar uma tabela de preços por token, coloque ao lado os tokens por segundo de cada resolução. Em vídeo cobrado por token, a menor tarifa pode gerar a maior fatura.
O que generate_audio altera?
A tarifa, não os tokens. Na 1.5-pro, o mesmo clipe de 5 segundos consumiu 50,638 tokens com áudio e 50,638 sem áudio. A tarifa dobra de $1.2/M sem áudio para $2.4/M com áudio. Portanto, a saída com trilha custa exatamente 2x, sem qualquer sobretaxa oculta de tokens. Na linha 2.0, o áudio já faz parte da tarifa única do modelo, sem cálculo adicional por ativação. Se o seu pipeline já adiciona a própria trilha sonora, a 1.5-pro sem áudio, a $0.0121/s, é a opção econômica menos óbvia do catálogo.
Como funciona a cobrança de vídeo assíncrono?
A cobrança acompanha o ciclo de vida da tarefa mostrado acima. Ela acontece uma única vez, quando a tarefa aparece como concluída pela primeira vez, independentemente da quantidade de consultas. O cancelamento respeita o estado real do processamento: uma tarefa ainda na fila pode ser cancelada sem cobrança, mas, depois que a execução começa, o serviço upstream rejeita a exclusão com 409 e é preciso aguardar o resultado. Gerações com falha não são cobradas.
Três observações operacionais das 27 tarefas executadas. Primeiro, as respostas de vídeo incluem o uso de tokens, mas não incluem um campo de custo, ao contrário de usage.cost nas respostas de chat. Para controlar o orçamento, multiplique os tokens pela tarifa da faixa usada. Segundo, o resultado é entregue por uma URL assinada com validade de 24 horas; copie o arquivo rapidamente para o seu próprio storage. Terceiro, limite o ritmo de criação: a plataforma permite 6 tarefas de vídeo por workspace por minuto. Como cada tarefa pendente reserva no saldo o pior custo possível, uma rajada de criações durante uma lentidão no serviço upstream pode gerar temporariamente uma resposta de quota insuficiente, mesmo que o gasto final caiba no saldo.
Perguntas frequentes
A API Seedance 2.0 está realmente disponível?
Sim. As limitações do início de 2026, como credenciais chinesas, listas de espera e liberação gradual, já ficaram para trás. A família completa, incluindo a 2.0, está disponível no endpoint /v1/videos do gateway da Synthorai pelos preços de tabela da ByteDance. Consulte as páginas dos modelos: Seedance 2.0, 1.5-pro e 1.0-pro-fast. Várias outras plataformas também oferecem esses modelos. Se uma página disser que a Seedance 2.0 está restrita a quotas de experimentação, ela é anterior ao lançamento da API.
Por que os preços da Seedance variam tanto entre provedores?
A maioria dos revendedores converte a cobrança por token em um preço fixo por segundo ou por clipe, aplicando a própria margem e arredondamentos. Essa conversão esconde o cálculo de tokens, que depende da resolução e da duração. A fórmula deste artigo é a base de qualquer cotação: calcule W × H × (24s + 1) / 1024 com as dimensões codificadas e multiplique pela tarifa oficial. Assim, é possível calcular com precisão a margem de qualquer provedor.
Proporção de tela ou formato vertical custa mais?
Não. 16:9 e 9:16 consumiram a mesma quantidade de tokens em todas as resoluções e durações testadas. Somente resolução e duração alteram o medidor, e o custo cresce de forma exatamente linear com a duração.
E a Seedance 2.5?
Foi anunciada, mas ainda não está disponível nas APIs que monitoramos. A fórmula de tokens e a relação entre faixa e tarifa provavelmente serão mantidas. Quando o modelo chegar, repetiremos as mesmas medições.
Medido em 2026-07-22/23: 27 gerações concluídas em cinco modelos Seedance pelo endpoint /v1/videos; quantidades de tokens obtidas nos registros de uso de cada tarefa; tarifas da tabela da ByteDance; matriz de recursos do catálogo ativo em /v1/videos/models. Os valores por segundo dos concorrentes são preços de tabela, não medições. A fórmula se ajusta exatamente a todos os pontos medidos. Como as dimensões codificadas foram derivadas do medidor, confirme-as novamente caso a ByteDance altere os encoders. Outros artigos da série por modalidade: geração de imagens, transcrição de áudio, sessões de voz e tokens de texto.