🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
Preços da API Seedance, medidos: a fórmula de tokens de vídeo, resolvida

Preços da API Seedance, medidos: a fórmula de tokens de vídeo, resolvida

Conteúdo
  1. Qual modelo Seedance faz o quê?
  2. Como se chama a API da Seedance?
  3. O que é um token de vídeo, exatamente?
  4. Quanto custa por segundo, na prática, o Seedance?
  5. O 4k é mais barato? A tabela diz que sim, a fatura diz que não
  6. O que o generate_audio muda?
  7. Como funciona a cobrança de vídeo assíncrono?
  8. FAQ

A Seedance cobra vídeo por tokens, e a fórmula que realmente bate com o medidor é encoded_width × encoded_height × (24 × seconds + 1) / 1024. Duas partes dela não estão em nenhuma documentação que conseguimos encontrar: o frame +1 e o fato de que as dimensões codificadas não são as nominais (720p é cobrado como 1248×704, não 1280×720). Rodamos 27 gerações em cinco modelos Seedance e em todos os níveis de resolução, e cada contagem de tokens cobrada bate com essa fórmula até o token. Este post mapeia a família, mostra a API de duas requisições, e depois dá a fórmula resolvida, a escala de preço por segundo que resulta dela, e os dois pontos em que a tabela de preços engana.

TL;DR

  • Tokens de vídeo Seedance = largura codificada × altura × (24 × segundos + 1) / 1024; o frame +1 e as dimensões codificadas foram medidos, não estão documentados.
  • 720p é cobrado como 1248×704 e 1080p como 1920×1088; a proporção não muda nada.
  • O mesmo clipe de 4 segundos cobrou tokens idênticos em todos os níveis a partir do 1.5-pro; as tarifas vão de US$ 1,0 a US$ 7,0 por milhão.
  • A tarifa de US$ 4,0/M do 4k é menor que os US$ 7,7/M do 1080p, mas custa US$ 0,78 por segundo contra US$ 0,38 — 2,1x mais.
  • generate_audio não altera os tokens e dobra a tarifa no 1.5-pro.

Tudo abaixo foi medido em 22/07/2026 pelo endpoint /v1/videos do gateway da Synthorai, onde a família Seedance está no ar pelos preços de tabela da ByteDance; os registros brutos por tarefa sustentam cada número.

Qual modelo Seedance faz o quê?

A escolha do nível muda a tarifa, nunca o medidor: escolha pela capacidade e deixe as próximas seções tratarem do preço. O mesmo prompt de 4 segundos em 480p cobrou tokens idênticos no Seedance 2.0, 2.0-fast, 2.0-mini e 1.5-pro (40.594 cada; o 1.0-pro-fast cobrou 39.285 na sua grade de pixels um pouco menor). O que você paga ao subir na escala é capacidade, e a família distribui isso de forma desigual:

ResoluçõesDuraçãoÁudioEntrada de imagemseed / camera_fixedTarifa (US$/M tokens)
2.0480p-4k4-15s (+auto)✓ nativoprimeiro + último frameUS$ 7,0 (1080p US$ 7,7 · 4k US$ 4,0)
2.0-fast480p-720p4-15s (+auto)primeiro + último frameUS$ 5,6
2.0-mini480p-720p4-15s (+auto)primeiro + último frameUS$ 3,5
1.5-pro480p-1080p4-12s (+auto)toggle (US$ 1,2 / US$ 2,4)primeiro + último frameUS$ 1,2-2,4
1.0-pro-fast480p-1080p2-12sapenas primeiro frameUS$ 1,0

Três detalhes que valem conhecer antes de escolher. A reprodutibilidade corre no sentido errado: seed e camera_fixed só existem nos modelos 1.x, então os níveis mais baratos são os controláveis e o flagship não é. Os campos de capacidade têm gate rígido por modelo: enviar generate_audio para um modelo 1.0 retorna um 400 nomeado (extension_not_supported), então monte as requisições a partir da lista de capacidades de cada modelo, e não de um formato único compartilhado. E só o 1.0-pro-fast desce a clipes de 2 segundos, e é por isso que as medições da fórmula abaixo se apoiam nele; tudo mais novo começa em 4 segundos. Além da tabela, os modelos 2.0 também aceitam entrada de arquivo de referência a montante (até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio) onde a plataforma expõe isso.

Como se chama a API da Seedance?

Geração de vídeo é uma API de job assíncrono: um POST cria a tarefa e retorna em cerca de dois segundos, e depois você faz polling da URL da tarefa até ela terminar. Todo o fluxo em Python:

import os, time, requests

BASE = "https://synthorai.io/v1"
auth = {"Authorization": f"Bearer {os.environ['SYNTHORAI_API_KEY']}"}

task = requests.post(f"{BASE}/videos", headers=auth, json={
    "model": "seedance-1-5-pro-251215",
    "prompt": "A paper boat drifting across a rain puddle, cinematic",
    "resolution": "720p", "ratio": "16:9",
    "duration": 5, "generate_audio": True,
}).json()                                    # returns in ~2s: {"id": "vid_...", "status": "queued", ...}

while task["status"] not in ("completed", "failed", "cancelled"):
    time.sleep(8)
    task = requests.get(f"{BASE}/videos/{task['id']}", headers=auth).json()

print(task["data"][0]["url"])                # signed MP4, valid 24h
print(task["usage"]["total_tokens"])         # the billing meter this post is about

Se você preferir bloquear em vez de fazer polling, envie o header Prefer: wait=60 no create e a resposta fica pendurada até o clipe terminar ou a janela expirar, momento em que ela volta para o objeto de polling. A geração em si levou de 20 segundos a pouco mais de dois minutos para os clipes de 480p e 720p nos nossos testes. O campo usage.total_tokens da tarefa concluída é o medidor de cobrança, e o resto deste post é sobre o que determina esse valor.

O que é um token de vídeo, exatamente?

Um token de vídeo é uma fatia fixa de pixels de saída ao longo do tempo: a contagem cobrada é W × H × frames / 1024, onde a quantidade de frames é 24 × seconds + 1 e W×H são as dimensões reais do encoder, não o rótulo do tier de resolução. Recuperamos os dois termos a partir do próprio medidor. As contagens de tokens cobradas em três durações para cada resolução formam uma reta com resíduo zero; a inclinação da reta dá os tokens por segundo, e seu intercepto, em toda resolução, equivale exatamente aos tokens de um frame (405 em 480p, 858 em 720p, 2.040 em 1080p). Resolvendo as inclinações para W×H, chegamos às grades reais de codificação:

Tier nominalDimensões codificadas (medidas)Tokens por segundoUm frame extra
480p864×480 (série 1.0) / 864×496 (série 1.5/2.0)9.720 / 10.044405 / 418
720p1248×704 (não 1280×720)20.592858
1080p1920×1088 (não 1920×1080)48.9602.040
4k3840×2160 (nominal = codificado)194.4008.100

Uma verificação cruzada independente: o exemplo prático da ByteDance para o 2.0, muito difundido, um clipe de 15 segundos com cerca de 308.880 tokens, é exatamente 15 vezes a nossa taxa medida para 720p, ou seja, a grade de 720p vale além da série 1.0 sobre a qual a ajustamos (e a conta de marketing deles ignora o frame +1).

Duas consequências práticas. A proporção não muda a conta: 16:9 e 9:16 cobraram tokens idênticos em todos os nove pares de testes, então saída vertical não é uma decisão de custo. E a aproximação amplamente citada W × H × 24 × duration / 1024 erra para menos por um frame e usa as dimensões erradas, o que explica por que estimativas de terceiros divergem alguns por cento das faturas reais.

Quanto custa por segundo, na prática, o Seedance?

Multiplique as taxas de tokens medidas pela tarifa de tabela de cada tier e todo o catálogo se resume a uma única escada:

Modelo @ resoluçãoUS$/segundo (tokens medidos × tarifa de tabela)
seedance-1.0-pro-fast @ 480p$0.0097
seedance-1.5-pro @ 480p, sem áudio$0.0121
seedance-1.0-pro-fast @ 720p$0.0206
seedance-1.5-pro @ 480p, com áudio$0.0241
seedance-2.0-mini @ 480p$0.0352
seedance-1.0-pro-fast @ 1080p$0.0490
seedance-2.0-fast @ 480p$0.0563
seedance-2.0 @ 480p$0.0703
seedance-2.0 @ 4k$0.778

Para efeito de comparação com os preços de tabela de julho de 2026 de quem cobra por segundo (conforme agregado por rastreadores públicos de preços): o Kling fica em torno de $0.07/s, o Sora 2 em torno de $0.10/s e o Veo 3.1 em torno de $0.40/s. O Seedance 2.0 a 480p está no mesmo patamar de preço do Kling, mas já inclui áudio multi-track nativo, e o tier 1.0-fast gera 480p assistível por cerca de um sétimo da tarifa do Kling. Um clipe de 15 segundos em 720p no 2.0 sai por volta de $2.17; o mesmo clipe no 1.0-pro-fast custa $0.31.

O 4k é mais barato? A tabela diz que sim, a fatura diz que não

O 4k tem a menor tarifa por token no Seedance 2.0, $4.0 por milhão contra $7.7 do 1080p, e mesmo assim é a opção mais cara do cardápio. O motivo está na fórmula: o 4k emite cerca de quatro vezes mais tokens por segundo que o 1080p (194.400 contra 48.960), então a tarifa mais barata compra um custo por segundo 2,1x maior, $0.778/s contra $0.377/s. Nosso teste de referência de 4 segundos em 4k faturou 785.700 tokens, $3.14 por quatro segundos de vídeo. Leia qualquer tabela de tarifas por token junto com os tokens por segundo daquela resolução; em vídeo cobrado por token, o preço de tabela e a fatura podem apontar em direções opostas.

O que o generate_audio muda?

A tarifa, não os tokens. No 1.5-pro, o mesmo clipe de 5 segundos faturou 50.638 tokens com áudio ligado e 50.638 com ele desligado; a tarifa de tabela dobra, de $1.2/M sem som para $2.4/M com áudio, então a saída com trilha sonora custa exatamente 2x, sem pegadinha, sem sobretaxa oculta de tokens. Na série 2.0, o áudio faz parte da tarifa única do modelo, então não há conta de toggle a fazer. Se o seu pipeline já adiciona a própria trilha de fundo de qualquer jeito, o 1.5-pro sem som a $0.0121/s é a pechincha silenciosa do catálogo.

Como funciona a cobrança de vídeo assíncrono?

A cobrança se prende ao ciclo de vida da task que você viu acima: a fatura chega uma vez só, quando a task reporta completed pela primeira vez, não importa quantas vezes você faça polling. O cancelamento é honesto quanto à física: uma task na fila cancela sem problema e não é cobrada, mas assim que a task está running o upstream rejeita a exclusão (409) e você espera pelo resultado. Gerações que falham não são cobradas.

Três observações operacionais de rodar 27 tasks. Primeiro, as respostas de vídeo trazem o uso de tokens, mas nenhum campo de custo, ao contrário do usage.cost do chat; faça o orçamento como tokens × a tarifa do seu tier. Segundo, a saída chega como uma URL assinada com validade de 24 horas; mova o arquivo para o seu próprio storage o quanto antes. Terceiro, controle o ritmo dos creates: a plataforma permite 6 tasks de vídeo por workspace por minuto, e como cada task pendente reserva o custo de pior caso contra o seu saldo, disparar creates em rajada durante uma lentidão do upstream pode esbarrar em uma resposta temporária de quota insuficiente, mesmo que o gasto final caiba tranquilamente.

FAQ

A API do Seedance 2.0 já está disponível de verdade?

Sim. Aquela história de acesso do início de 2026 (credenciais chinesas, listas de espera, rollout escalonado) já está desatualizada: toda a família, incluindo a 2.0, está no ar no endpoint /v1/videos do gateway da Synthorai, aos preços de tabela da ByteDance (páginas dos modelos: Seedance 2.0, 1.5-pro, 1.0-pro-fast), e várias outras plataformas também a oferecem. Se alguma página diz que o Seedance 2.0 é só por cota de experiência, ela é anterior ao rollout da API.

Por que os preços do Seedance variam tanto entre os provedores?

Porque a maioria dos revendedores converte o faturamento por token em preços fixos por segundo ou por clipe, com sua própria margem e arredondamento, e essa conversão esconde a matemática de tokens que depende de resolução e duração. A fórmula deste post é a verdade fundamental por trás de qualquer cotação: calcule W × H × (24s + 1) / 1024 com as dimensões codificadas e multiplique pela taxa oficial; assim você consegue precificar o markup de qualquer provedor com precisão.

Aspect ratio ou formato vertical custa mais?

Não. 16:9 e 9:16 faturaram tokens idênticos em todas as resoluções e durações que testamos. Resolução e duração são as únicas alavancas que movem o medidor, e a duração é exatamente linear.

E o Seedance 2.5?

Anunciado, mas ainda não disponível nas APIs que acompanhamos. A fórmula de tokens e a estrutura de tier versus taxa são as partes que provavelmente se mantêm; quando ele chegar, vamos rodar as mesmas sondagens de novo.

Medido em 2026-07-22/23: 27 gerações concluídas em cinco modelos Seedance via /v1/videos, contagens de tokens a partir dos registros de uso por tarefa, taxas da tabela da ByteDance e a matriz de capacidades a partir do catálogo ao vivo /v1/videos/models. Os números por segundo dos concorrentes são preços de tabela, não medições. Os ajustes da fórmula são exatos em cada ponto medido; as dimensões codificadas são recuperadas do medidor, então reconfira-as se a ByteDance mudar os encoders. Para o resto da série sobre modalidades: geração de imagem, speech-to-text, sessões de voz e tokens de texto.

← Voltar ao blog