In February 2026, ByteDance dropped Seedance 2.0. Within 24 hours it was everywhere, because a filmmaker generated a Hollywood-quality fight scene with a two-line prompt. The Deadpool screenwriter saw it and publicly posted that it was likely over for screenwriters. Elon Musk replied. The Motion Picture Association issued a formal statement the same day. ByteDance pulled the ability to generate real celebrity likenesses, tightened the guardrails, and the internet held its breath wondering if the model had been gutted in the process.
Não foi. A capacidade por trás disso, a ação, a física, o movimento, a atuação emocional, tudo sobreviveu intacto. E, sinceramente, essas conversas precisam acontecer. A IA generativa está avançando mais rápido do que qualquer estrutura legal consegue acompanhar, e a forma como a indústria lida com isso importa. Mas esse é um outro vídeo. O que podemos te dizer é que o Seedance 2.0 é o modelo de vídeo mais capaz do mercado neste momento, e ele está no ar na OpenArt.
Ermin Monzon, nosso Head de Conteúdo, Mídia e Educação, explicou por que o modelo faz diferença do ponto de vista técnico. Nosso criador interno Bob testou ao limite todos os tipos de referência que conseguiu imaginar. E nossa colaboradora Mia Meow montou um guia de fluxo de trabalho com 10 dicas depois de semanas de testes. Este Manual reúne o melhor material dos três para te dar uma visão completa.
O que o Seedance 2.0 pode fazer → visão geral do Ermin
Antes de irmos para as dicas de fluxo de trabalho, vale entender por que esse modelo está gerando a reação que gera. Ermin passou por uma série de demos que mostram onde o Seedance 2.0 se distancia de tudo o que existe no mercado.
The fight scene that broke the internet is the obvious headline, but the demo that surprised Ermin more was a dancer with neon light trails sweeping around them in orbital arcs. It looks like a Nike commercial or a music video with a serious production budget. The reason this is technically significant is that the light trails are not composited over the dancer. The model generated both simultaneously. The motion and the effect interact with each other: the trails bend around the dancer's body, and the lighting from the trails actually reflects on the floor beneath them. That is called coherent VFX generation. The model understands that light behaves physically. It does not just paint glowing lines on top of video. For anyone doing music video content, UGC ads, or anything with a visual effects component, this is where Seedance 2.0 stands apart.
Outra demo que vale a pena ver: um esquiador saltando de uma montanha com uma cordilheira alpina preenchendo o fundo. A física do spray de neve, a rotação do corpo, a aterrissagem. Tudo gerado, tudo fisicamente plausível. O modelo lida com ação e movimento num nível que nenhuma outra ferramenta disponível ao público está atingindo hoje.
Texto para vídeo: a estrutura de prompt em plano único → 0:50 no vídeo da Mia
Tudo o que você ouve nas demos de texto para vídeo da Mia, o áudio, o som ambiente, foi gerado ao mesmo tempo que o vídeo. Um prompt, uma tomada. Outros modelos têm dificuldade em segurar tantos detalhes numa única geração. O Seedance 2.0 realmente segue o que você pede.
A estrutura de prompt da Mia para planos únicos é simples. Comece com "continuous single take" e as ações da câmera. Depois descreva o que a câmera vê enquanto se move. Termine com palavras-chave de controle e estilo: no cuts, seamless transition, cinematic, high definition. Só essa fórmula já vai te dar ótimos resultados.
Para cenas mais complexas, como um sequência de luta em 2:13, Mia recommends starting with a clear beginning and end state. Describe the fight scene, describe how it ends (everyone on the ground, for example), and let the model fill the middle. She also found that describing specific camera angles creates a more cinematic feel, and adding a film genre reference to the end of the prompt helps set the visual tone. One thing she discovered through iteration: if you describe your characters physically in the prompt rather than leaving it vague, the model does a better job designing the scene and keeping characters visually distinct.
A principal dica de Mia sobre prompts: o modelo foi bem treinado em linguagem cinematográfica. Termos como "tracking shot", "crane shot", "whip pan" e referências de gênero como "filme de guerra cru" ou "thriller neo-noir" fazem toda a diferença.

O tutorial completo da Mia cobre todas as 10 dicas do fluxo de trabalho dela, incluindo as que resumimos ao longo deste Manual. Assista junto ou volte a ele mais tarde.
O sistema de referências: marcar imagens, vídeo e áudio no seu prompt → 4:27 no vídeo da Mia · → Mergulho nas referências do Bob
Essa é a mecânica central que move tudo o mais no Seedance 2.0 na OpenArt, e assim que você entender isso, cada seção seguinte fará mais sentido.
A ideia é simples: você pode enviar imagens, vídeos e arquivos de áudio como referências e depois marcá-los diretamente no seu prompt de texto usando o símbolo @. Digite @ e escolha qual arquivo enviado você quer referenciar. A partir daí, diga ao modelo exatamente o que fazer com cada um. Use o rosto da imagem um. Use o movimento de câmera do vídeo um. Faça lip sync com o áudio um. O modelo lê seu prompt, olha os arquivos marcados e combina tudo em uma única geração.
da Mia tutorial multimodal em 4:27 é a explicação mais clara de como isso funciona. Ela enviou um vídeo de dança, duas imagens de personagens e uma música, então disse ao modelo para usar o vídeo como referência de movimento de câmera, a imagem um como a dançarina da esquerda, a imagem dois como a dançarina da direita e o áudio como música de fundo. Tudo marcado com @, tudo em um único prompt.
Bob pushed this further. In one of his demos, he referenced four different files in a single prompt: the face from image one, the overalls from image three, the shirt from image four, and a location from a reference video. The prompt was: the man in image one is walking down the street from the video wearing the overalls from image three and carrying the shirt from image four, talking to the camera. The model held consistency across every element. That is a remarkable amount of compositing happening from a single text prompt.

Algumas coisas que os dois criadores aprenderam sobre como as referências se comportam:
Se o seu vídeo de referência tiver áudio e você também marcar um arquivo de áudio separado, o modelo tende a favorecer o áudio já existente no vídeo em vez da trilha que você enviou. A solução da Mia: envie o vídeo sem áudio se quiser que sua própria música ou narração tenha prioridade.
As referências não se limitam a elementos concretos. Você também pode apontar para um vídeo e dizer "quero só que fique parecido com isso" sem copiar mais nada. Bob usou isso para transferir um estilo visual (lente olho de peixe, luz piscando) de um vídeo para uma cena totalmente nova.
Você não precisa usar todos os tipos de referência de uma vez. Uma única imagem de personagem em um prompt de texto é um uso perfeitamente válido do sistema. O poder aumenta conforme você adiciona mais elementos, mas funciona bem em qualquer nível de complexidade.

Sincronia labial, voz e performance → 7:57 no vídeo da Mia · → Análise aprofundada de áudio do Bob
O vídeo completo do Bob aborda em profundidade referências em imagens, áudio e vídeo. As partes sobre sincronização labial e clonagem de voz são onde ele realmente brilha.
Esta é a seção com mais dicas dos mais criadores, e por um bom motivo. Os recursos de áudio do Seedance 2.0 são o que o separa de tudo o que existe no mercado hoje.
O truque de transcrição do Bob
Esta é a dica mais útil dos três vídeos. Quando você faz sincronia labial com uma referência de áudio, inclua a transcrição real das palavras no seu prompt junto com o arquivo de áudio. Veja por quê.
Bob tested this with a clip of himself talking to camera. In his first attempt, he tagged the audio file and described the scene but did not include the exact words being spoken. The model listened to the audio and tried to replicate it, but got details wrong ("CGI 2.0" instead of "Seedance 2.0"). When he modified the prompt to explicitly spell out the words being said, the audio file combined with the written transcript produced dramatically better results. The lip sync was tighter, the words were accurate, and the overall performance was more convincing.

A lição é: sempre que for fazer lip sync, forneça a transcrição real junto com o arquivo de áudio. É quase garantido que você terá um resultado melhor.
Combine a duração do áudio com a duração do vídeo
A Mia aprendeu isso do jeito difícil. Se o seu áudio de referência tem 11 segundos e você define o vídeo para 15 segundos, o modelo é forçado a esticar ou comprimir o áudio para caber, e você quase certamente vai perder a sincronia. Sempre combine a duração configurada com o tamanho real do seu arquivo de áudio.
Clonagem de voz
Bob demonstrou a clonagem de voz com um clipe de 15 segundos da voz do Ermin (o Tio Monz lá pelo escritório da OpenArt). O processo: grave cerca de 15 segundos de uma voz de um jeito que capture as qualidades que você quer duplicar. Marque esse áudio como referência de voz, e não como fonte de sincronia labial. Depois escreva a fala real no prompt, e o modelo gera uma nova fala naquela voz.
A primeira tentativa ficou rápida demais para a cadência natural do Ermin. O Bob deu ao modelo 14 segundos completos em vez de 9, e o resultado ficou muito mais parecido com o jeito como o Ermin realmente falaria. A lição: o ritmo importa tanto quanto a amostra de voz. Dê ao modelo tempo suficiente para pronunciar as palavras na velocidade certa para aquela voz.
Você pode reutilizar a mesma referência de voz em vários vídeos para manter a consistência vocal de um personagem.
Dicas da Mia para dirigir a performance → 12:20 no vídeo da Mia
Mia descobriu que dá para dirigir a performance emocional e a energia de um personagem pelo próprio prompt. As palavras que você escreve influenciam como o personagem entrega a fala, não só o que ele diz. Se você escreve "ele diz isso animado", a linguagem corporal e a energia vocal do personagem mudam. Se você escreve "ela sussurra nervosa", toda a performance muda.
Isso também vale para vários personagens na mesma cena. Em 11:10 no vídeo da Mia, ela demonstra dar a dois personagens personalidades vocais e estados emocionais diferentes em um único prompt, e o modelo os mantém distintos.
A dica de proteção negativa da Mia
Quando você quer transições limpas de uma cena para outra, sem morphing entre elas (por exemplo, ao narrar quatro imagens diferentes), a Mia aprendeu a adicionar barreiras negativas ao prompt: "no morphing, no ghosting, no camera cuts". Sem isso, o modelo às vezes mistura as cenas de formas que parecem falhas visuais. Com essas barreiras, você obtém transições nítidas de uma cena para a próxima.

Referências avançadas: movimento, storyboards e estilo → 13:22 no vídeo da Mia · → Referências de vídeo do Bob
Depois que você entende como o sistema de referência funciona para rostos e vozes, veja o que mais dá para apontar para ele.
Transferência de movimento e câmera
Se você tem uma cena em que gostou de como a câmera se move, dá para transferir esse movimento de câmera para uma cena totalmente nova. Bob demonstrou isso com um vídeo de um cachorro pulando enquanto a câmera fazia um dolly ao redor dele. Ele trouxe esse vídeo como referência e disse "use esse vídeo como referência para o movimento da câmera e do personagem para guiar um espantalho pulando num trampolim." O resultado transferiu tanto o dolly da câmera quanto a ação de pular para o novo personagem e a nova cena.
Ele também mostrou transferência de movimento com filmagem real. Usando um clipe da Emily correndo em 19:15, ele disse "substitua a mulher do vídeo um pelo homem da imagem um e está nevando." O modelo trocou o personagem, adicionou clima de inverno e manteve o movimento de corrida intacto. Alguns detalhes do fundo mudaram (a atmosfera geral ficou cinza e invernal), mas o movimento central se manteve.
Character Swap Split Screen LRB.mp4
Do storyboard ao vídeo → 13:22 no vídeo da Mia
Você pode enviar uma grade em estilo de painéis de quadrinhos ou um storyboard, e o modelo vai tentar animar painel por painel. A Mia testou isso com uma grade desenhada à mão e descobriu que o modelo seguiu os painéis em ordem, mas a lógica de direção entre os painéis nem sempre ficava óbvia para o modelo apenas pelos elementos visuais.
Duas dicas que fizeram isso funcionar melhor. Primeiro, descreva a lógica narrativa entre os quadros no seu prompt. O modelo precisa entender a progressão da história, não só a sequência visual. Segundo, se o seu storyboard tem texto ou legendas, adicione "text overlay no captions on screen" ao prompt para evitar que o texto vaze para o vídeo gerado.
A Mia também observa que você pode usar páginas reais de quadrinhos para isso, mas tome cuidado com qualquer coisa que envolva propriedade intelectual existente.
Referências de estilo e replicação de templates → 14:45 no vídeo da Mia
Mia's template replication tip is a practical one for anyone producing content at volume. If you have a video with a visual style you like, you can reference it and tell the model to replicate just the style, not the content. She tested this by pointing to a video and saying she only wanted the fisheye lens effect and the flickering double-exposure look, then combined it with character images and outfit references to create a fashion sequence. The model picked up the abstract visual qualities without copying the specific content of the reference video.
Isso é útil para manter uma identidade visual consistente em uma série de vídeos. Crie um vídeo de que você goste e use o estilo dele como referência para todas as gerações seguintes.
Pós-geração: estender e editar → 16:06 no vídeo da Mia
Um vídeo não está pronto assim que é gerado. O Seedance 2.0 permite estender, editar e reescrever depois.

Estender. Envie um vídeo que você quer continuar, escolha estender para frente (ou para trás), especifique quantos segundos, ajuste a duração para combinar e descreva o que você quer que aconteça na nova parte. A Mia estendeu um vídeo 10 segundos para frente, depois estendeu 10 segundos para trás e juntou tudo em uma cena contínua mais longa que o limite de 15 segundos de geração. Isso é um verdadeiro desbloqueio. O limite de 15 segundos costumava ser um teto rígido. Agora você pode continuar construindo cenas contínuas mais longas sem cortes.
Editar. Se você quiser mudar algo que já aconteceu em um vídeo gerado, pode conversar com o modelo sobre o vídeo existente e dizer o que alterar. Isso funciona de forma parecida com a edição vídeo a vídeo do Wan 2.7, mas com a compreensão mais avançada do Seedance 2.0 sobre o que está na cena.
Em resumo
Seedance 2.0 is the most capable video model available on OpenArt right now, and the reference system is the reason to pay attention. The ability to tag images, video, and audio into a single prompt and have the model hold consistency across all of them is not something any other model is doing at this level. The lip sync is strong. The voice cloning works. The motion transfer is clean. The coherent VFX generation, where lighting and effects actually interact with the scene physically, is new territory entirely.
Três criadores, três vídeos, uma conclusão em comum: este modelo escuta. Ele segue prompts complexos, com múltiplos elementos, melhor do que qualquer outro por aí. A melhor coisa que você pode fazer é começar a usá-lo e pedir o que você quer, porque ele tem uma imaginação incrível. Palavras do Bob, e ele está certo.