Alternar tema

Criar vídeos no ComfyUI com Wan e AnimateDiff

Easton editorial illustration: one large rounded charcoal node-canvas console, one orange video filmstrip emerging from the workflow

"O tutorial oficial do ComfyUI para Wan 2.2 fornece workflows text-to-video e image-to-video, locais de modelos e opções de precisão."

Você já consegue gerar no ComfyUI uma imagem estática satisfatória e agora quer fazê-la se mover. Ao importar o workflow de vídeo, porém, surgem blocos vermelhos de Missing Nodes ou o uso de VRAM chega imediatamente a 99%. Qual rota usar, Wan ou AnimateDiff? Em quais pastas ficam os modelos? Como equilibrar frames e memória e transformar uma sequência de imagens em mp4? Comece pela escolha da rota, pela lista de preparação e por um orçamento conservador; depois investigue os erros mais comuns na ordem.

1. Escolher entre Wan e AnimateDiff

Defina a rota antes de montar o workflow. Wan e AnimateDiff são sistemas diferentes, com pré-requisitos, usos e complexidade distintos.

1.1 Wan: uma rota com modelo de vídeo dedicado

Wan 2.2 é uma família aberta de modelos de vídeo compatível com text-to-video (T2V), image-to-video (I2V) e text-image-to-video (TI2V). Usa arquitetura mixture-of-experts e seus próprios pesos, VAE e text encoder. Para alguns workflows FP8, o tutorial oficial do ComfyUI sugere partir de mais de 16 GB de VRAM; variantes na precisão original costumam exigir mais. Wan atende à criação de novos vídeos e a uma necessidade maior de consistência temporal.

O ecossistema Wan é separado de um checkpoint SD normal. Reúna todos os arquivos exigidos pelo workflow, como diffusion model, VAE e text encoder. Um clipe de dois a quatro segundos é um início prático.

1.2 AnimateDiff: adicionar movimento ao ecossistema SD

AnimateDiff adiciona movimento a modelos Stable Diffusion compatíveis, como SD 1.5 ou SDXL. O componente central é um motion module usado com um base checkpoint. Como a pasta pode mudar no AnimateDiff-Evolved, siga o README atual e a lista exibida pelo node. Um workflow típico carrega checkpoint SD e motion module compatível para gerar animação curta.

AnimateDiff funciona bem quando já existem checkpoints de estilo. Checkpoint e VAE podem ser reutilizados, mas duração e consistência dependem de base model, motion module, context, frames e resolução.

1.3 Tabela de decisão Wan vs AnimateDiff

CritérioWan 2.2AnimateDiff
TarefaText-to-video, image-to-video, text-image-to-videoAnimação curta baseada em modelo SD
EcossistemaModelo de vídeo dedicadoSD 1.5/SDXL
Início de VRAMAlguns workflows FP8 começam na classe de 16 GB; precisão original exige maisDepende de base model, motion module e ajustes; teste pequeno e curto
RequisitosWan diffusion model + VAE + text encoderCheckpoint SD + motion module
Uso indicadoNovo vídeo e maior necessidade de consistênciaModelos de estilo existentes e animações curtas
ComplexidadeAlta: vários modelos e nodesMédia: motion module mais base checkpoint

Escolha Wan quando quiser um clipe novo e aceitar uma pilha de modelos maior. Escolha AnimateDiff se já tiver um checkpoint SD compatível, precisar de uma animação curta ou quiser evitar um grande modelo de vídeo dedicado.

2. Preparar o workflow do Wan

Muitos testes falham na preparação: modelo na pasta errada, node ausente ou workflow para outra tarefa. Uma revisão breve evita corrigir cada erro depois de iniciar a queue.

2.1 Preparar os arquivos de modelo

Os arquivos Wan devem estar nos locais esperados. Pasta ou nome incorretos costumam deixar a lista de modelos vazia.

Pastas comuns:

PastaTipoObservação
models/diffusion_models/Modelo T2V/I2VVariantes 480P/720P e fp16/fp8
models/vae/VAE de vídeoUse o VAE indicado pelo workflow Wan
models/clip_vision/Vision encoderNecessário em alguns workflows I2V
models/text_encoders/Text encoderUse o encoder indicado

Escolha de precisão:

  • fp16: precisão original e maior consumo de VRAM
  • fp8: menor precisão pode reduzir VRAM; meça com o workflow atual e seus logs
  • bf16: use apenas quando hardware e workflow forem compatíveis

Wan muda rapidamente. Confira nomes exatos, links e variantes no tutorial oficial atual.

2.2 Instalar Custom Nodes

Um workflow de vídeo pode depender de vários node packs de terceiros. VideoHelperSuite é comum para importação e exportação; AnimateDiff normalmente exige ComfyUI-AnimateDiff-Evolved.

Etapas:

  1. Abra o ComfyUI Manager e instale os nodes indicados; instale ComfyUI-VideoHelperSuite quando VHS for necessário
  2. Instale ComfyUI-AnimateDiff-Evolved para AnimateDiff
  3. Verifique ffmpeg e dependências no README atual do VideoHelperSuite
  4. Reinicie o ComfyUI

Verificar ffmpeg:

ffmpeg -version

Se uma versão aparecer, ffmpeg está disponível. Com command not found, use winget install ffmpeg no Windows, sudo apt install ffmpeg no Linux ou brew install ffmpeg no macOS.

2.3 Importar um template de workflow

No primeiro teste, use um workflow T2V ou I2V do tutorial oficial em vez de montar todos os nodes.

Etapas:

  1. Baixe o JSON Wan T2V ou I2V no tutorial oficial
  2. Arraste para o ComfyUI o JSON ou uma imagem com metadados
  3. Diante de Missing Nodes, procure cada node no Manager ou instale manualmente o repositório correto

Ordem de diagnóstico:

  1. Confirme no ComfyUI Manager que o node pack está instalado
  2. Pesquise o nome exato do node ausente
  3. Se o Manager não encontrar, clone o repositório correto em custom_nodes/
  4. Reinicie o ComfyUI

O guia de reutilização de workflows do ComfyUI detalha importação e Missing Nodes.

3. Executar Wan Text-to-Video

Com modelos e nodes prontos, rode um workflow T2V mínimo.

3.1 Nodes principais do workflow

Um workflow Wan T2V costuma cobrir estas funções; nomes exatos dependem do template oficial atual:

  1. Model loaders: carregar Wan T2V diffusion model, VAE e text encoder
  2. Video latent node: definir width, height e frames
  3. Text encoding: inserir prompts positivo e negativo
  4. Sampling: configurar steps, CFG, seed e opções relacionadas
  5. VAE Decode: decodificar frames de vídeo
  6. VideoHelperSuite ou equivalente: combinar frames em um arquivo

Diferenças para uma imagem estática:

  • Configura frames em vez de uma imagem única
  • Usa o VAE de vídeo compatível
  • A saída geralmente inclui sequência e combinação de vídeo

3.2 Escrever o prompt de vídeo

O prompt precisa descrever continuidade temporal.

Pontos:

  • Descreva movimento concreto: câmera (camera following, slow pan) e personagem (walking, turning head)
  • Evite mudanças de cena: mantenha uma ação contínua
  • Separe câmera e personagem: uma muda o ponto de vista, o outro muda o conteúdo do quadro

Exemplos:

A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background

O guia de prompts do Stable Diffusion explica a estrutura básica.

3.3 Ajustar frames, FPS e resolução

A relação é:

ParâmetroSignificadoValores de teste
framesTotal de frames16/24/48/72
FPSFrames reproduzidos por segundo12/16/24/30
durationSegundos = frames / FPSCalcule com a fórmula

Exemplos:

  • 48 frames @ 16 FPS = 3 segundos
  • 72 frames @ 12 FPS = 6 segundos

A resolução deve corresponder ao modelo e ao workflow. Templates comuns separam rotas 480P e 720P.

Mais frames e maior resolução aumentam normalmente a carga de sampling e VAE. A seção 6 oferece pontos prudentes.

3.4 Exportar o vídeo

Muitos workflows Wan geram uma sequência e depois usam Video Combine do VideoHelperSuite ou node semelhante.

Ajustes frequentes:

  • frame_rate: FPS de reprodução
  • format: mp4, gif, webp ou formato compatível
  • output_path: local de saída conforme a versão do node

Falhas comuns:

  • Falta ffmpeg ou dependência: siga o README e verifique ffmpeg -version
  • Sem permissão de escrita: altere a pasta
  • Encoder incompatível: salve primeiro os frames e escolha formato aceito

4. Executar Wan Image-to-Video

Image-to-video usa uma imagem estática como frame inicial e gera movimento desse estado.

4.1 Conectar o workflow I2V

Diferenças principais entre I2V e T2V:

  1. Load Image: carregar imagem no tamanho esperado
  2. I2V model loader: carregar o modelo Wan I2V correspondente, não T2V
  3. CLIP Vision e text encoding: processar imagem e prompt conforme o workflow
  4. Sampling, VAE Decode e Video Combine: gerar e salvar

I2V e T2V podem usar arquivos e templates diferentes. Compare cada download com o template oficial.

4.2 Preparar a imagem inicial

A entrada influencia os frames posteriores.

Requisitos:

  • Ajustar tamanho ao workflow
  • Usar assunto claro e bordas definidas
  • Evitar detalhes excessivos; fundo carregado e texturas densas aumentam a deriva

A imagem pode vir do ComfyUI ou de fonte externa que você tenha direito de usar.

4.3 Diagnosticar ajustes I2V

Uma falha comum começa com primeiro frame reconhecível e depois rosto e mãos derivam, deformam ou cintilam.

Causas e correções:

  • Prompt incompatível: descreva movimento coerente com a imagem
  • Imagem complexa: simplifique o fundo ou crie entrada mais limpa
  • VRAM esgotada: reduza frames, resolução ou precisão
  • Movimento grande: reduza motion ou strength quando disponível

Teste outra variante I2V ou seed se o modelo não combinar com o estilo.

5. Preparar um workflow AnimateDiff

AnimateDiff usa uma pilha diferente da Wan.

5.1 Preparar o Motion Module

O motion module é o componente central. Como pasta e formatos podem mudar no AnimateDiff-Evolved, use README atual, workflow de exemplo e lista do node.

Verifique se foi feito para SD 1.5, SDXL ou outra arquitetura e se combina com base checkpoint e workflow. Reinicie o ComfyUI depois do download e confirme que aparece no loader.

5.2 Escolher o Base Checkpoint

AnimateDiff não substitui o modelo base; adiciona movimento a um modelo de difusão de imagem compatível.

Escolha:

  • Use checkpoint SD 1.5 ou SDXL compatível com motion module e workflow
  • Teste checkpoints de estilo com poucos frames
  • Não trate checkpoint normal como modelo de vídeo completo

Consulte o guia para escolher modelos Stable Diffusion.

5.3 Conectar o workflow

Um workflow AnimateDiff costuma incluir:

  1. Checkpoint Loader: carregar base checkpoint compatível
  2. Motion Model Loader: carregar motion module ou motion model
  3. Context Options: configurar context window
  4. Video latent node: definir resolução e frames
  5. Text encoding, sampling, VAE Decode e combinação de vídeo

A relação entre frames e context length depende da versão. Comece com valores do exemplo e mude um ajuste por vez.

6. Definir orçamento de parâmetros e desempenho

VRAM e duração são os principais limites locais. Estes valores são pontos iniciais, não garantias de GPU.

6.1 Matriz inicial de VRAM, frames e resolução

VRAMInício prudentePode testarEvite no começo
8 GBAnimateDiff, resolução baixa, cerca de 16 frames, batch 1Workflows low-VRAM da comunidadeWan em alta resolução, clipes longos, várias branches
12 GBAnimateDiff curto e pequenoWan de baixa precisão, pequeno e com poucos framesClipes 720P longos e pós-processamento complexo
16 GBTeste Wan FP8 curto conforme indicação oficialTemplate 480P ou 720P correspondenteVárias branches simultâneas e vídeos longos
24 GB+Mais margem para clipes curtosMaior resolução ou framesBatch, VAE e pós-processamento continuam limitados

O requisito real varia com versão, GPU, VAE, custom nodes e workflow. A tabela serve apenas para escolher o primeiro teste.

6.2 Reduzir a carga nesta ordem

Se faltar VRAM:

  1. Reduza frames, por exemplo de 48 para 24 ou 16
  2. Baixe de 720P para 480P ou tamanho compatível menor
  3. Mantenha batch em 1 e desative branches de controle e pós-processamento desnecessárias
  4. Se compatível, troque fp16 por fp8 ou precisão inferior
  5. Teste tiles espaciais e ajustes temporais de VAEDecodeTiled ou VAEEncodeTiled
  6. Use --lowvram ou opção compatível
  7. Desative preview e feche outros aplicativos de GPU

Opções low-VRAM, cache e VAE tiled precisam ser testados com versão e workflow atuais.

6.3 Equilibrar duração e qualidade

Mais longo não significa melhor. Clipes curtos são mais fáceis; longos costumam exigir movimento menor e geração segmentada.

Riscos:

  • Cintilação: cor ou brilho mudam entre frames
  • Deformação: rosto, mãos ou contornos derivam
  • Movimento fraco: prompt ou motion insuficiente

Para vídeo longo, valide um segmento curto e depois use continuation, I2V ou pós-produção compatível. Duplicar frames não garante consistência.

7. Entender saída e gravação de vídeo

Muitos workflows do ComfyUI produzem primeiro frames e os combinam depois com VideoHelperSuite ou node semelhante.

7.1 Funções dos nodes VideoHelperSuite

FunçãoUsoAjustes frequentes
Load VideoImportar vídeo ou sequênciaframe_count, frame_rate, width/height
Video CombineCombinar framesframe_rate, format, saída
Node Save VideoSalvar o arquivoformat, quality, save_output

Nomes, parâmetros e formatos mudam com a extensão. Load Video importa vídeo existente; Video Combine ou equivalente converte frames em arquivo.

7.2 Converter FPS, frames e duração

A fórmula é:

duration (segundos) = frames / FPS

Exemplos:

  • 48 frames @ 16 FPS = 3 segundos
  • 72 frames @ 12 FPS = 6 segundos

Opções de FPS:

FPSEfeito
12Os mesmos frames duram mais, mas o movimento pode parecer truncado
16Equilíbrio entre duração e fluidez
24A sequência roda mais rápido e termina antes
30Mais frames são necessários para manter duração

FPS controla a velocidade, mas não cria imagens intermediárias. Um clipe longo exige mais frames ou segmentos; maior fluidez pode exigir interpolação.

7.3 Corrigir falhas de gravação

FalhaCorreção
Falta ffmpeg ou dependênciaSiga o README e verifique ffmpeg -version
Pasta sem permissãoDê acesso de escrita ou use saída padrão
Encoder ou formato incompatívelSalve frames e escolha formato compatível
Frames não chegam ao saverRevise latent, VAE Decode e conexões de saída

8. Resolver erros comuns

Um workflow de vídeo pode falhar em várias camadas. Revise na ordem sem mudar ajustes desconectados ao mesmo tempo.

8.1 Resolver Missing Nodes

O workflow importado mostra blocos vermelhos Missing Nodes.

Ordem:

  1. Confirme no ComfyUI Manager os node packs necessários
  2. Pesquise o nome exato do node ausente
  3. Se não encontrar, clone o repositório em custom_nodes/
  4. Reinicie o ComfyUI

O guia de reutilização de workflows do ComfyUI traz mais detalhes.

8.2 Corrigir caminhos de modelos

Uma pasta incorreta costuma deixar a lista vazia.

TipoPasta comum
Wan diffusion modelmodels/diffusion_models/
Wan VAEmodels/vae/
CLIP Visionmodels/clip_vision/
text encodermodels/text_encoders/
AnimateDiff motion moduleSiga README atual e lista do node

Faça nome, tarefa, resolução e precisão corresponderem ao workflow.

8.3 Resolver OOM

Esgotar VRAM é o erro de recurso mais comum.

Ordem:

  1. Reduza frames, resolução e precisão
  2. Mantenha batch em 1 e corte branches extras
  3. Teste VAEDecodeTiled ou temporal chunk
  4. Use opção compatível como --lowvram
  5. Desative preview e feche outros aplicativos GPU

8.4 Corrigir cintilação, deformação ou movimento fraco

ProblemaCausa provávelAjuste
CintilaçãoConsistência temporal baixa ou context/motion inadequadoFixe seed, encurte teste e ajuste context ou motion
DeformaçãoImagem complexa, movimento excessivo ou limite do modeloSimplifique entrada, reduza movimento ou mude modelo
Movimento fracoPrompt sem ação ou motion baixoAdicione ação concreta e ajuste motion gradualmente
Qualidade baixaCheckpoint, motion module ou VAE incompatíveisRevise combinação e volte ao workflow de exemplo

O guia de prompts Stable Diffusion ajuda a estruturar ações.

8.5 Corrigir VAE Decode travado

VAE Decode trava, fica muito lento ou chega a OOM.

Soluções:

  • Reduza frames e resolução
  • Teste VAEDecodeTiled com tiles espaciais ou temporal chunks
  • Confirme que VAE corresponde ao workflow
  • Baixe novamente um modelo danificado de fonte confiável e verifique

8.6 Corrigir deriva I2V após o primeiro frame

É um padrão comum em I2V.

CausaAjuste
Prompt incompatível com imagemDescreva movimento coerente com a entrada
Imagem inicial detalhada demaisSimplifique o fundo ou crie entrada mais limpa
Movimento grande demaisComece com subtle motion ou slow camera push-in
Modelo I2V inadequado ao estiloTeste outra variante, workflow ou seed

9. Continuar com controle, pós-processamento e automação

Quando o primeiro workflow estiver estável, escolha o próximo passo conforme o limite real encontrado.

9.1 Guias relacionados da série

Este é o capítulo de vídeo da série prática ComfyUI e Stable Diffusion. Consulte estes pré-requisitos quando necessário:

Outros artigos cobrem low-VRAM, reparo frame a frame, automação de API e conflitos de versão. Estabilize um workflow curto antes de adicionar camadas.

9.2 Documentação oficial e projetos

Comece pelas fontes oficiais:

9.3 Licenças e uso comercial

Verifique a licença atual de cada modelo:

Antes do uso comercial, confirme:

  • Se a licença permite uso comercial
  • Se você tem direitos sobre o material, principalmente a imagem inicial I2V
  • Como os direitos do conteúdo gerado se aplicam ao projeto e à plataforma

Isto não é aconselhamento jurídico. A licença atual do repositório é a referência.

Conclusão

Wan e AnimateDiff atendem workflows de vídeo diferentes no ComfyUI. Wan cria vídeo desde texto ou imagem inicial; AnimateDiff reutiliza checkpoints compatíveis em animações curtas. Pastas, versões de nodes e templates devem corresponder ao workflow real. A matriz é um começo prudente, não garantia de GPU. Se faltarem recursos, reduza frames, resolução, branches, precisão e carga do VAE nessa ordem.

Para Missing Nodes, caminhos de modelos, OOM, cintilação, deformação, VAE Decode travado ou falha de exportação, diagnostique camada por camada. Comece com poucos frames, resolução baixa e batch 1, valide a cadeia completa e aumente uma variável por teste.

Executar o primeiro workflow de vídeo curto no ComfyUI

Valide a cadeia completa, da escolha da rota e dos modelos ao teste mínimo e à exportação.

  1. 1

    Step 1: Verificar o workflow básico

    Confirme que o ComfyUI gera imagens estáticas com estabilidade e que você sabe importar workflow, identificar nodes ausentes e revisar caminhos de modelos.
  2. 2

    Step 2: Escolher a rota de vídeo

    Use Wan T2V para texto, Wan I2V para uma imagem inicial ou AnimateDiff quando precisar reutilizar um checkpoint SD.
  3. 3

    Step 3: Preparar os modelos

    Siga o workflow e a documentação oficial para obter diffusion model, VAE, text encoder, CLIP Vision ou motion module.
  4. 4

    Step 4: Instalar os nodes necessários

    Instale os custom nodes pelo ComfyUI Manager e prepare uma extensão de exportação como VideoHelperSuite.
  5. 5

    Step 5: Rodar um teste mínimo

    Comece com poucos frames, resolução pequena e batch 1, sem ControlNet, upscale ou pós-processamento complexo.
  6. 6

    Step 6: Combinar e salvar o vídeo

    Depois de gerar frames, defina frame rate e formato e exporte com Video Combine, Save Video ou node equivalente.
  7. 7

    Step 7: Aumentar uma variável por vez

    Fixe o seed e mude apenas um valor por teste; diante de OOM, cintilação ou deriva, recue em frames, resolução, precisão e VAE.

FAQ

É melhor começar com Wan ou AnimateDiff para vídeo no ComfyUI?
Use Wan para criar um vídeo novo a partir de texto ou imagem. Use AnimateDiff se já possui checkpoints SD, LoRAs e recursos de estilo e quer uma animação curta.
Qual é a diferença entre frames e FPS no ComfyUI?
Frames é o total de imagens geradas; FPS indica quantas são exibidas por segundo. A duração é calculada dividindo frames por FPS.
Por que o ComfyUI gera imagens em vez de um arquivo mp4?
Muitos workflows produzem primeiro os frames e depois usam VideoHelperSuite, Video Combine ou node semelhante para criar mp4, gif ou webp.
É possível gerar vídeo no ComfyUI com 8 GB de VRAM?
Você pode testar AnimateDiff com baixa resolução e poucos frames ou workflows low-VRAM da comunidade. O resultado depende da precisão, VAE, custom nodes, backend da GPU e workflow; não há garantia para vídeos Wan longos em alta resolução.
Por que image-to-video se afasta da imagem inicial?
A imagem inicial não fixa o clipe inteiro. Movimento amplo, entrada complexa e mais frames aumentam alterações em rosto, mãos, roupas e fundo.
O que fazer quando a geração trava em VAE Decode?
Reduza primeiro frames e resolução. Depois teste tiles espaciais ou temporal chunks de VAEDecodeTiled, confirme o VAE e aplique configurações low-VRAM.

14 min de leitura · Publicado em: 23 jul 2026 · Atualizado em: 24 jul 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog