Changer le thème

Créer des vidéos ComfyUI avec Wan et AnimateDiff

Easton editorial illustration: one large rounded charcoal node-canvas console, one orange video filmstrip emerging from the workflow

"Le tutoriel officiel ComfyUI sur Wan 2.2 fournit des workflows text-to-video et image-to-video, les emplacements des modèles et les choix de précision."

Vous savez déjà produire une image fixe satisfaisante dans ComfyUI et voulez maintenant l’animer. Après import du workflow vidéo, l’interface se remplit pourtant de Missing Nodes, ou la VRAM atteint immédiatement 99 %. Faut-il choisir Wan ou AnimateDiff ? Dans quels dossiers placer les modèles ? Comment équilibrer frames et mémoire, puis transformer une suite d’images en mp4 ? Commencez par la méthode, la liste de préparation et un budget prudent, avant de diagnostiquer les échecs fréquents.

1. Choisir entre Wan et AnimateDiff

Choisissez la méthode avant de construire le workflow. Wan et AnimateDiff sont deux systèmes différents, avec leurs prérequis, leurs usages et leur complexité.

1.1 Wan : un modèle vidéo dédié

Wan 2.2 est une famille ouverte de modèles vidéo prenant en charge text-to-video (T2V), image-to-video (I2V) et text-image-to-video (TI2V). Elle utilise une architecture mixture-of-experts ainsi que ses propres poids, VAE et text encoder. Pour certains workflows FP8, le tutoriel officiel ComfyUI propose de partir de plus de 16 Go de VRAM ; les variantes en précision originale demandent généralement davantage. Wan vise la création de nouvelles vidéos avec une meilleure continuité temporelle.

L’écosystème Wan est distinct d’un checkpoint SD classique. Il faut donc réunir toutes les ressources exigées par le workflow, notamment diffusion model, VAE et text encoder. Un clip court de deux à quatre secondes constitue un bon premier test.

1.2 AnimateDiff : ajouter du mouvement à l’écosystème SD

AnimateDiff apporte du mouvement aux modèles Stable Diffusion compatibles, comme SD 1.5 ou SDXL. Son élément central est un motion module associé à un base checkpoint. Le dossier des modèles pouvant évoluer avec AnimateDiff-Evolved, consultez le README actuel et la liste du node. Un workflow courant charge un checkpoint SD et un motion module compatible pour générer une animation courte.

Cette méthode convient si vous possédez déjà des checkpoints de style. Le checkpoint et le VAE peuvent être réutilisés, mais la durée et la cohérence dépendent du base model, du motion module, du context, des frames et de la résolution.

1.3 Tableau de décision Wan vs AnimateDiff

CritèreWan 2.2AnimateDiff
TâcheText-to-video, image-to-video, text-image-to-videoAnimation courte basée sur un modèle SD
ÉcosystèmeModèle vidéo dédiéSD 1.5/SDXL
Point de départ VRAMCertains workflows FP8 démarrent autour de 16 Go ; la précision originale exige plusDépend du base model, du motion module et des réglages ; tester petit et court
PrérequisWan diffusion model + VAE + text encoderCheckpoint SD + motion module
Usage adaptéNouvelle vidéo et cohérence accrueModèles de style existants et animations courtes
ComplexitéÉlevée : plusieurs modèles et nodesMoyenne : motion module plus base checkpoint

Choisissez Wan pour créer un nouveau clip si la pile de modèles plus lourde est acceptable. Choisissez AnimateDiff si vous possédez un checkpoint SD compatible, si une animation courte suffit ou si vous préférez éviter un grand modèle vidéo dédié.

2. Préparer le workflow Wan

De nombreux essais Wan échouent pendant la préparation : modèle dans le mauvais dossier, node absent ou workflow conçu pour une autre tâche. Une vérification préalable évite de corriger chaque erreur après lancement de la queue.

2.1 Préparer les fichiers de modèle

Les fichiers Wan doivent se trouver aux emplacements attendus. Une erreur de dossier ou de nom produit souvent une liste de modèles vide.

Dossiers fréquents :

DossierTypeRemarque
models/diffusion_models/Modèle T2V/I2VVariantes 480P/720P et fp16/fp8
models/vae/VAE vidéoUtiliser le VAE du workflow Wan
models/clip_vision/Vision encoderRequis pour certains workflows I2V
models/text_encoders/Text encoderUtiliser celui du workflow

Choix de précision :

  • fp16 : précision originale et consommation VRAM la plus élevée
  • fp8 : précision réduite pouvant alléger la VRAM ; mesurez le besoin réel avec le workflow actuel et les logs
  • bf16 : uniquement si matériel et workflow sont compatibles

Wan évolue rapidement. Vérifiez les noms exacts, liens de téléchargement et variantes dans le tutoriel officiel actuel.

2.2 Installer les Custom Nodes

Un workflow vidéo peut dépendre de plusieurs node packs tiers. VideoHelperSuite sert souvent à l’import et l’export ; AnimateDiff nécessite généralement ComfyUI-AnimateDiff-Evolved.

Étapes :

  1. Ouvrir ComfyUI Manager et installer les nodes indiqués ; installer ComfyUI-VideoHelperSuite si VHS est requis
  2. Installer ComfyUI-AnimateDiff-Evolved pour AnimateDiff
  3. Vérifier ffmpeg et les dépendances dans le README actuel de VideoHelperSuite
  4. Redémarrer ComfyUI

Vérifier ffmpeg :

ffmpeg -version

Si une version apparaît, ffmpeg est disponible. Avec command not found, utilisez winget install ffmpeg sous Windows, sudo apt install ffmpeg sous Linux ou brew install ffmpeg sous macOS.

2.3 Importer un modèle de workflow

Pour le premier essai, partez d’un workflow T2V ou I2V du tutoriel officiel au lieu d’assembler tous les nodes.

Étapes :

  1. Télécharger le JSON Wan T2V ou I2V depuis le tutoriel officiel
  2. Déposer dans ComfyUI le JSON ou une image d’exemple contenant les métadonnées
  3. En cas de Missing Nodes, rechercher chaque node dans Manager ou installer le bon dépôt manuellement

Ordre de diagnostic :

  1. Vérifier dans ComfyUI Manager que le node pack requis est installé
  2. Rechercher le nom exact du node manquant
  3. Si Manager ne le trouve pas, cloner le bon dépôt dans custom_nodes/
  4. Redémarrer ComfyUI

Le guide de réutilisation des workflows ComfyUI détaille l’import et Missing Nodes.

3. Exécuter Wan Text-to-Video

Une fois modèles et nodes prêts, lancez un workflow T2V minimal.

3.1 Nodes essentiels du workflow

Un workflow Wan T2V couvre généralement les responsabilités suivantes ; les noms exacts dépendent du modèle officiel actuel :

  1. Model loaders : charger Wan T2V diffusion model, VAE et text encoder
  2. Video latent node : définir width, height et frames
  3. Text encoding : saisir prompt positif et négatif
  4. Sampling : régler steps, CFG, seed et options associées
  5. VAE Decode : décoder les frames vidéo
  6. VideoHelperSuite ou équivalent : réunir les frames dans un fichier vidéo

Différences avec une image fixe :

  • Le workflow règle frames plutôt qu’une image unique
  • Il utilise le VAE vidéo compatible
  • La sortie comprend souvent la séquence et une étape d’assemblage

3.2 Écrire le prompt vidéo

Le prompt vidéo doit décrire la continuité temporelle.

Points clés :

  • Décrire précisément le mouvement : caméra (camera following, slow pan) et sujet (walking, turning head)
  • Éviter les changements de scène : rester dans une scène continue
  • Distinguer caméra et sujet : l’une change le point de vue, l’autre le contenu du cadre

Exemples :

A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background

Le guide des prompts Stable Diffusion explique la structure de base.

3.3 Régler frames, FPS et résolution

La relation est simple :

ParamètreSignificationValeurs de test
framesNombre total de frames16/24/48/72
FPSFrames lues par seconde12/16/24/30
durationSecondes = frames / FPSCalculer avec la formule

Exemples :

  • 48 frames @ 16 FPS = 3 secondes
  • 72 frames @ 12 FPS = 6 secondes

La résolution doit correspondre au modèle et au workflow. Les modèles courants distinguent souvent 480P et 720P.

Davantage de frames et une résolution supérieure augmentent généralement la charge du sampling et du VAE. La section 6 propose des points de départ prudents.

3.4 Exporter la vidéo

De nombreux workflows Wan créent une séquence puis utilisent Video Combine de VideoHelperSuite ou un node similaire.

Réglages fréquents :

  • frame_rate : FPS de lecture
  • format : mp4, gif, webp ou autre format pris en charge
  • output_path : emplacement de sortie, selon la version du node

Échecs fréquents :

  • ffmpeg ou dépendance manquante : suivre le README et vérifier ffmpeg -version
  • Droits insuffisants : choisir un dossier accessible en écriture
  • Encodeur non pris en charge : enregistrer d’abord les frames puis choisir un format compatible

4. Exécuter Wan Image-to-Video

Image-to-video utilise une image fixe comme frame initiale et génère le mouvement à partir de cet état.

4.1 Connecter le workflow I2V

Différences principales entre I2V et T2V :

  1. Load Image : charger une image à la taille attendue
  2. I2V model loader : charger le modèle Wan I2V correspondant, pas la variante T2V
  3. CLIP Vision et text encoding : traiter l’image et le prompt selon le workflow
  4. Sampling, VAE Decode et Video Combine : générer puis enregistrer

I2V et T2V peuvent employer des fichiers et modèles distincts. Comparez chaque téléchargement au modèle officiel.

4.2 Préparer l’image initiale

L’image d’entrée influence fortement les frames suivantes.

Conditions :

  • Adapter sa taille au workflow
  • Choisir un sujet clair et des contours propres
  • Éviter trop de détails ; arrière-plan chargé et texture dense peuvent accroître la dérive

L’image peut venir de ComfyUI ou d’une source externe que vous avez le droit d’utiliser.

4.3 Diagnostiquer les réglages I2V

Un échec courant commence par une première frame correcte, puis le visage et les mains dérivent, se déforment ou scintillent.

Causes et corrections :

  • Prompt incompatible : décrire un mouvement plausible pour l’image
  • Image trop complexe : simplifier le décor ou produire une entrée plus nette
  • VRAM saturée : réduire frames, résolution ou précision
  • Mouvement trop ample : diminuer motion ou strength si le workflow l’expose

Essayez une autre variante I2V ou un autre seed si le modèle convient mal au style.

5. Préparer un workflow AnimateDiff

AnimateDiff utilise une pile de modèles différente de Wan.

5.1 Préparer le Motion Module

Le motion module est le composant central. Dossier et formats pouvant changer avec AnimateDiff-Evolved, prenez comme référence le README actuel, le workflow d’exemple et la liste du node.

Vérifiez s’il cible SD 1.5, SDXL ou une autre architecture et s’il correspond au base checkpoint. Après téléchargement, redémarrez ComfyUI et confirmez sa présence dans le loader AnimateDiff-Evolved.

5.2 Choisir le Base Checkpoint

AnimateDiff ne remplace pas le modèle de base ; il ajoute le mouvement à un modèle d’image compatible.

Choix :

  • Utiliser un checkpoint SD 1.5 ou SDXL compatible avec motion module et workflow
  • Tester les checkpoints de style existants avec peu de frames
  • Ne pas traiter un checkpoint ordinaire comme modèle vidéo complet

Consultez le guide de sélection des modèles Stable Diffusion.

5.3 Connecter le workflow

Un workflow AnimateDiff comprend généralement :

  1. Checkpoint Loader : charger un base checkpoint compatible
  2. Motion Model Loader : charger motion module ou motion model
  3. Context Options : régler la fenêtre de contexte
  4. Video latent node : définir résolution et frames
  5. Text encoding, sampling, VAE Decode et assemblage vidéo

Le rapport entre frames et context length dépend de la version des nodes. Commencez par les valeurs de l’exemple, puis changez un seul réglage.

6. Définir le budget de paramètres et de performances

VRAM et durée sont les principales contraintes locales. Ces valeurs sont des départs prudents, pas des garanties GPU.

6.1 Matrice de départ VRAM, frames et résolution

VRAMDépart prudentÀ testerÀ éviter au début
8 GoAnimateDiff, petite résolution, environ 16 frames, batch 1Workflows low-VRAM communautairesWan haute résolution, clips longs, branches multiples
12 GoAnimateDiff court et petitWan basse précision, petite taille et peu de framesLongs clips 720P et post-traitement complexe
16 GoTest Wan FP8 court selon les indications officiellesModèle 480P ou 720P correspondantBranches simultanées et vidéos longues
24 Go+Plus de marge pour les clips courtsRésolution ou frames supérieuresBatch, VAE et post-traitement restent à limiter

Le besoin réel varie selon version, GPU, VAE, custom nodes et implémentation. Cette matrice sert uniquement au premier test.

6.2 Réduire la charge dans cet ordre

Si la VRAM manque :

  1. Réduire frames, par exemple de 48 à 24 ou 16
  2. Passer de 720P à 480P ou à une taille plus petite prise en charge
  3. Garder batch à 1 et désactiver les branches de contrôle et de post-traitement inutiles
  4. Si possible, passer de fp16 à fp8 ou à une précision inférieure
  5. Tester tiles spatiales et réglages temporels de VAEDecodeTiled ou VAEEncodeTiled
  6. Utiliser --lowvram ou une option compatible
  7. Désactiver preview et fermer les applications GPU

Options low-VRAM, cache et VAE tiled doivent être testés avec la version actuelle et le workflow concret.

6.3 Arbitrer durée et qualité

Plus long ne signifie pas meilleur. Les clips courts se contrôlent plus facilement ; les longs exigent souvent des mouvements réduits et une génération segmentée.

Risques :

  • Scintillement : couleur ou luminosité change entre les frames
  • Déformation : visage, mains ou contours dérivent
  • Mouvement faible : prompt ou réglage motion insuffisant

Pour une vidéo longue, validez d’abord un segment court puis utilisez les méthodes de continuation, I2V ou de post-production prises en charge. Doubler frames ne garantit pas la cohérence.

7. Comprendre la sortie et l’enregistrement vidéo

De nombreux workflows ComfyUI produisent d’abord des frames, ensuite assemblées avec VideoHelperSuite ou un node similaire.

7.1 Rôle des nodes VideoHelperSuite

RôleFonctionRéglages fréquents
Load VideoImporter vidéo ou séquence d’imagesframe_count, frame_rate, width/height
Video CombineAssembler les framesframe_rate, format, sortie
Node Save VideoEnregistrer le fichierformat, quality, save_output

Noms, paramètres et formats évoluent avec l’extension. Load Video importe une vidéo existante ; Video Combine ou équivalent transforme les frames produites en fichier vidéo.

7.2 Convertir FPS, frames et durée

La formule est :

duration (secondes) = frames / FPS

Exemples :

  • 48 frames @ 16 FPS = 3 secondes
  • 72 frames @ 12 FPS = 6 secondes

Choix du FPS :

FPSEffet
12Les mêmes frames durent plus longtemps, avec un mouvement parfois plus saccadé
16Compromis entre durée et fluidité
24La même séquence est lue plus vite et finit plus tôt
30Il faut plus de frames pour conserver la même durée

Le FPS contrôle la vitesse de lecture, sans créer d’images intermédiaires. Un clip plus long demande plus de frames ou des segments ; une animation plus fluide peut demander une interpolation.

7.3 Corriger les échecs d’enregistrement

ÉchecCorrection
ffmpeg ou dépendance absenteSuivre le README et vérifier ffmpeg -version
Dossier non accessible en écritureDonner les droits ou utiliser le dossier de sortie par défaut
Encodeur ou format non pris en chargeSauver les frames puis choisir un format compatible
Aucune frame au node de sauvegardeVérifier latent, VAE Decode et connexions de sortie

8. Résoudre les erreurs courantes

Un workflow vidéo peut échouer à plusieurs niveaux. Contrôlez-les dans l’ordre au lieu de modifier plusieurs paramètres sans rapport.

8.1 Résoudre Missing Nodes

Le workflow importé affiche des blocs rouges Missing Nodes.

Ordre :

  1. Vérifier dans ComfyUI Manager que les node packs sont installés
  2. Rechercher le nom exact du node absent
  3. Si Manager ne le trouve pas, cloner le bon dépôt dans custom_nodes/
  4. Redémarrer ComfyUI

Le guide de réutilisation des workflows ComfyUI fournit plus de détails.

8.2 Corriger les chemins de modèle

Un mauvais dossier produit souvent une liste vide.

TypeDossier fréquent
Wan diffusion modelmodels/diffusion_models/
Wan VAEmodels/vae/
CLIP Visionmodels/clip_vision/
text encodermodels/text_encoders/
AnimateDiff motion moduleSuivre le README actuel et la liste du node

Faites correspondre noms, tâche, résolution et précision au workflow.

8.3 Résoudre OOM

L’épuisement de VRAM est l’erreur de ressources la plus courante.

Ordre :

  1. Réduire frames, résolution et précision
  2. Garder batch à 1 et couper les branches supplémentaires
  3. Tester VAEDecodeTiled ou temporal chunk
  4. Utiliser une option compatible telle que --lowvram
  5. Désactiver preview et fermer les autres applications GPU

8.4 Corriger scintillement, déformation ou mouvement faible

ProblèmeCause probableAjustement
ScintillementCohérence temporelle faible ou context/motion inadaptéFixer seed, raccourcir le test, ajuster context ou motion
DéformationImage complexe, mouvement trop grand ou limite du modèleSimplifier l’image, réduire le mouvement, changer de modèle
Mouvement faiblePrompt peu précis ou motion trop basAjouter une action concrète et ajuster progressivement motion
Qualité faibleCheckpoint, motion module ou VAE incompatiblesVérifier la combinaison et revenir au workflow d’exemple

Le guide des prompts Stable Diffusion aide à structurer les actions.

8.5 Corriger un VAE Decode bloqué

VAE Decode se bloque, devient très lent ou atteint OOM.

Corrections :

  • Réduire frames et résolution
  • Tester VAEDecodeTiled avec tiles spatiales ou temporal chunks
  • Vérifier que le VAE correspond au workflow
  • Retélécharger un modèle endommagé depuis une source fiable et le vérifier

8.6 Corriger la dérive I2V après la première frame

Ce schéma est fréquent en I2V.

CauseAjustement
Prompt incompatible avec l’imageDécrire un mouvement cohérent avec l’entrée
Image initiale trop détailléeSimplifier l’arrière-plan ou créer une image plus nette
Mouvement trop importantCommencer par subtle motion ou slow camera push-in
Modèle I2V mal adapté au styleTester une autre variante, un autre workflow ou seed

9. Poursuivre avec contrôle, post-traitement et automatisation

Une fois le premier workflow stable, choisissez la suite en fonction de la limite réellement rencontrée.

9.1 Guides associés de la série

Cet article est consacré à la vidéo dans la série pratique ComfyUI et Stable Diffusion. Consultez ces prérequis si nécessaire :

D’autres articles traitent de low-VRAM, réparation frame par frame, automatisation API et conflits de versions. Stabilisez un workflow court avant d’ajouter des couches.

9.2 Documentation officielle et projets

Commencez par les sources officielles :

9.3 Licences et usage commercial

Vérifiez la licence actuelle de chaque modèle :

Avant un usage commercial, vérifiez :

  • Si la licence du modèle autorise l’usage commercial
  • Si vous détenez les droits sur la source, surtout l’image initiale I2V
  • Comment les droits des contenus générés s’appliquent au projet et à la plateforme

Ce texte ne constitue pas un conseil juridique. La licence actuelle du dépôt fait foi.

Conclusion

Wan et AnimateDiff répondent à des workflows vidéo ComfyUI différents. Wan crée une vidéo depuis du texte ou une image initiale ; AnimateDiff réutilise des checkpoints compatibles pour de courtes animations. Dossiers, versions de nodes et modèles doivent correspondre au workflow réel. La matrice est un départ prudent, pas une garantie GPU. Si les ressources manquent, réduisez successivement frames, résolution, branches, précision et charge VAE.

Pour Missing Nodes, chemins de modèles, OOM, scintillement, déformation, VAE Decode bloqué ou échec d’export, procédez couche par couche. Commencez avec peu de frames, une petite résolution et batch 1, validez toute la chaîne, puis augmentez une seule variable par test.

Exécuter un premier workflow vidéo court dans ComfyUI

Validez toute la chaîne, du choix de la méthode et des modèles au test minimal puis à l’export.

  1. 1

    Step 1: Vérifier le workflow de base

    Confirmez que ComfyUI produit des images fixes et que vous savez importer un workflow, repérer les nodes manquants et vérifier les chemins des modèles.
  2. 2

    Step 2: Choisir la méthode vidéo

    Prenez Wan T2V pour le texte, Wan I2V pour une image initiale, ou AnimateDiff pour réutiliser un checkpoint SD.
  3. 3

    Step 3: Préparer les modèles

    Suivez le workflow et la documentation officielle pour obtenir diffusion model, VAE, text encoder, CLIP Vision ou motion module.
  4. 4

    Step 4: Installer les nodes requis

    Installez les custom nodes dans ComfyUI Manager et préparez une extension d’export telle que VideoHelperSuite.
  5. 5

    Step 5: Lancer un test minimal

    Commencez avec peu de frames, une petite résolution et batch 1, sans ControlNet, upscale ni post-traitement complexe.
  6. 6

    Step 6: Assembler et enregistrer la vidéo

    Une fois les frames produites, réglez frame rate et format puis exportez avec Video Combine, Save Video ou un node équivalent.
  7. 7

    Step 7: Augmenter une variable à la fois

    Fixez le seed et ne modifiez qu’un réglage par test ; en cas d’OOM, de scintillement ou de dérive, revenez sur frames, résolution, précision et VAE.

FAQ

Faut-il commencer la vidéo ComfyUI avec Wan ou AnimateDiff ?
Choisissez Wan pour créer une nouvelle vidéo depuis du texte ou une image. Choisissez AnimateDiff si vous possédez déjà des checkpoints SD, des LoRA et des ressources de style pour une animation courte.
Quelle différence entre frames et FPS dans ComfyUI ?
Frames est le nombre total d’images générées ; FPS indique combien sont lues chaque seconde. La durée est égale à frames divisé par FPS.
Pourquoi ComfyUI produit-il des images au lieu d’un mp4 ?
De nombreux workflows génèrent d’abord les frames puis utilisent VideoHelperSuite, Video Combine ou un node similaire pour créer un mp4, gif ou webp.
Peut-on générer une vidéo ComfyUI avec 8 Go de VRAM ?
Vous pouvez tester AnimateDiff à faible résolution et avec peu de frames, ou un workflow low-VRAM communautaire. Le résultat dépend de la précision, du VAE, des custom nodes, du backend GPU et du workflow ; une longue vidéo Wan en haute résolution n’est pas garantie.
Pourquoi l’image-to-video s’éloigne-t-il de l’image source ?
Une image initiale ne verrouille pas tout le clip. Un mouvement important, une entrée complexe et davantage de frames accentuent les variations du visage, des mains, des vêtements et du décor.
Que faire si la génération reste bloquée sur VAE Decode ?
Réduisez d’abord frames et résolution, puis essayez les tiles spatiales ou temporal chunks de VAEDecodeTiled. Vérifiez ensuite le VAE et appliquez les réglages low-VRAM.

15 min de lecture · Publié le: 23 juil. 2026 · Mis à jour le: 24 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog