Crear videos en ComfyUI con Wan y AnimateDiff

"El tutorial oficial de ComfyUI para Wan 2.2 incluye workflows text-to-video e image-to-video, ubicaciones de modelos y opciones de precisión."
Ya puedes crear en ComfyUI una imagen fija que te convence y ahora quieres darle movimiento. Al importar el workflow de video, aparecen bloques rojos de Missing Nodes o el uso de VRAM sube de inmediato al 99 %. ¿Debes elegir Wan o AnimateDiff? ¿En qué carpetas van los modelos? ¿Cómo equilibras frames y memoria, y cómo conviertes una secuencia de imágenes en mp4? Empieza por la ruta, la lista de preparación y un presupuesto conservador, y luego revisa los fallos más comunes en orden.
1. Elegir entre Wan y AnimateDiff
Elige la ruta antes de construir el workflow. Wan y AnimateDiff son sistemas distintos, con requisitos, casos de uso y niveles de complejidad diferentes.
1.1 Wan: una ruta de modelo de video dedicado
Wan 2.2 es una familia abierta de modelos de video compatible con text-to-video (T2V), image-to-video (I2V) y text-image-to-video (TI2V). Usa una arquitectura mixture-of-experts y sus propios pesos, VAE y text encoder. Para algunos workflows FP8, el tutorial oficial de ComfyUI sugiere partir de más de 16 GB de VRAM; las variantes con precisión original suelen exigir más. Wan se adapta a videos nuevos y a una mayor necesidad de coherencia temporal.
El ecosistema Wan está separado de un checkpoint SD normal. Debes reunir todos los archivos que exige el workflow, como diffusion model, VAE y text encoder. Para la primera prueba, un clip de dos a cuatro segundos es un punto razonable.
1.2 AnimateDiff: añadir movimiento al ecosistema SD
AnimateDiff añade movimiento a modelos Stable Diffusion compatibles, como SD 1.5 o SDXL. Su componente central es un motion module que funciona junto a un base checkpoint. Como la carpeta puede cambiar con AnimateDiff-Evolved, sigue el README actual y la lista del node. Un workflow típico carga un checkpoint SD y un motion module compatible para crear una animación corta.
AnimateDiff encaja cuando ya tienes checkpoints de estilo. Puedes reutilizar checkpoint y VAE, pero la duración y la consistencia dependen de base model, motion module, context, frames y resolución.
1.3 Tabla de decisión Wan vs AnimateDiff
| Criterio | Wan 2.2 | AnimateDiff |
|---|---|---|
| Tarea | Text-to-video, image-to-video, text-image-to-video | Animación corta basada en un modelo SD |
| Ecosistema | Modelo de video dedicado | SD 1.5/SDXL |
| Punto de partida de VRAM | Algunos workflows FP8 parten de la clase de 16 GB; la precisión original necesita más | Depende de base model, motion module y ajustes; prueba pequeño y corto |
| Requisitos | Wan diffusion model + VAE + text encoder | Checkpoint SD + motion module |
| Uso adecuado | Video nuevo y mayor necesidad de consistencia | Modelos de estilo existentes y animaciones cortas |
| Complejidad | Alta: varios modelos y nodes | Media: motion module más base checkpoint |
Elige Wan si quieres un clip nuevo y aceptas una pila de modelos mayor. Elige AnimateDiff si ya tienes un checkpoint SD compatible, necesitas una animación corta o prefieres evitar un gran modelo de video dedicado.
2. Preparar el workflow de Wan
Muchos intentos de Wan fallan durante la preparación: modelo en la carpeta equivocada, node ausente o workflow para otra tarea. Una revisión breve evita buscar cada error después de iniciar la queue.
2.1 Preparar los archivos de modelo
Los archivos de Wan deben estar en las ubicaciones esperadas. Una carpeta o un nombre incorrectos suelen dejar vacía la lista de modelos.
Carpetas habituales:
| Carpeta | Tipo de archivo | Nota |
|---|---|---|
models/diffusion_models/ | Modelo T2V/I2V | Variantes 480P/720P y fp16/fp8 |
models/vae/ | VAE de video | Usa el VAE indicado por el workflow Wan |
models/clip_vision/ | Vision encoder | Necesario para algunos workflows I2V |
models/text_encoders/ | Text encoder | Usa el encoder indicado |
Elegir precisión:
- fp16: precisión original y mayor consumo de VRAM
- fp8: menor precisión que puede reducir VRAM; mide el requisito con el workflow actual y tus logs
- bf16: solo si hardware y workflow son compatibles
Wan cambia con rapidez. Revisa nombres exactos, enlaces y variantes en el tutorial oficial vigente.
2.2 Instalar Custom Nodes
Un workflow de video puede depender de varios node packs de terceros. VideoHelperSuite se usa con frecuencia para importar y exportar; AnimateDiff suele requerir ComfyUI-AnimateDiff-Evolved.
Pasos:
- Abre ComfyUI Manager e instala los nodes indicados; instala
ComfyUI-VideoHelperSuitesi se requiere VHS - Instala
ComfyUI-AnimateDiff-Evolvedpara AnimateDiff - Comprueba ffmpeg y las dependencias en el README actual de VideoHelperSuite
- Reinicia ComfyUI
Comprobar ffmpeg:
ffmpeg -version
Si muestra una versión, ffmpeg está disponible. Si aparece command not found, usa winget install ffmpeg en Windows, sudo apt install ffmpeg en Linux o brew install ffmpeg en macOS.
2.3 Importar una plantilla de workflow
Para la primera prueba, utiliza un workflow T2V o I2V del tutorial oficial en lugar de montar cada node desde cero.
Pasos:
- Descarga el JSON de Wan T2V o I2V desde el tutorial oficial
- Arrastra a ComfyUI el JSON o una imagen de ejemplo con metadatos
- Ante Missing Nodes, busca cada node en Manager o instala manualmente el repositorio correcto
Orden de diagnóstico:
- Comprueba en ComfyUI Manager que el node pack está instalado
- Busca el nombre exacto del node ausente
- Si Manager no lo encuentra, clona el repositorio correcto en
custom_nodes/ - Reinicia ComfyUI
La guía para reutilizar workflows de ComfyUI explica la importación y Missing Nodes con más detalle.
3. Ejecutar Wan Text-to-Video
Con modelos y nodes listos, lanza un workflow T2V mínimo.
3.1 Nodes clave del workflow
Un workflow Wan T2V suele cubrir estas responsabilidades; los nombres exactos dependen de la plantilla oficial actual:
- Model loaders: cargar Wan T2V diffusion model, VAE y text encoder
- Video latent node: definir width, height y frames
- Text encoding: introducir prompts positivo y negativo
- Sampling: configurar steps, CFG, seed y opciones relacionadas
- VAE Decode: decodificar frames de video
- VideoHelperSuite o equivalente: combinar frames en un archivo
Diferencias respecto a una imagen fija:
- Se configura
framesen lugar de una imagen única - Se usa el VAE de video compatible
- La salida suele incluir secuencia y etapa de combinación
3.2 Escribir el prompt de video
El prompt debe describir continuidad temporal.
Puntos clave:
- Describe movimiento concreto: cámara (
camera following,slow pan) y sujeto (walking,turning head) - Evita cambios de escena: mantén una sola acción continua
- Separa cámara y sujeto: la primera cambia el punto de vista; el segundo cambia el contenido del cuadro
Ejemplos:
A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background
La guía de prompts de Stable Diffusion explica la estructura base.
3.3 Ajustar frames, FPS y resolución
La relación es:
| Parámetro | Significado | Valores de prueba |
|---|---|---|
| frames | Número total de frames | 16/24/48/72 |
| FPS | Frames reproducidos por segundo | 12/16/24/30 |
| duration | Segundos = frames / FPS | Calcular con la fórmula |
Ejemplos:
- 48 frames @ 16 FPS = 3 segundos
- 72 frames @ 12 FPS = 6 segundos
La resolución debe corresponder al modelo y workflow. Las plantillas comunes suelen separar rutas 480P y 720P.
Más frames y mayor resolución aumentan normalmente la carga de sampling y VAE. La sección 6 ofrece puntos de partida prudentes.
3.4 Exportar el video
Muchos workflows Wan generan una secuencia y luego usan Video Combine de VideoHelperSuite o un node similar.
Ajustes frecuentes:
frame_rate: FPS de reproducciónformat: mp4, gif, webp u otro formato compatibleoutput_path: ubicación de salida según la versión del node
Fallos habituales:
- Falta ffmpeg o una dependencia: sigue el README y revisa
ffmpeg -version - Sin permisos de escritura: cambia la carpeta
- Encoder incompatible: guarda primero los frames y elige un formato compatible
4. Ejecutar Wan Image-to-Video
Image-to-video utiliza una imagen fija como frame inicial y genera movimiento desde ese estado.
4.1 Conectar el workflow I2V
Diferencias principales entre I2V y T2V:
- Load Image: cargar una imagen del tamaño esperado
- I2V model loader: cargar el modelo Wan I2V correspondiente, no la variante T2V
- CLIP Vision y text encoding: procesar imagen y prompt según el workflow
- Sampling, VAE Decode y Video Combine: generar y guardar
I2V y T2V pueden usar archivos y plantillas diferentes. Compara cada descarga con la plantilla oficial.
4.2 Preparar la imagen inicial
La entrada influye mucho en los frames posteriores.
Requisitos:
- Ajustar el tamaño al workflow
- Usar un sujeto claro con bordes definidos
- Evitar exceso de detalle; un fondo cargado o texturas densas pueden aumentar la deriva
La imagen puede venir de ComfyUI o de una fuente externa que tengas derecho a usar.
4.3 Diagnosticar ajustes I2V
Un fallo común empieza con una primera imagen reconocible y después aparecen deriva, deformación o parpadeo en cara y manos.
Causas y correcciones:
- Prompt incompatible: describe un movimiento lógico para la imagen
- Imagen demasiado compleja: simplifica el fondo o crea una entrada más limpia
- VRAM saturada: reduce frames, resolución o precisión
- Movimiento excesivo: baja motion o strength si el workflow lo ofrece
Prueba otra variante I2V o seed si el modelo no encaja con el estilo.
5. Preparar un workflow AnimateDiff
AnimateDiff utiliza una pila distinta de Wan.
5.1 Preparar el Motion Module
El motion module es el componente central. Como carpeta y formatos pueden cambiar con AnimateDiff-Evolved, toma como referencia el README actual, el workflow de ejemplo y la lista del node.
Comprueba si está destinado a SD 1.5, SDXL u otra arquitectura y si coincide con base checkpoint y workflow. Reinicia ComfyUI tras descargarlo y verifica que aparece en el loader.
5.2 Elegir el Base Checkpoint
AnimateDiff no reemplaza el modelo base; añade movimiento a un modelo de difusión de imagen compatible.
Selección:
- Usa un checkpoint SD 1.5 o SDXL compatible con motion module y workflow
- Prueba checkpoints de estilo existentes con pocos frames
- No trates un checkpoint normal como modelo de video completo
Consulta la guía para elegir modelos Stable Diffusion.
5.3 Conectar el workflow
Un workflow AnimateDiff suele incluir:
- Checkpoint Loader: cargar base checkpoint compatible
- Motion Model Loader: cargar motion module o motion model
- Context Options: configurar la ventana de contexto
- Video latent node: definir resolución y frames
- Text encoding, sampling, VAE Decode y combinación de video
La relación entre frames y context length depende de la versión. Empieza con los valores del ejemplo y cambia un ajuste cada vez.
6. Definir un presupuesto de parámetros y rendimiento
VRAM y duración son los principales límites locales. Estos valores son puntos de partida, no garantías de GPU.
6.1 Matriz inicial de VRAM, frames y resolución
| VRAM | Inicio prudente | Se puede probar | Evitar al principio |
|---|---|---|---|
| 8 GB | AnimateDiff, resolución baja, unos 16 frames, batch 1 | Workflows low-VRAM comunitarios | Wan en alta resolución, clips largos, varias ramas |
| 12 GB | AnimateDiff corto y pequeño | Wan de baja precisión, tamaño pequeño y pocos frames | Clips 720P largos y posprocesado complejo |
| 16 GB | Prueba Wan FP8 corta según indicaciones oficiales | Plantilla 480P o 720P correspondiente | Varias ramas simultáneas y videos largos |
| 24 GB+ | Más margen para clips cortos | Mayor resolución o frames | Batch, VAE y posprocesado siguen necesitando límites |
El requisito real varía con versión, GPU, VAE, custom nodes y workflow. La tabla solo sirve para elegir la primera prueba.
6.2 Reducir la carga en este orden
Si falta VRAM:
- Reduce
frames, por ejemplo de 48 a 24 o 16 - Baja de 720P a 480P o a otro tamaño compatible
- Mantén batch en 1 y desactiva ramas de control y posprocesado innecesarias
- Si es compatible, cambia de fp16 a fp8 u otra precisión inferior
- Prueba tiles espaciales y ajustes temporales de VAEDecodeTiled o VAEEncodeTiled
- Usa
--lowvramu otra opción compatible - Desactiva preview y cierra otras aplicaciones de GPU
Opciones low-VRAM, cache y VAE tiled deben probarse con la versión y el workflow actuales.
6.3 Equilibrar duración y calidad
Más largo no significa mejor. Los clips cortos son más fáciles de controlar; los largos suelen requerir movimiento menor y generación por segmentos.
Riesgos:
- Parpadeo: cambian color o brillo entre frames
- Deformación: derivan cara, manos o contornos
- Movimiento débil: prompt o ajuste motion insuficiente
Para un video largo, valida un segmento corto y después usa continuation, I2V o posproducción compatible. Duplicar frames no garantiza consistencia.
7. Entender la salida y el guardado de video
Muchos workflows de ComfyUI producen primero frames y los combinan después mediante VideoHelperSuite o un node similar.
7.1 Funciones de los nodes VideoHelperSuite
| Función | Uso | Ajustes frecuentes |
|---|---|---|
| Load Video | Importar video o secuencia | frame_count, frame_rate, width/height |
| Video Combine | Combinar frames | frame_rate, format, salida |
| Node Save Video | Guardar el archivo | format, quality, save_output |
Nombres, parámetros y formatos cambian con la extensión. Load Video importa un video existente; Video Combine o equivalente convierte los frames en archivo.
7.2 Convertir FPS, frames y duración
La fórmula es:
duration (segundos) = frames / FPS
Ejemplos:
- 48 frames @ 16 FPS = 3 segundos
- 72 frames @ 12 FPS = 6 segundos
Opciones de FPS:
| FPS | Efecto |
|---|---|
| 12 | Los mismos frames duran más, pero el movimiento puede verse entrecortado |
| 16 | Equilibrio entre duración y fluidez |
| 24 | La secuencia se reproduce más rápido y termina antes |
| 30 | Se necesitan más frames para mantener la duración |
FPS controla la velocidad, pero no crea imágenes intermedias. Un clip más largo requiere más frames o segmentos; mayor fluidez puede exigir interpolación.
7.3 Corregir fallos de guardado
| Fallo | Corrección |
|---|---|
| Falta ffmpeg o dependencia | Sigue el README y revisa ffmpeg -version |
| Carpeta sin permisos | Da acceso de escritura o usa la salida predeterminada |
| Encoder o formato incompatible | Guarda frames y elige un formato compatible |
| No llegan frames al saver | Revisa latent, VAE Decode y conexiones de salida |
8. Resolver errores comunes
Un workflow de video puede fallar en varios niveles. Revísalos en orden sin cambiar ajustes inconexos a la vez.
8.1 Resolver Missing Nodes
El workflow importado muestra bloques rojos Missing Nodes.
Orden:
- Comprueba en ComfyUI Manager los node packs necesarios
- Busca el nombre exacto del node ausente
- Si Manager no lo encuentra, clona el repositorio en
custom_nodes/ - Reinicia ComfyUI
La guía para reutilizar workflows de ComfyUI ofrece más detalle.
8.2 Corregir rutas de modelos
Una carpeta incorrecta suele dejar la lista vacía.
| Tipo | Carpeta habitual |
|---|---|
| Wan diffusion model | models/diffusion_models/ |
| Wan VAE | models/vae/ |
| CLIP Vision | models/clip_vision/ |
| text encoder | models/text_encoders/ |
| AnimateDiff motion module | Sigue el README actual y la lista del node |
Haz coincidir nombre, tarea, resolución y precisión con el workflow.
8.3 Resolver OOM
Agotar VRAM es el error de recursos más común.
Orden:
- Reduce frames, resolución y precisión
- Mantén batch en 1 y corta ramas extra
- Prueba VAEDecodeTiled o temporal chunk
- Usa una opción compatible como
--lowvram - Desactiva preview y cierra otras aplicaciones GPU
8.4 Corregir parpadeo, deformación o movimiento débil
| Problema | Causa probable | Ajuste |
|---|---|---|
| Parpadeo | Coherencia temporal baja o context/motion inadecuado | Fija seed, acorta la prueba y ajusta context o motion |
| Deformación | Imagen compleja, movimiento excesivo o límite del modelo | Simplifica la entrada, reduce movimiento o cambia de modelo |
| Movimiento débil | Prompt sin acción o motion bajo | Añade una acción concreta y ajusta motion gradualmente |
| Calidad baja | Checkpoint, motion module o VAE incompatibles | Revisa la combinación y vuelve al workflow de ejemplo |
La guía de prompts Stable Diffusion ayuda a estructurar las acciones.
8.5 Corregir VAE Decode bloqueado
VAE Decode se bloquea, funciona muy lento o llega a OOM.
Soluciones:
- Reduce frames y resolución
- Prueba VAEDecodeTiled con tiles espaciales o temporal chunks
- Verifica que el VAE corresponde al workflow
- Vuelve a descargar un modelo dañado desde una fuente fiable y compruébalo
8.6 Corregir deriva I2V tras el primer frame
Es un patrón frecuente en I2V.
| Causa | Ajuste |
|---|---|
| Prompt incompatible con la imagen | Describe un movimiento coherente con la entrada |
| Imagen inicial demasiado detallada | Simplifica el fondo o crea una entrada más limpia |
| Movimiento demasiado grande | Empieza con subtle motion o slow camera push-in |
| Modelo I2V inadecuado para el estilo | Prueba otra variante, workflow o seed |
9. Continuar con control, posprocesado y automatización
Cuando el primer workflow sea estable, elige el siguiente paso según el límite real que hayas encontrado.
9.1 Guías relacionadas de la serie
Este es el capítulo de video de la serie práctica ComfyUI y Stable Diffusion. Consulta estos requisitos cuando sea necesario:
- Introducción a ComfyUI: estabiliza primero la imagen fija
- Reutilizar workflows de ComfyUI: importa JSON y resuelve custom nodes
- Elegir modelos Stable Diffusion: selecciona un checkpoint compatible
- Prompts para Stable Diffusion: añade acción y cámara a una estructura sólida
Otros artículos cubren low-VRAM, reparación frame a frame, automatización API y conflictos de versiones. Estabiliza un workflow corto antes de añadir capas.
9.2 Documentación oficial y proyectos
Empieza por fuentes oficiales:
- Documentación de ComfyUI
- ComfyUI Wan2.2 Tutorial: fuente principal para Wan
- Wan-Video/Wan2.2 en GitHub: variantes y tareas
- ComfyUI-AnimateDiff-Evolved: implementación AnimateDiff
- ComfyUI-VideoHelperSuite: importación y exportación
- Documentación de VAEDecodeTiled: VAE tiled
- ComfyUI Startup Flags: opciones low-VRAM
9.3 Licencias y uso comercial
Comprueba la licencia actual de cada modelo:
- Para Wan 2.2, revisa LICENSE en Wan-Video/Wan2.2
- Para AnimateDiff, revisa LICENSE en AnimateDiff
Antes del uso comercial, verifica:
- Si la licencia permite uso comercial
- Si tienes derechos sobre el material, sobre todo la imagen inicial I2V
- Cómo se aplican los derechos del contenido generado al proyecto y la plataforma
Esto no es asesoría legal. La licencia actual del repositorio es la referencia.
Conclusión
Wan y AnimateDiff cubren workflows de video ComfyUI distintos. Wan crea video desde texto o imagen inicial; AnimateDiff reutiliza checkpoints compatibles para animaciones cortas. Carpetas, versiones de nodes y plantillas deben coincidir con el workflow real. La matriz es un comienzo prudente, no una garantía de GPU. Si faltan recursos, reduce frames, resolución, ramas, precisión y carga del VAE en ese orden.
Para Missing Nodes, rutas de modelos, OOM, parpadeo, deformación, VAE Decode bloqueado o fallos de exportación, diagnostica capa por capa. Empieza con pocos frames, resolución baja y batch 1, valida toda la cadena y aumenta una sola variable por prueba.
Ejecutar el primer workflow de video corto en ComfyUI
Valida toda la cadena, desde la elección de la ruta y los modelos hasta una prueba mínima y la exportación.
- 1
Step 1: Comprobar el workflow básico
Confirma que ComfyUI genera imágenes fijas de forma estable y que puedes importar un workflow, identificar nodes ausentes y revisar rutas de modelos. - 2
Step 2: Elegir la ruta de video
Usa Wan T2V para texto, Wan I2V para una imagen inicial o AnimateDiff si necesitas reutilizar un checkpoint SD. - 3
Step 3: Preparar los modelos
Sigue el workflow y la documentación oficial para obtener diffusion model, VAE, text encoder, CLIP Vision o motion module. - 4
Step 4: Instalar los nodes necesarios
Instala los custom nodes desde ComfyUI Manager y prepara una extensión de exportación como VideoHelperSuite. - 5
Step 5: Ejecutar una prueba mínima
Empieza con pocos frames, resolución baja y batch 1, sin ControlNet, upscale ni posprocesado complejo. - 6
Step 6: Combinar y guardar el video
Cuando se generen los frames, configura frame rate y formato, y exporta con Video Combine, Save Video o un node equivalente. - 7
Step 7: Aumentar una variable cada vez
Fija el seed y cambia un solo valor por prueba; ante OOM, parpadeo o deriva, retrocede en frames, resolución, precisión y VAE.
FAQ
¿Conviene empezar con Wan o AnimateDiff para video en ComfyUI?
¿Cuál es la diferencia entre frames y FPS en ComfyUI?
¿Por qué ComfyUI entrega imágenes en vez de un archivo mp4?
¿Se puede generar video en ComfyUI con 8 GB de VRAM?
¿Por qué image-to-video se aleja de la imagen inicial?
¿Qué hago si la generación se bloquea en VAE Decode?
15 min de lectura · Publicado el: 23 jul 2026 · Actualizado el: 24 jul 2026
Guía práctica de ComfyUI y Stable Diffusion
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Optimizar ComfyUI con poca VRAM: SDXL, FLUX y video en GPU de 6–8 GB
Ejecuta ComfyUI con 6–8 GB de VRAM controlando modelo, T5, VAE, resolución y batch, y diagnostica errores OOM y workflows FLUX o de video demasiado lentos.
Parte 8 de 10
Siguiente
Automatizar la generación de imágenes con la API de ComfyUI
Exporta un workflow API, envíalo a /prompt, espera por WebSocket, descarga resultados y añade parámetros, límites de cola y seguimiento backend.
Parte 10 de 10



Comentarios
Inicia sesión con GitHub para dejar un comentario