WAN 2.2 Animar es un modelo abierto de animación y reemplazo de personajes diseñado para transferir movimiento y expresión de un video de referencia a una imagen de personaje. A diferencia de la generación de imagen a video común, no pide al modelo que invente la actuación solo a partir de un texto. El video de referencia proporciona movimiento corporal, comportamiento facial y sincronización.
El proyecto oficial Wan2.2 presentó el modelo 14B Animate en septiembre de 2025 como un marco unificado para animación y reemplazo de personajes. Desde entonces, las demostraciones populares en ComfyUI se han enfocado en dos modos: animar un personaje independiente a partir de una actuación de referencia y reemplazar al intérprete dentro de un video existente preservando el movimiento y el contexto de la escena.
En Este Artículo
WAN 2.2 Animar: Animación de Personajes vs Reemplazo de Personajes

| Modo | Entradas | Objetivo de salida | Mejor uso |
|---|---|---|---|
| Animación de personaje | Imagen de personaje + video de referencia | Animar el personaje de referencia con el movimiento transferido | Ilustraciones, avatares, artistas estilizados |
| Reemplazo de personaje | Imagen de personaje + video original | Reemplazar al intérprete original dentro de la escena existente | Intercambio de personajes, escenas conceptuales, fondos controlados |
El modo de animación enfatiza el personaje objetivo. El modo de reemplazo también debe preservar la cámara, el fondo, la oclusión y la iluminación del video original. Por lo tanto es más difícil: el nuevo cuerpo debe contactar el mismo suelo, pasar detrás de los mismos objetos y heredar sombras plausibles.
Intercambio de personajes WAN 2.2 Animar no es un simple intercambio de rostro. El modelo puede reemplazar ropa, forma corporal y apariencia siguiendo la actuación original. Si solo es necesario cambiar el rostro, un flujo de trabajo más específico de reemplazo facial puede preservar más del metraje original.
Entradas que Determinan la Calidad de WAN Animar

La Imagen de Referencia del Personaje
Utiliza una imagen limpia en alta resolución con un personaje claramente visible. Las tomas de cuerpo completo requieren una referencia que muestre todo el vestuario y la proporción corporal. Pies recortados, manos ocultas y ropa ambigua obligan al modelo a inventar información durante el movimiento.
- Mantén las extremidades visualmente separadas cuando sea posible.
- Evita desenfoques de movimiento fuertes, distorsión extrema de lente o fondos ocupados.
- Alinea la orientación corporal de la imagen objetivo con la pose inicial del video de referencia.
- Usa una expresión neutra o compatible para movimientos donde predomine el diálogo.
- Para personajes estilizados, preserva una silueta definida y estructura articular clara.
El Video de Referencia
El video de referencia es el plano del movimiento. Un encuadre estable, buen contraste y articulaciones visibles importan más que el pulido cinematográfico. Giros rápidos, auto-ocultamiento, manos cruzando la cara o saliendo del cuadro aumentan el riesgo de error. Comienza con un clip corto en el que una persona realice una acción clara.
Si la imagen aprobada solo necesita movimiento inventado por el modelo en vez de coreografía copiada, un flujo estándar de imagen a video es más sencillo. WAN Animar es valioso cuando se requiere transferir una actuación específica.
Flujo de trabajo WAN 2.2 Animar en ComfyUI

ComfyUI es la ruta más documentada para ejecutar WAN 2.2 Animar. Los flujos de trabajo oficiales y de la comunidad agrupan la carga de modelo, preprocesado, acondicionamiento de referencia, muestreo y salida de video en un grafo de nodos.
- Instala o actualiza ComfyUI. Usa un entorno limpio y confirma que los nodos personalizados requeridos coincidan con la versión del flujo de trabajo.
- Descarga los archivos correctos del modelo. Verifica los puntos de control de Animate, codificadores de texto, VAE y cualquier variante optimizada o cuantizada especificada por el autor del flujo.
- Carga la imagen del personaje. Recórtala para mostrar la anatomía que requiere la actuación.
- Carga y recorta el video de referencia. Comienza con un clip corto y estable para estimar memoria y calidad.
- Selecciona modo de animación o reemplazo. Los nodos y el acondicionamiento difieren; no asumas que un flujo funciona igual en ambos casos.
- Define resolución y número de fotogramas de forma conservadora. Clips más largos y mayor resolución multiplican el consumo de memoria y el tiempo de renderizado.
- Genera una prueba de bajo costo. Inspecciona identidad, manos, pies, rostro y la integración con el fondo.
- Revisa los recursos originales antes de ajustar cualquier otra cosa. Una referencia más clara suele ayudar más que añadir adjetivos al prompt.
- Escala y haz interpolación solo después de aprobar la prueba. El acabado no puede corregir una estructura de movimiento incorrecta.
Tutoriales populares de MDMZ y Max Novak demuestran el valor práctico de usar flujos de trabajo preparados en vez de construir cada nodo de memoria. También muestran los verdaderos cuellos de botella: descargas del modelo, VRAM, preparación del clip y la diferencia entre un avance rápido y una salida final terminada.
Flujo nativo vs flujo optimizado
Un flujo nativo generalmente prioriza la implementación y calidad de referencia, mientras que los flujos optimizados pueden usar cuantización, descarga de memoria, procesamiento por mosaico o implementaciones alternativas de atención. La optimización puede hacer posible el uso local en GPUs más pequeñas, pero puede añadir complejidad de instalación o variar velocidad y fidelidad de salida.
Registra el punto de control exacto, cuantización, JSON del flujo, semilla, dimensiones y recuento de fotogramas. “WAN 2.2” por sí solo no es información suficiente para reproducir un resultado.
Ejemplos de Prompts WAN 2.2 Animar

El movimiento proviene principalmente del video de referencia, por lo que el prompt debe estabilizar la apariencia e interpretación de la escena en vez de describir coreografías alternativas.
Reemplazo fotorrealista de personaje
Mujer adulta fotorrealista con chaqueta de running azul marino ajustada y pantalones deportivos negros, textura natural de piel, identidad facial consistente, luz exterior nublada igualando la escena original, contacto realista del pie y movimiento de la prenda, conservar movimiento original de cámara y fondo, sin extremidades extra, sin distorsión facial.
Animación estilizada de cuerpo completo
Personaje de novela gráfica de cuerpo completo con contornos de tinta gruesos, chaqueta roja corta, botas oscuras y proporciones consistentes, conservar la actuación de referencia y el tiempo facial, grosor de línea estable entre cuadros, manos limpias, sin cambios de vestuario, sin parpadeo de fondo.
Actuación para mascota de producto
Mascota robot naranja amigable con casco redondeado brillante y logo blanco en el pecho, reproducir gestos y movimiento de cabeza del presentador original, iluminación suave de estudio, geometría del logo estable, sombra correcta en el suelo, cámara fija, sin dedos duplicados.
Mantén las instrucciones de movimiento compatibles con el clip de referencia. Si el intérprete camina a la izquierda, pedir una pose estática de frente crea una condición conflictiva.
Problemas comunes y soluciones WAN 2.2 Animar

| Problema | Causa probable | Mejor solución inicial |
|---|---|---|
| Deriva de identidad | Referencia de personaje débil o desalineada | Usa una referencia más clara alineada con la pose inicial |
| Deformación de manos | Movimiento rápido, oclusión o baja visibilidad de origen | Elige una toma más lenta o recorta la región difícil |
| Deslizamiento de pies | Contacto débil con el suelo o desajuste de encuadre | Utiliza pies visibles y un plano de suelo estable |
| El rostro y los labios se ven incorrectos | Baja resolución facial o giros extremos de cabeza | Usa un origen más cercano y limita transiciones de perfil |
| Cambios de vestuario | La referencia no muestra el disfraz completo | Proporcione una imagen de personaje completa y sin ambigüedades |
| El fondo parpadea | La sustitución reconstruye demasiado de la escena | Utilice una fuente más limpia y componga el personaje por separado |
| El tamaño del personaje cambia | Movimiento profundo grande o proporciones incompatibles | Use una actuación conductora con distancia estable |
| Error de memoria insuficiente | Resolución, fotogramas o precisión de modelo demasiado altos | Reduzca la prueba, utilice offloading o una cuantización soportada |
Separe los defectos de generación de los de entrega. La ampliación puede mejorar una cara estable, pero no corrige una mano extra. La interpolación de fotogramas puede suavizar el movimiento aceptable, pero también puede amplificar las deformaciones. Repare en la etapa más temprana donde aparece el error.
Mejorando la consistencia del personaje
Una sola imagen de referencia no muestra todos los lados de un personaje. Los giros de perfil y las extremidades cruzadas requieren que el modelo infiera detalles ocultos. Elija un vídeo conductor compatible con la información visible, o cree un conjunto de referencia de personajes antes de animar. La consistencia también mejora cuando el disfraz de origen tiene formas claras en vez de patrones intrincados y repetitivos.
Para otros métodos basados en referencia, compare la lógica de control con Kling Motion Control. El objetivo no es coronar un solo ganador a partir de una demo, sino probar qué sistema conserva el movimiento específico y la identidad que su proyecto requiere.
WAN 2.2 Opciones para animar local, online y vía API

| Ruta de acceso | Ventaja | Compromiso |
|---|---|---|
| ComfyUI local | Control, repetibilidad y archivos privados | Descargas grandes, memoria GPU y configuración |
| ComfyUI GPU alojado | Usa flujos de trabajo conocidos sin hardware local | Costo de alquiler, tiempo de carga y gestión de entorno |
| Interfaz online gestionada | Configuración más rápida | Menor visibilidad de versiones y controles de flujo de trabajo |
| Proveedor API | Automatización e integración en lotes | Precios, límites y retención específicos del proveedor |
WAN 2.2 es abierto, pero “gratis” no significa sin coste. La inferencia local requiere hardware, electricidad, almacenamiento y tiempo de configuración. Los servicios alojados cobran por tiempo de GPU o generaciones. Antes de subir rostros o secuencias de clientes, revise los términos de retención, entrenamiento y privacidad.
Para usuarios que no requieren transferencia de movimiento o nodos locales, Media.io ofrece una vía más ligera desde el navegador. Genere movimiento desde una imagen aprobada con Image to Video, luego ensamble sólo los clips exitosos. Esto reduce la configuración para conceptos sociales y momentos simples de personajes.
WAN 2.2 Animate vs Kling y Omnihuman

| Familia de herramientas | Control principal | Mejor ajuste |
|---|---|---|
| WAN 2.2 Animar | Imagen del personaje + actuación guía | Flujos abiertos de transferencia de movimiento y reemplazo de personaje |
| Flujos de movimiento Kling | Control de imagen y movimiento basado en plataforma | Creadores que prefieren generación gestionada |
| Sistemas tipo OmniHuman | Animación humana a partir de señales multimodales | Investigación y servicios sobre humanos digitales parlantes o actuantes |
| Imagen a vídeo estándar | Prompt + imagen inicial | Movimiento inventado sin actuación guía exacta |
Use la misma imagen fuente y clip de guía al comparar servicios. Evalúe identidad facial, estructura de extremidades, temporización gestual, contacto de pies, iluminación, preservación del fondo, tiempo de renderizado y coste. Un clip corto atractivo no garantiza fiabilidad.
Para alternativas gestionadas, consulte la actualidad de Kling 2.6 de imagen a vídeo, Generación WAN 2.6 y Seedance 2.5 imagen a vídeo. Estas páginas tratan generaciones adyacentes; no replican automáticamente la transferencia de referencia-vídeo de WAN Animate.
Lista de verificación de producción
- La imagen objetivo del personaje muestra todas las partes del cuerpo requeridas por la actuación.
- El clip guía contiene un solo sujeto legible con oclusión limitada.
- La pose del primer fotograma y las proporciones corporales son compatibles.
- La prueba es lo suficientemente corta para diagnosticar sin desperdiciar recursos computacionales.
- Se revisan identidad, manos, pies, ropa y fondo cuadro por cuadro.
- La semejanza y la actuación de origen están autorizadas.
- El clip final está etiquetado o divulgado donde las reglas de la plataforma lo exijan.
Si WAN Animate es sólo un clip dentro de una secuencia mayor, flujos alternativos de Seedance pueden ayudar con escenas adyacentes. Vea Seedance 2.0 imagen a vídeo, su opción de generación más rápida, un flujo Seedance orientado a 4K, y la guía de prompts de Seedance solo cuando esas herramientas se ajusten al plano requerido.
Preguntas frecuentes

-
¿Qué es WAN 2.2 Animate?
WAN 2.2 Animate es un modelo abierto de 14B para animación y reemplazo de personaje usando una imagen de personaje y un vídeo de referencia o guía. -
¿Cuál es la diferencia entre modo animación y modo reemplazo?
El modo animación transfiere la actuación a un personaje objetivo, mientras que el modo reemplazo intercambia el intérprete dentro de la escena original y debe conservar más fondo y contexto de iluminación. -
¿Puede ejecutar WAN 2.2 Animate localmente?
Sí, comúnmente vía ComfyUI, pero el tamaño del modelo y la inferencia de vídeo requieren mucha memoria GPU, almacenamiento y configuración. Los flujos de trabajo optimizados pueden reducir los requerimientos de hardware. -
¿WAN 2.2 Animate es gratis?
El modelo y los flujos de trabajo pueden estar libremente disponibles, pero el hardware local, tiempo de GPU alojado, almacenamiento o créditos de servicios gestionados igual generan costes. -
¿Por qué se deforman manos y caras?
El movimiento rápido, la oclusión, la baja resolución facial y la falta de detalles en la referencia fuerzan al modelo a inferir anatomía compleja entre fotogramas. -
¿Es WAN 2.2 Animate mejor que Kling?
WAN es atractivo para flujos abiertos de transferencia de movimiento con ComfyUI, mientras que Kling puede ofrecer una experiencia gestionada más sencilla. Pruebe ambos con la misma imagen y vídeo guía.




