Las herramientas de video con IA pueden generar una escena a partir de una frase, pero la animación de personajes siempre ha sido un problema distinto: usted quiere que una persona, mascota o avatar específicos realicen un movimiento específico. Eso es exactamente lo que hace Wan Animate 2. Publicado como código abierto por el laboratorio Tongyi de Alibaba el 7 de agosto de 2026, toma una imagen de referencia y un video guía, y hace que el personaje de la imagen ejecute el movimiento, la expresión y los gestos del video — sin extracción de esqueleto y con el ángulo de cámara que usted quiera.
¿Qué es Wan Animate 2?
Wan Animate 2 (nombre del modelo Wan2.2-Animate-2-14B) es un marco de animación de personajes de extremo a extremo. Usted le da dos entradas:
- Una imagen de referencia — un personaje, persona, mascota, robot o incluso un animal. La salida conserva esta identidad.
- Un video guía — cualquier clip con movimiento corporal, gestos de manos y expresiones faciales. La salida copia esta interpretación.
El modelo genera un video nuevo donde su personaje ejecuta el movimiento del video guía, mientras la apariencia se mantiene fiel a la imagen de referencia. El fondo y la perspectiva de cámara ya no están atados al metraje de origen — usted describe ambos en un prompt de texto.
Es una herramienta distinta de Wan 3, el generador de texto/imagen a video. Wan 3 inventa una escena a partir de un prompt; Wan Animate 2 transfiere una interpretación a un personaje que usted elige. Usados juntos, cubren ambos lados del trabajo: cree el metraje o el personaje con Wan 3, y luego anime con Wan Animate 2.
Funciones clave
- Sin extracción de esqueleto. Los sistemas antiguos convierten primero el video guía en huesos o puntos clave, lo que pierde detalles finos como microexpresiones y movimiento de dedos. Wan Animate 2 alimenta el video guía directamente al modelo, preservando el movimiento sutil que hace que una interpretación se sienta viva.
- Fuerte preservación de identidad. El personaje de referencia permanece reconocible durante todo el clip — incluso con grandes diferencias de tipo de cuerpo, como un dibujo animado bailando el baile de un humano.
- Control de cámara por texto. La cámara de salida está desacoplada del video guía. Pida "ángulo cenital" o "toma orbital lenta" y el modelo reencuadra la misma interpretación, sin volver a filmar nada.
- Fondo controlado por prompt. La escena detrás del personaje se genera desde su prompt, no se copia de ninguna de las entradas.
- Escenas con varios personajes. Una generación puede animar varios personajes a la vez, cada uno con su propia identidad y movimiento.
- Videos largos. Los servicios alojados admiten videos guía de hasta 120 segundos, con segmentos encadenados sin fisuras.
- Transmisión en tiempo real con Lite. La variante Wan Animate-2-Lite alcanza unas 24 fps a 400×720, abriendo la puerta a la transmisión en vivo de humanos digitales y avatares interactivos.
Cómo funciona
La idea central es simple: el video de referencia es el mejor prior de movimiento. En lugar de comprimir el movimiento en esqueletos o características latentes y perder información en el camino, un transformador de difusión (DiT) rediseñado consume el video guía directamente.
Tres decisiones arquitectónicas lo hacen práctico:
- DiT de doble rama — una rama de referencia mantiene la información limpia de movimiento en t=0 y alimenta las características clave/valor a la rama de generación, para que el movimiento no decaiga durante el denoising.
- RoPE alineado en tiempo — los fotogramas de referencia y generados comparten una línea de tiempo, manteniendo precisa la correspondencia entre fotogramas incluso cuando las resoluciones de entrada y salida difieren.
- Atención de referencia dispersa — cada fotograma generado solo atiende a sus tokens de referencia alineados en el tiempo, reduciendo memoria y cómputo sin perder fidelidad de movimiento.
Un LoRA de punto de vista (entrenado con unas 50.000 muestras renderizadas multivista) convierte el control de cámara en una tarea de texto, y la variante Lite usa una receta de entrenamiento de tres etapas — preentrenamiento por forzado de profesor con buffer de errores, destilación Self-Forcing y retropropagación por bloques — para transmitir la generación bloque a bloque sin acumular errores.
Los datos de entrenamiento incluyen más de 100.000 videos sintéticos emparejados que cubren tomas de cuerpo completo, medio cuerpo y primeros planos hasta resolución 2.5K.
Cómo usarlo
Hay tres formas de empezar:
- Pruebe la demo en línea — la demo del estudio ModelScope ejecuta el mismo modelo gratis.
- Use una API alojada — servicios como WaveSpeedAI la exponen como API REST con salida de 480p y 720p, cobrada por segundo generado, ideal para productos y flujos por lotes.
- Ejecútela localmente — el repositorio de código abierto, los nodos de ComfyUI, el pipeline de Diffusers de Hugging Face y la integración con DiffSynth-Studio cubren desde la inferencia hasta el ajuste fino con LoRA. Tenga en cuenta que los valores predeterminados oficiales apuntan a 8×A800 GPU a 720P y 480P se probó en 2×A800, por lo que se recomienda una configuración GPU seria (clase de 80 GB).
Para obtener buenos resultados, prepare tres cosas:
- Una imagen de referencia clara de su personaje, preferiblemente de cuerpo completo.
- Un video guía con movimiento limpio y visible — evite la oclusión fuerte y el desenfoque de movimiento.
- Un prompt que describa solo la apariencia y el fondo. El patrón recomendado es subtitular la imagen de referencia con un LLM primero (apariencia + fondo, sin palabras de acción), porque el movimiento ya vive en el video guía.
Consejos prácticos: mantenga la imagen de referencia y el video guía en el mismo encuadre (cuerpo completo a cuerpo completo), empiece con clips cortos a 480p y describa explícitamente el fondo de salida.
Qué hace mejor
Wan Animate 2 brilla donde necesite que un personaje elegido siga una interpretación real:
- Humanos digitales y transmisión en vivo — la variante Lite lleva la animación de personajes en streaming a escenarios interactivos como anfitriones virtuales y e-commerce en vivo.
- Danza y transferencia de movimiento complejo — movimientos rápidos y no rígidos como baile, tocar un instrumento y deportes salen con muchos menos artefactos que los métodos basados en esqueleto.
- Anime y personajes de IP — convierta una ilustración estática en un personaje animable, incluidas escenas de varios personajes con identidades independientes.
- Marketing y e-commerce — dé vida a mascotas de marca y personajes de producto en creatividades publicitarias sin rodaje.
- Educación y creación de contenido — convierta avatares y presentadores de cursos en videos de cabezas parlantes rápidamente.
- Protopipado de juegos y metaverso — el control de cámara por texto facilita renderizar la misma acción desde varios ángulos para previsualización.
En los estudios ciegos de usuarios del equipo, más del 70% de los usuarios prefirieron Wan Animate 2 sobre la generación anterior, y los resultados fueron competitivos con herramientas comerciales como Dreamina y Kling MotionControl. Como con cualquier herramienta creativa, la forma justa de juzgarla es probarla con sus propios personajes y metraje.
La conclusión
Wan Animate 2 es la opción de código abierto más práctica para animación de personajes en 2026: licencia Apache 2.0, uso comercial gratuito, entradas simples, fuerte preservación de identidad y una vía en tiempo real para aplicaciones interactivas. No es un generador de escenas completo — para inventar metraje o imágenes de personajes desde un prompt, ese es el trabajo de Wan 3 — pero como la mitad de transferencia de movimiento de un flujo de video, es difícil de superar.
¿Listo para construir las entradas? Genere sus imágenes de personajes y metraje guía con Wan 3 y luego anímelos con Wan Animate 2.
