什么是 Wan Animate 2?AI 角色动画指南

2026/08/23

AI 视频工具可以靠一句话生成一个场景,但角色动画一直是另一类问题:你想要的,是让一个特定的人、吉祥物或虚拟形象,做出特定的动作。这正是 Wan Animate 2 在做的事。2026 年 8 月 7 日,阿里通义实验室将其开源——输入一张参考图加一段驱动视频,就能让图中的角色复刻视频里的动作、表情和手势,无需骨骼提取,镜头角度还可以由你指定。

什么是 Wan Animate 2?

Wan Animate 2(模型名 Wan2.2-Animate-2-14B)是一个端到端角色动画框架。你只需要准备两样输入:

  • 参考图——人物、动漫角色、吉祥物、机器人甚至动物都可以。输出会保持这个形象的身份。
  • 驱动视频——任意一段包含肢体动作、手势和面部表情的素材。输出会复刻这段表演。

模型会生成一段新视频:你的角色做出驱动视频中的动作,外观始终忠于参考图。而背景和镜头视角不再受素材限制——两者都可以通过文字提示词指定。

它和 Wan 3(文生视频/图生视频模型)是互补的关系:Wan 3 负责从提示词“创作”场景,Wan Animate 2 负责把表演“迁移”到你选定的角色上。配合使用正好覆盖完整流程:用 Wan 3 生成素材和角色,再用 Wan Animate 2 让角色动起来。

核心功能

  • 无需骨骼提取。 传统方案要先从驱动视频里提取骨骼或关键点,这一步会丢掉微表情、手指动作等细节。Wan Animate 2 直接把驱动视频喂给模型,保留了让表演“活”起来的关键细节。
  • 身份一致性极强。 角色在整个片段中始终保持可辨认,即使是卡通形象复刻真人的舞蹈这种跨体型迁移,也不会“越演越不像”。
  • 文本驱动镜头控制。 输出机位与驱动视频解耦。输入“俯视”“缓慢环绕”这类提示词,同一段动作可以出多机位版本,无需重新拍摄素材。
  • 背景完全由提示词控制。 角色身后的场景由文字生成,与参考图和驱动视频的背景无关。
  • 多角色同框。 单轮生成可以同时动画化多个角色,各自身份和动作保持独立。
  • 长视频。 托管服务支持最长 120 秒的驱动视频,分段生成、无缝衔接。
  • Lite 实时版。 Wan-Animate-2-Lite 在 400×720 分辨率下可达约 24fps,为数字人直播、实时互动虚拟形象打开了可能性。

工作原理

核心判断很简单:参考视频本身就是最好的运动先验。 与其把动作压缩成骨骼或隐特征、在中间环节丢失信息,不如让一个重新设计的扩散 Transformer(DiT)直接消费驱动视频。

三个架构设计让这条路走得通:

  • 双分支 DiT——参考分支固定在 t=0 时刻提供干净的运动先验,把 key/value 特征传给生成分支,避免运动信息在去噪过程中衰减。
  • 时间对齐 RoPE——参考帧与生成帧共享同一条时间线,即使输入输出分辨率不一致,帧与帧的对应关系依然精确。
  • 稀疏参考注意力——每个生成帧只关注时间上对齐的参考帧,大幅降低显存和计算开销,同时不损失运动保真度。

视角 LoRA(用约 5 万条多视角渲染样本训练)把镜头控制变成文字任务;Lite 变体则通过三阶段训练——带误差缓冲的教师强制预训练、Self-Forcing 蒸馏、分块反向传播——实现逐块流式生成,且长序列不累积误差。

训练数据包含超过 10 万对由动画模型合成的配对视频,覆盖全身、半身、特写等镜头,分辨率最高达 2.5K。

如何使用

三种入门方式任选:

  1. 在线体验——魔搭创空间提供了免费在线 Demo,跑的是同一个模型。
  2. 调用托管 API——WaveSpeedAI 等服务已提供 REST API,支持 480p / 720p 输出,按生成时长计费,适合产品和批量工作流。
  3. 本地部署——开源仓库、ComfyUI 原生节点、Hugging Face Diffusers 管线以及 DiffSynth-Studio(支持推理和 LoRA 微调)一应俱全。注意官方默认配置面向 8×A800(720P),480P 在 2×A800 上测试过,建议准备 80GB 级别的显卡。

想要好效果,需要准备三样东西:

  • 一张清晰的角色参考图,全身优先。
  • 一段动作清晰可见的驱动视频,避免严重遮挡和运动模糊。
  • 一段只描述外观和背景的提示词。官方推荐先用 LLM 给参考图生成客观描述(外观 + 背景,不写动作词),因为动作信息已经在驱动视频里了。

实用技巧:参考图与驱动视频保持相近构图(全身对全身);先用 480p 短片段试跑;在提示词里明确写出想要的输出背景。

它最擅长什么

只要需求是“让选定角色跟随一段真实表演”,Wan Animate 2 都很能打:

  • 数字人与直播——Lite 版把流式角色动画带到虚拟主播、直播带货等实时互动场景。
  • 舞蹈与复杂动作迁移——舞蹈、乐器演奏、运动等快节奏非刚性动作,比基于骨骼的方案少很多伪影。
  • 动漫与 IP 角色——让静态插画变成可动角色,多角色同框时各自身份独立。
  • 营销与电商——无需拍摄,就能让品牌吉祥物和产品角色出演广告创意。
  • 教育与内容创作——快速生成虚拟讲师、课程主播类口播视频。
  • 游戏与元宇宙原型——文本控制机位,同一段动作轻松渲染多个视角,用于分镜预演。

在官方盲测中,超过 70% 的用户认为新版优于上一代 Wan-Animate,效果也与 Dreamina、Kling MotionControl 等商业方案有竞争力。当然,任何创作工具都要拿自己的角色和素材实测,才算公平判断。

写在最后

Wan Animate 2 是 2026 年最值得关注的开源角色动画方案:Apache 2.0 协议、商用无限制、输入简单、身份保真度高,还有面向实时交互的 Lite 版本。它不是全能场景生成器——凭空创作镜头和角色素材是 Wan 3 的事——但作为视频流程中“动作迁移”这一环,很难找到更合适的选择。

想先准备好输入素材?用 Wan 3 生成你的角色图和驱动片段,再交给 Wan Animate 2 让它动起来。

Wan AI 团队

Wan AI 团队