AI動画ツールは文章からシーンを生成できますが、キャラクターアニメーションは常に別の問題でした。求められるのは特定の人物、マスコット、アバターが特定の動きをすることです。まさにそれを行うのがWan Animate 2です。Alibabaの通義実験室(Tongyi Lab)が2026年8月7日にオープンソースで公開したこのモデルは、1枚の参照画像と1本の駆動動画を取り込み、画像内のキャラクターに動画の動き・表情・ジェスチャーを演じさせます — 骨格抽出なしで、好きなカメラアングルで。
Wan Animate 2とは?
Wan Animate 2(モデル名 Wan2.2-Animate-2-14B)はエンドツーエンドのキャラクターアニメーションフレームワークです。2つの入力を与えます:
- 参照画像 — キャラクター、人物、マスコット、ロボット、動物でも可。出力はこのアイデンティティを保ちます。
- 駆動動画 — 身体の動き、手のジェスチャー、表情のある任意のクリップ。出力はこのパフォーマンスをコピーします。
モデルは、参照画像に忠実な外見を保ったまま、駆動動画の動きをキャラクターが演じる新しい動画を生成します。背景とカメラ視点はソース映像に縛られず、テキストプロンプトで両方を指定します。
これはテキスト/画像から動画を生成するWan 3とは別のツールです。Wan 3はプロンプトからシーンを作り出し、Wan Animate 2は選んだキャラクターにパフォーマンスを転写します。組み合わせて使えば、仕事の両側をカバーできます:Wan 3でフッテージやキャラクターを作り、Wan Animate 2でアニメーション化する。
主な機能
- 骨格抽出なし。 従来システムはまず駆動動画を骨格やキーポイントに変換し、その過程で微表情や指の動きといった細部を失います。Wan Animate 2は駆動動画を直接モデルに渡し、パフォーマンスを生き生きと感じさせる微妙な動きを保持します。
- 強いアイデンティティ保持。 参照キャラクターはクリップ全体で認識可能なまま保たれます — 漫画キャラクターが人間のダンスを踊るような体型の大きな差でも。
- テキスト駆動のカメラ制御。 出力カメラは駆動動画から切り離されています。「トップアングル」「ゆっくり周回するショット」と頼めば、再撮影なしで同じパフォーマンスを再構図します。
- プロンプト制御の背景。 キャラクターの背後にあるシーンはプロンプトから生成され、どちらの入力からもコピーされません。
- マルチキャラクターシーン。 1回の生成で複数のキャラクターを同時にアニメーション化でき、それぞれが自分のアイデンティティと動きを保ちます。
- 長尺動画。 ホスティングサービスは最大120秒の駆動動画に対応し、セグメントをシームレスに連結します。
- Liteによるリアルタイム配信。 Wan Animate-2-Liteは400×720で約24fpsに達し、デジタルヒューマンのライブ配信やインタラクティブアバターへの扉を開きます。
仕組み
核となるアイデアはシンプルです:参照動画こそが最良のモーションプライアです。 動きを骨格や潜在特徴に圧縮して情報を失う代わりに、再設計された拡散トランスフォーマー(DiT)が駆動動画を直接消費します。
3つのアーキテクチャ上の選択がこれを実用的にしています:
- デュアルブランチDiT — 参照ブランチがt=0のクリーンなモーション情報を保持し、キー/バリュー特徴を生成ブランチに供給するため、デノイジング中にモーションが減衰しません。
- 時間整列RoPE — 参照フレームと生成フレームが1つのタイムラインを共有し、入力と出力の解像度が異なってもフレーム間対応を正確に保ちます。
- スパース参照アテンション — 各生成フレームは時間整列された参照トークンのみに注目し、モーション忠実度を失わずにメモリと計算を削減します。
ビューポイントLoRA(約5万サンプルのマルチビュー合成データで学習)がカメラ制御をテキストタスクに変え、Lite版は3段階のトレーニングレシピ — エラーバッファ付きティーチャーフォーシング事前学習、Self-Forcing蒸留、チャンク単位バックプロパゲーション — でエラーを蓄積せずにチャンク単位でストリーミング生成します。
トレーニングデータには、全身、半身、クローズアップショットをカバーする10万以上のペア合成動画が最大2.5K解像度で含まれます。
使い方
始める方法は3つあります:
- オンラインデモを試す — ModelScopeスタジオのデモは同じモデルを無料で実行します。
- ホスト型APIを使う — WaveSpeedAIなどのサービスが480p・720p出力のREST APIとして提供し、生成秒数ごとに課金。製品やバッチワークフローに最適です。
- ローカルで実行する — オープンソースリポジトリ、ComfyUIノード、Hugging Face Diffusersパイプライン、DiffSynth-Studio統合が推論からLoRAファインチューニングまでをカバーします。公式デフォルトは720Pで8×A800 GPU、480Pは2×A800でテストされているため、本格的なGPU環境(80GB級)が推奨されます。
良い結果を得るには3つを準備します:
- キャラクターのクリアな参照画像(全身が好ましい)。
- クリーンで可視性のある動きの駆動動画 — 重度のオクルージョンやモーションブラーは避けます。
- 外見と背景だけを説明するプロンプト。推奨パターンは、まずLLMで参照画像をキャプション化すること(外見+背景、アクション語なし)。動きはすでに駆動動画に含まれているからです。
実践的なヒント:参照画像と駆動動画を同じフレーミング(全身から全身)に保ち、480pの短いクリップから始め、出力背景を明示的に説明しましょう。
得意なこと
Wan Animate 2は、選んだキャラクターが本物のパフォーマンスに従う必要がある場面で輝きます:
- デジタルヒューマンとライブ配信 — Lite版が仮想ホストやライブECなどのインタラクティブなシーンにストリーミングキャラクターアニメーションをもたらします。
- ダンスと複雑なモーション転写 — ダンス、楽器演奏、スポーツのような速く非剛体な動きが、骨格ベースの手法よりはるかに少ないアーティファクトで出力されます。
- アニメとIPキャラクター — 静止イラストをアニメーション可能なキャラクターに変換し、独立したアイデンティティのマルチキャラクターシーンにも対応。
- マーケティングとEC — 撮影なしで広告クリエイティブにブランドマスコットや製品キャラクターの命を吹き込みます。
- 教育とコンテンツ制作 — アバターやコースホストをクイックにトーキングヘッド動画に。
- ゲームとメタバースのプロトタイピング — テキスト駆動のカメラ制御で、プリビジュアライゼーション用に同じアクションを複数アングルから簡単にレンダリングできます。
チームのブラインドユーザー調査では、70%超のユーザーが前世代よりWan Animate 2を好み、DreaminaやKling MotionControlなどの商用ツールと競合する結果でした。他のクリエイティブツールと同様、公正な判断方法は自分のキャラクターとフッテージでテストすることです。
結論
Wan Animate 2は2026年で最も実用的なオープンなキャラクターアニメーションオプションです:Apache 2.0ライセンス、商用利用無料、シンプルな入力、強いアイデンティティ保持、インタラクティブアプリケーションへのリアルタイム経路。完全なシーンジェネレーターではありません — プロンプトからフッテージやキャラクター画像を作るのはWan 3の仕事 — しかし、動画パイプラインのモーショントランスファー半分としては、打ち負かすのは難しい存在です。
入力を作る準備はできましたか?Wan 3でキャラクター画像と駆動フッテージを生成し、Wan Animate 2でアニメーション化しましょう。
