Animation de personnages en bout en bout : l’approche de Wan-Animate-2

Wan-Animate-2 anime plusieurs personnages, dissocie les mouvements des angles de caméra et propose une version temps réel à 24 FPS.

Wan-Animate-2 est un framework de 14 milliards de paramètres consacré à l’animation de personnages à partir d’une image de référence et d’une vidéo servant de guide au mouvement. Contrairement à des approches reposant sur une extraction préalable des mouvements, le système exploite directement la vidéo de référence dans son architecture Diffusion Transformer afin de préserver l’apparence du personnage et les détails du mouvement.

Le modèle peut animer plusieurs personnages dans une même scène, chacun conservant son identité et son mouvement. Il ajoute aussi un contrôle de caméra indépendant de la vidéo source : une instruction textuelle comme « top view » peut modifier l’angle de vue sans imposer celui de la séquence utilisée pour guider l’animation.

Une déclinaison Wan-Animate-2-Lite cible les usages en temps réel. Alibaba rapporte une génération à 24 images par seconde en 400 × 720 sur quatre GPU H100, avec une production découpée en segments permettant de prolonger la séquence. L’équipe affirme ne pas observer d’accumulation visible d’erreurs au fil de ces segments.

L’architecture combine notamment des mécanismes dédiés à l’alignement temporel entre la référence et la vidéo générée, ainsi qu’une sélection des informations visuelles utiles issues de l’image de départ. La version Distillation réduit de son côté le processus à dix étapes d’inférence, contre quarante dans l’exemple fourni pour la version Base.

Les poids et le code d’inférence sont accessibles sur Hugging Face, ModelScope et GitHub sous licence Apache 2.0. Le dépôt indique des réglages par défaut pour une génération 720p sur huit GPU A800 et mentionne également des tests en 480p sur deux A800.