HeyGen lance Avatar V, un système de génération d'avatars vidéo à cohérence d'identité persistante

HeyGen lance Avatar V, un moteur d'avatar vidéo qui maintient l'identité du sujet et surpasse Kling O3 Pro et Veo 3.1 en synchronisation labiale.

HeyGen dévoile Avatar V, une nouvelle version de son moteur de génération d'avatars vidéo. Le système capture l'identité d'un individu à partir d'une séquence de référence de 15 secondes et la préserve sur l'ensemble des vidéos générées, quelle qu'en soit la durée. Tenue, décor, apparence : les variables visuelles peuvent être modifiées librement sans altérer les caractéristiques propres au sujet, qu'il s'agisse de sa gestuelle, de sa synchronisation labiale ou de ses micro-expressions. Techniquement, le modèle repose sur un Diffusion Transformer conditionné sur la séquence complète de tokens de la vidéo de référence, sans compression d'identité. Un pipeline d'entraînement en cinq étapes intègre fine-tuning, distillation et alignement par RLHF. Sur les benchmarks publiés, Avatar V devance Kling O3 Pro, Veo 3.1, OmniHuman 1.5 et Seedance 2.0 sur la synchronisation labiale, la similarité faciale et six dimensions d'évaluation humaine. Le rapport technique complet est disponible sur le site de HeyGen Research.