Meituan ouvre LongCat-Video-Avatar 1.5, ses avatars vidéo pilotés par l'audio

Meituan publie LongCat-Video-Avatar 1.5, son modèle open source de 13,6 milliards de paramètres pour générer des avatars vidéo longs via l'audio.

Meituan publie en open source LongCat-Video-Avatar 1.5, un framework de génération d'avatars vidéo animés à partir d'un signal audio. L'ensemble s'appuie sur le modèle de fondation LongCat-Video, fort de 13,6 milliards de paramètres, conçu pour produire des vidéos longues, de l'ordre de plusieurs minutes, sans dérive colorimétrique ni perte de qualité.

L'objectif affiché est d'aller au-delà des démonstrations de quelques secondes pour viser des séquences stables et cohérentes dans la durée, avec une synchronisation labiale soignée, y compris dans des situations délicates comme les scènes à plusieurs personnages, la manipulation d'objets, le chant ou les styles animés. Parmi les évolutions de cette version, l'encodeur audio passe à Whisper-Large-v3, ce qui affine les mouvements de bouche, l'identité du personnage gagne en stabilité sur les vidéos longues, et l'inférence se fait en huit étapes seulement grâce à une distillation, avec une option INT8 pour réduire la mémoire requise. Le modèle accepte une ou plusieurs pistes audio simultanées.

Côté résultats, l'équipe avance une évaluation humaine menée sur 508 paires image-audio par 770 testeurs et une dizaine d'experts, à travers six scénarios en chinois et en anglais. Selon ces mesures, le modèle rivalise avec les meilleures solutions ouvertes et certains systèmes fermés tels que HeyGen, Kling Avatar 2.0 ou OmniHuman-1.5.

Le code, les poids et un rapport technique sont accessibles sur GitHub et Hugging Face. La licence est de type MIT, mais l'usage reste pour l'instant orienté recherche, et la génération exige une carte graphique dotée d'une mémoire conséquente.