HappyHorse 1.1 : la nouvelle version du modèle vidéo d'Alibaba
Alibaba lance HappyHorse 1.1, une mise à jour de son modèle IA vidéo via API améliorant la fluidité, le suivi de prompt long et la cohérence multi-images.
Alibaba pousse une nouvelle version de HappyHorse, son modèle de génération vidéo développé par l'unité ATH. La 1.1 reprend les bases de la 1.0 et resserre quatre aspects de la fabrication d'une vidéo.
Le nom traîne déjà une réputation : repéré au printemps après une apparition anonyme sur un classement public, le modèle avait pris la tête des tests à l'aveugle avant qu'Alibaba ne s'en déclare l'auteur.
Premier chantier, le mouvement, qu'Alibaba dit plus fluide et plus ample, grâce à une modélisation retravaillée et une meilleure continuité d'une image à l'autre. Deuxième, la référence multi-images, dite R2V, qui cherche à préserver l'identité d'un même sujet à partir de plusieurs feuilles de personnage sans les confondre, en séparant les images de personnage de celles du décor. Vient ensuite le suivi d'instructions, plus solide sur les prompts longs : une seule consigne peut décrire une suite de scènes, le modèle répartissant lui-même la durée et les coupes de caméra. Le dernier porte sur la qualité d'image, avec des textures moins artificielles, une peau adoucie sans effet plastique et des gros plans soignés pour micro-dramas et publicité. L'audio, lui, reste généré en même temps que l'image, dialogue calé et lip-sync compris, comme dans la version précédente. Le modèle s'utilise via API.