H3 rassemble génération, références multimodales et édition vidéo

Le modèle MiniMax H3 réunit la génération, l'édition locale et l'intégration de douze références visuelles ou sonores pour stabiliser les plans.

MiniMax H3 réunit la génération vidéo à partir de texte, l’animation d’une image, le contrôle par première et dernière image, ainsi que l’utilisation de références visuelles, sonores et vidéo dans un même contexte. Le modèle produit des séquences jusqu’en 2K, avec un son stéréo généré nativement et une durée pouvant atteindre 15 secondes.

Le mode de référence accepte jusqu’à neuf images, trois extraits vidéo et trois fichiers audio, dans une limite globale de douze éléments. Ces sources peuvent servir à conserver un personnage, reprendre un mouvement de caméra, transférer une voix, suivre un rythme de montage ou maintenir une direction visuelle au fil de la génération. Les consignes peuvent atteindre 7 000 caractères, ce qui permet de décrire plusieurs plans ou relations entre les références dans une seule requête.

H3 prend aussi en charge l’édition localisée de séquences existantes. Il peut remplacer un produit, modifier un texte, changer une réplique, ajuster l’éclairage ou ajouter un élément sans reconstruire volontairement l’ensemble du plan. MiniMax met particulièrement en avant le rendu des typographies, des interfaces, des sous-titres et des éléments graphiques animés.

Cette approche repose sur une architecture qui traite conjointement le texte, l’image, la vidéo et l’audio. Pour produire les sorties en 2K, le modèle régénère sa première version en conservant le contexte initial, plutôt que d’appliquer uniquement une étape d’agrandissement séparée. MiniMax affirme que ce fonctionnement aide à récupérer des détails fins et à mieux maintenir les textes.

H3 est accessible par API, ainsi que dans ComfyUI grâce à une intégration partenaire. MiniMax prévoit également de rendre les poids du modèle accessibles prochainement, sous réserve des contraintes juridiques applicables.