HyperFlow réduit MiniMax H3 de 49 à 8 passes de génération
Video Rebirth publie HyperFlow, un LoRA pour MiniMax H3 obtenu par self-distillation sans données externes. Le système ramène le sampling de 49 à 8 passes et accélère d’environ trois fois la génération sur H200 dans les mesures publiées par l’équipe.
Un LoRA pour raccourcir le sampling
Faire tourner un modèle vidéo à chaque étape de débruitage concentre une grande partie du coût de génération. HyperFlow attaque directement ce point en modifiant le sampling de MiniMax H3.
Dans le pipeline Diffusers utilisé comme référence, le modèle effectue 49 passages avec une grille de 50 valeurs sigma. HyperFlow sur GitHub réduit ce processus à huit passages sur une grille fixe apprise pendant l’entraînement. Le modèle de base, les VAE, le conditioner et les workflows vidéo et audio de MiniMax H3 restent inchangés.
HyperFlow prend la forme d’un LoRA PEFT de 2,8 Go appliqué à 316 modules, couvrant attention, feed-forward et deux time embedders. Le même fichier fonctionne avec les workflows text-to-video, first-frame-to-video et reference-to-video de MiniMax H3. Le modèle devient son propre professeur
Video Rebirth décrit son procédé comme une data-free flow self-distillation. Le modèle de base sert lui-même de professeur : il génère des candidats, les sorties retenues alimentent ensuite la distillation, sans jeu de données externe ni annotation humaine supplémentaire.
Techniquement, HyperFlow ajoute un conditionnement sur deux instants, `t` pour l’état courant et `r` pour la fin de l’étape. Le LoRA apprend cette formulation dérivée des flow maps, tandis qu’un second composant impose la grille de huit étapes utilisée pendant l’inférence. Le reste du workflow demeure celui de MiniMax H3.
Video Rebirth rattache cette méthode à sa conception de la Recursive Self-Improvement, mais il faut distinguer les deux notions : HyperFlow démontre ici un mécanisme de self-distillation sur les sorties du modèle, pas un système capable de modifier de manière autonome l’ensemble de son architecture ou de son processus d’entraînement. Environ trois fois plus rapide sur H200
Les mesures publiées dans le dépôt comparent HyperFlow au pipeline MiniMax H3 de référence sur un clip de 124 frames en 1344 × 768.
Avec quatre H200, le temps de pipeline passe d’environ 175 à 60 secondes, soit un gain de 2,9×. Sur une seule H200 avec CPU offload, il descend d’environ 395 à 130 secondes, soit 3×.
Le gain reste inférieur au rapport théorique entre 49 et 8 passages, car l’encodage du texte et le décodage VAE ne sont pas accélérés par HyperFlow. La mémoire maximale reste par ailleurs proche de 80 Go par carte dans le protocole mesuré.
Les comparaisons qualitatives publiées par Video Rebirth revendiquent un meilleur contrôle caméra, une cohérence renforcée et davantage de détails que le pipeline de base à seed identique. Ces résultats proviennent des tests internes de l’équipe et ne constituent pas un benchmark indépendant. Une seconde accélération avec Sol-Attn
HyperFlow peut également activer Sol-Attn, le kernel d’attention sparse de NVIDIA. Après deux étapes d’attention dense, il remplace une partie des calculs sur les blocs DiT.
Une fois le coût de compilation absorbé, Video Rebirth mesure jusqu’à 13 % de gain supplémentaire sur une H200 et environ 7 % sur quatre H200. L’équipe précise toutefois qu’il s’agit d’une approximation : le résultat diffère du calcul dense, avec un PSNR vidéo d’environ 23 dB et une similarité audio mesurée à 0,88 dans leur protocole. Code ouvert, poids sous licence MiniMax
Le dépôt GitHub est publié sous licence Apache-2.0 et contient le loader, les scripts d’exemple et les composants nécessaires pour intégrer HyperFlow au pipeline Diffusers.
Les poids distribués séparément sur Hugging Face ne suivent toutefois pas cette licence. Ils constituent un dérivé de MiniMax H3 et restent régis par la MiniMax H3 Community License Agreement. Le dépôt précise que cette licence exclut notamment l’Union européenne, le Royaume-Uni, la Corée du Sud et les États-Unis sans autorisation de MiniMax.
HyperFlow ne remplace donc pas MiniMax H3 par un nouveau modèle complet. Il modifie principalement son chemin d’inférence afin de produire une génération comparable avec huit passages au lieu de 49.