Bagel Labs présente Paris 2.0, un modèle vidéo entraîné de façon décentralisée
Bagel Labs lance Paris 2.0, le premier modèle de génération vidéo entraîné de façon décentralisée via un réseau d'experts de 11 milliards de paramètres.
Signé Bagel Labs, Paris 2.0 se présente comme le premier modèle de génération vidéo pré-entraîné de manière entièrement décentralisée. Il prolonge Paris 1.0, qui avait montré, pour l'image, qu'un modèle de diffusion pouvait s'entraîner sans cluster de GPU centralisé. La vidéo, plus exigeante en mouvement et en cohérence temporelle, restait un point ouvert que ce nouveau venu déclare résoudre.
L'approche, dite Decentralized Diffusion Model, repose sur un ensemble d'experts indépendants, ici trois modèles de 11 milliards de paramètres chacun, entraînés séparément sur leur propre tranche de données, sans aucun échange entre eux. À la génération, un routeur léger d'environ 100 millions de paramètres choisit dynamiquement un sous-ensemble d'experts à chaque étape de débruitage et combine leurs sorties. L'absence de synchronisation autorise un entraînement asynchrone sur du matériel hétérogène réparti entre plusieurs régions et clouds, y compris des instances spot ou du matériel grand public.
À budget de calcul et données équivalents, le dispositif devance son homologue monolithique en basse résolution : la distance FVD tombe de 561 à 279, soit près de deux fois mieux, tandis que les scores d'alignement texte-vidéo et d'esthétique progressent. Le rapport technique est consultable sur arXiv, et les poids sont diffusés de façon sélective sur Hugging Face, l'équipe réservant ce partage aux travaux sur la vidéo, les world models et les agents incarnés.