ByteDance ouvre Bernini, un framework open-source de génération et d'édition vidéo
ByteDance lance Bernini, un framework open-source de génération et d'édition vidéo par diffusion qui sépare le raisonnement sémantique du rendu d'images.
ByteDance met en open-source Bernini, un framework unifié dédié à la génération et à l'édition de vidéos par diffusion. Sa particularité tient à une architecture qui sépare le raisonnement du rendu. Un premier module, un planificateur sémantique appuyé sur un modèle de langage multimodal (MLLM), interprète les entrées texte, image ou vidéo et prédit directement les cibles à produire, tandis qu'un second module, le renderer (moteur de rendu), fabrique ensuite les images proprement dites.
Pour maintenir la cohérence temporelle et spatiale entre les segments d'une vidéo, l'équipe introduit une technique baptisée Segment-Aware 3D RoPE. Cette logique de planification préalable, présentée comme une forme de raisonnement latent, vise les tâches les plus complexes et une meilleure généralisation au-delà des cas vus à l'entraînement. Bernini regroupe plusieurs usages sous un même toit : l'édition vidéo pilotée par prompt, qui permet de modifier un style, un décor, la météo ou des objets, l'édition guidée par une image de référence, l'insertion d'une image ou d'une vidéo dans une scène existante, et la génération d'une vidéo à partir d'une à cinq images de référence, utile pour conserver un personnage ou un objet d'un plan à l'autre.
L'outil s'inscrit dans la même dynamique que Gemini Omni, le modèle de génération et d'édition vidéo récemment présenté par Google, dont il se distingue surtout par son ouverture : là où l'offre de Google reste propriétaire et arrimée à son écosystème, le code et les modèles de Bernini sont distribués sous licence Apache-2.0 sur GitHub et Hugging Face, les poids du renderer ayant été ouverts récemment.