Netflix Research publie VOID, un modèle de suppression d'objets vidéo tenant compte des interactions physiques
VOID, le modèle de Netflix Research, supprime un objet vidéo en simulant ses interactions physiques réelles, surpassant Runway avec 64,8 % de préférence.
Des chercheurs de Netflix et de l'université de Sofia publient VOID, un framework de suppression d'objets vidéo capable de reconstruire les conséquences physiques induites par cette suppression. Là où les outils existants se limitent à effacer l'apparence d'un objet et à corriger ses effets visuels immédiats (ombres, reflets), VOID modélise ce que la scène aurait produit si l'objet n'avait jamais été présent : un objet tenu en l'air tombe, une collision n'a pas lieu, un effet domino s'interrompt. Le modèle repose sur CogVideoX, un transformeur vidéo de 5 milliards de paramètres, affiné sur des paires de vidéos contrefactuelles générées via les moteurs de simulation Kubric et HUMOTO. L'entraînement mobilise un système de masques à quatre valeurs (quadmask) qui distingue l'objet à supprimer, la zone de chevauchement, les zones affectées par la suppression et le fond à préserver. À l'inférence, un modèle de langage visuel génère ces masques automatiquement à partir d'un simple clic utilisateur. Un premier passage produit la vidéo contrefactuelle. Un second passage optionnel, basé sur un bruit aligné par flux optique, corrige les déformations structurelles que le modèle peut introduire lors de la synthèse de nouveaux mouvements. Lors d'une évaluation par préférence humaine sur 75 vidéos réelles, VOID est sélectionné dans 64,8 % des cas, devant Runway (18,4 %) et Generative Omnimatte (11,2 %). Le modèle et les checkpoints sont disponibles sur Hugging Face sous licence Apache 2.0. L'intégralité de la documentation se trouve ici