Trois travaux de World Labs sur la 3D générée depuis une image
World Labs dévoile World Tracing, Modality Forcing et Flex4DHuman, trois IA génératives 3D et 4D qui transforment des images et vidéos en scènes dynamiques.
Le laboratoire d'intelligence spatiale met en avant trois recherches menées par ses stagiaires, autour d'une même idée : générer de la 3D en exploitant de grands modèles génératifs et les priors 2D qu'ils ont appris.
World Tracing reconstruit une scène 3D complète à partir d'une seule image ; pour chaque pixel, un modèle de diffusion empile une série ordonnée de points, de la surface visible à la géométrie cachée derrière, ce qui restitue les zones occultées sans s'éloigner de l'image. Ses auteurs revendiquent une précision de surface au niveau des meilleurs estimateurs de profondeur monoculaire, et une fidélité géométrique supérieure aux générateurs image-to-3D et video-to-4D.
Modality Forcing adapte les modèles text-to-image pour raisonner conjointement sur texte, image et profondeur : un même backbone DiT, entraîné avec un niveau de bruit distinct par modalité, bascule entre estimation de profondeur, génération depuis la profondeur et génération RGB-D conjointe ; appliqué à FLUX.2-klein-9B, il égalerait des modèles de profondeur dédiés comme MoGe-2 ou PPD.
Flex4DHuman, enfin, transforme une vidéo monoculaire, jusqu'à une simple capture de téléphone, en humain dynamique 4D : un modèle de diffusion vidéo finetuné produit des vues multiples synchronisées, distillées en splats gaussiens 4D et réintégrables dans des mondes 3D, avec des usages visés en AR/VR et dans le jeu.
Chaque projet s'accompagne d'un papier, d'une page et d'une démo publics.