SpAItial AI dévoile Echo-2, un world model qui génère des scènes 3D à partir d'une image

SpAItial AI lance Echo-2, un world model générant des scènes 3D persistantes via 3D Gaussian Splatting pour la robotique et les jumeaux numériques.

SpAItial AI lance Echo-2, son nouveau world model capable de produire des scènes 3D complètes à partir d'une seule image source. Contrairement aux modèles vidéo dont les sorties s'effondrent dès que l'on revient sur un point déjà filmé, le système génère un environnement spatialement persistant : la scène conserve sa cohérence géométrique quel que soit l'angle de vue ou le déplacement de la caméra. Le rendu s'effectue en temps réel grâce à l'usage du 3D Gaussian Splatting (3DGS), avec un contrôle interactif de la caméra et une qualité visuelle que l'équipe revendique au niveau de l'état de l'art selon le benchmark world score. Les sorties sont par ailleurs ancrées physiquement, ce qui ouvre la possibilité d'extraire des représentations directement exploitables en aval : maillages 3D, nuages de points ou scènes au format 3DGS. SpAItial AI positionne Echo-2 comme un pont entre le réel et le virtuel, dans les deux sens. Côté physique vers virtuel, l'outil permet de capturer un environnement existant à partir de photos pour produire un jumeau numérique éditable, avec des cas d'usage en architecture, en design d'intérieur ou en rénovation. Côté virtuel vers physique, il sert de bac à sable de simulation pour l'IA incarnée, où des robots peuvent apprendre et anticiper leurs actions dans des scènes réalistes avant d'opérer dans le monde réel. La démo est accessible sur spaitial.ai.