Des mondes interactifs aux humanoïdes : Odyssey-3 change d’échelle
Le world model Odyssey-3 simule des environnements interactifs en temps réel. Son architecture sert de base physique pour la robotique et les véhicules.
Odyssey présente Odyssey-3, son world model le plus avancé à ce jour, capable de générer des environnements interactifs en temps réel mais aussi de servir de base à des systèmes physiques comme des bras robotiques, des humanoïdes ou des véhicules autonomes. L’entreprise le décrit comme un système dynamique appris, conçu pour prédire comment les objets se déplacent, interagissent et évoluent dans le temps.
Contrairement à un modèle vidéo classique, Odyssey-3 ne cherche pas seulement à produire une séquence cohérente visuellement. Son objectif est de prédire l’état futur d’un environnement en fonction de ce qui vient de se passer et des actions effectuées à l’intérieur. Cette distinction est centrale dans la catégorie des world models : le système doit conserver une représentation suffisamment stable du monde pour répondre lorsqu’un utilisateur, un agent ou une machine modifie la situation. Un transformer de diffusion qui prédit la suite du monde
Techniquement, Odyssey-3 repose sur un diffusion transformer autoregressif. Le modèle génère plusieurs étapes vidéo successives tout en conditionnant chaque nouvelle prédiction sur les observations précédentes, les événements récents et les actions qui lui sont fournies.
Le corpus d’entraînement combine plusieurs types de données : vidéos issues d’Internet, annotations d’événements précisément localisées dans le temps, captures de jeux associées aux entrées clavier et souris, ainsi que simulations d’interactions entre corps rigides accompagnées de descriptions et de métadonnées.
Cette diversité sert à relier ce que le modèle voit à ce qui se produit ensuite et, lorsque l’information existe, à l’action ayant provoqué ce changement.
Odyssey utilise ensuite du teacher forcing et du causal masking pour entraîner le modèle à prolonger une séquence à partir de ses observations précédentes. Une phase de post-entraînement mélange enfin distribution matching et distillation adversariale afin de produire une variante nécessitant seulement quelques étapes de diffusion et suffisamment rapide pour permettre une interaction en temps réel. Des mondes générés pendant qu’on les explore
La version accessible en research preview peut générer un environnement à partir d’un prompt puis continuer à le faire évoluer pendant que l’utilisateur se déplace à l’intérieur ou provoque un événement.
Odyssey-3 prend en charge la navigation à la première et à la troisième personne ainsi qu’un déplacement indépendant de la caméra. Le système réutilise les observations précédentes et les nouvelles actions pour prédire en continu ce qui devrait apparaître ensuite.
Cette continuité constitue l’un des défis majeurs des world models. Produire une belle image à partir d’un prompt est relativement différent du fait de maintenir pendant plusieurs étapes la disposition des objets, leurs propriétés physiques et les conséquences d’une action.
C’est aussi ce qui rapproche Odyssey-3 d’un simulateur appris plutôt que d’un simple générateur vidéo. Un score de 66,1 sur Physics-IQ Verified
Odyssey met particulièrement en avant les performances physiques de son modèle.
Sur le benchmark Physics-IQ Verified, Odyssey-3 Pro atteint 66,1 en vidéo-vers-vidéo dans la configuration publiée par l’entreprise. Physics-IQ évalue la capacité d’un modèle à prolonger des expériences physiques réelles couvrant notamment la dynamique des fluides, l’optique, la mécanique des solides, le magnétisme et la thermodynamique.
La variante Pro atteint également 54,7 en image-vers-vidéo selon les résultats communiqués par Odyssey.
Il faut toutefois nuancer le terme « state of the art ». Le classement dynamique actuel de Physics-IQ Verified place FLUX 3 [large] devant Odyssey-3 Pro sur certaines configurations intégrant des prompts personnalisés et une mesure de gain net. Odyssey reste néanmoins parmi les meilleurs modèles actuellement répertoriés sur ce benchmark.
Autre détail important : les chiffres de coûts utilisés par Odyssey sont partiellement estimés. Pour ses propres modèles, l’entreprise suppose notamment un coût de 1 dollar par heure de GPU MI355X, hors frais éventuels de réécriture des prompts. Premier dans trois catégories de WorldMark selon Odyssey
Odyssey-3 est également évalué sur WorldMark, un benchmark public destiné aux world models interactifs.
WorldMark utilise des environnements standardisés, les mêmes trajectoires et une couche commune de commandes pour comparer différents modèles sur la qualité visuelle, le respect des contrôles et la cohérence du monde. Son jeu d’évaluation comprend 500 cas couvrant première et troisième personne, scènes réalistes ou stylisées et plusieurs niveaux de difficulté.
Dans les évaluations réalisées par Odyssey avec les captions officielles du benchmark, Odyssey-3 arrive premier sur trois des quatre catégories : première personne stylisée, troisième personne réaliste et troisième personne stylisée. Il reste troisième sur la catégorie première personne réaliste derrière Lyra 2.0 et AlayaWorld.
Ces résultats portent sur des propriétés spécifiques des mondes générés et ne suffisent pas, à eux seuls, à mesurer la qualité d’un système robotique réel. Odyssey le précise d’ailleurs explicitement : une adaptation à une machine doit aussi être évaluée sur les comportements réellement utiles à cette machine. Le même backbone derrière plusieurs machines
La partie la plus intéressante d’Odyssey-3 se situe probablement dans sa réutilisation comme fondation commune à plusieurs systèmes physiques.
Plutôt que de réentraîner entièrement un modèle pour chaque robot ou véhicule, Odyssey conserve le backbone du world model puis lui ajoute un action decoder ou une politique spécialisée. Cette couche apprend à convertir les représentations internes du modèle en commandes compréhensibles par la machine concernée.
Pour un bras robotique, Odyssey indique avoir utilisé seulement quelques dizaines d’heures de démonstrations. Le système aurait ensuite montré des comportements de récupération absents des exemples initiaux,