JING et DAO veulent simuler un monde qui continue d’exister hors champ
XGEN Labs associe JING, un modèle interactif en vue subjective, à DAO, un moteur chargé de maintenir l’état d’un environnement partagé. Le prototype cherche à dépasser la génération vidéo image après image pour conserver un monde évolutif entre plusieurs agents.
Un environnement qui ne s’arrête pas avec la caméra
Tourner la tête, avancer dans une pièce ou engager une conversation ne suffit plus. Le prototype de simulation développé par XGEN Labs repose sur deux composants complémentaires : JING génère ce qu’un agent voit et entend depuis son point de vue, tandis que DAO conserve l’état global de l’environnement, ses règles et les conséquences des actions qui s’y déroulent.
Cette séparation permet au monde simulé de continuer à évoluer au-delà de ce qu’un utilisateur observe directement. DAO détermine par exemple ce qui change dans l’environnement lorsqu’un personnage agit ailleurs, puis ne transmet à JING que les informations perceptibles depuis la position de l’observateur. Plusieurs agents peuvent ainsi évoluer dans un même espace sans disposer en permanence d’une vue complète de celui-ci. JING transforme les actions en vidéo et en audio
Le composant actuellement accessible est XGEN-JING, un modèle d’expérience interactive en vue subjective construit à partir de MiniMax-H3. À partir d’actions, d’images de référence et de l’historique des observations, il produit conjointement vidéo et audio pour gérer les déplacements, les interactions avec des objets et les conversations.
La caméra peut être pilotée au clavier, tandis que des instructions textuelles déterminent certaines interactions ou prises de parole. Plusieurs images de référence peuvent également définir des personnages, objets ou décors avant l’exploration. Le même point de départ peut donc évoluer différemment selon les commandes successives.
La version JING-Flash-v1 disponible dans le dépôt GitHub du projet utilise une inférence bidirectionnelle en quatre étapes. XGEN fournit également le code d’inférence, des exemples et des Prompt skills capables de convertir une histoire accompagnée d’images de référence en cas de test structurés. Le modèle causal et le rapport technique complet restent annoncés pour une publication ultérieure.
L’exécution locale n’est pas légère. La configuration de démonstration a été validée sur six GPU H100, répartis entre l’encodeur de texte, les composants vidéo et audio et quatre cartes consacrées au DiT avec parallélisme de séquence. Un premier résultat sur WBench
Sur WBench, benchmark consacré aux World Models vidéo interactifs, la variante bidirectionnelle de XGEN-JING a obtenu un score moyen de 81,0 sur le split Full de 289 cas lors de son entrée dans le classement. Elle occupait alors la première place. Sur les 158 cas dédiés à la navigation, son score de 81,9 la plaçait en deuxième position.
Le classement a depuis continué à évoluer, ce qui rend préférable de considérer ces positions comme une photographie du benchmark au moment de l’évaluation plutôt que comme un rang permanent. WBench mesure 22 critères regroupant qualité vidéo, respect du contexte, interaction, cohérence et comportement physique, et souligne qu’aucun modèle évalué ne domine l’ensemble de ces dimensions. De la génération d’une scène à la persistance d’un monde
La partie la plus ambitieuse du prototype se trouve finalement du côté de DAO. JING produit l’expérience perceptible d’un agent, alors que DAO est censé conserver ce qui existe derrière cette expérience : état partagé, règles, modifications de l’environnement et décisions autonomes des autres agents.
XGEN rattache cette architecture à son projet OASIS, pensé comme une simulation dans laquelle un monde, et potentiellement une société d’agents, peut continuer à évoluer avec ou sans observation humaine. À ce stade, le code public permet surtout d’expérimenter JING. La documentation technique détaillant le fonctionnement de DAO et l’ensemble du système couplé n’a pas encore été publiée.