PROWL-2 apprend aux agents à repérer les erreurs de leur propre simulation

Odyssey présente PROWL-2, un framework d’apprentissage multi-agent où les agents progressent dans un World Model pendant qu’un second processus recherche et corrige les erreurs de cette simulation. Sur StarCraft II et des tâches de coordination robotique simulée, Odyssey rapporte des gains allant jusqu’à 91 % face à son baseline.

Apprendre dans une simulation qui apprend elle aussi

Un agent entraîné dans un World Model peut apprendre d’une situation qui n’a jamais existé. Le problème apparaît lorsque la simulation se trompe : l’agent risque alors d’améliorer son comportement face à une situation imaginaire erronée.

PROWL-2 organise l’entraînement autour de deux progressions simultanées. Les agents travaillent sur des scénarios classés selon leur potentiel d’apprentissage, tandis qu’un agent dédié explore l’environnement réel afin d’identifier les situations que le World Model prédit mal.

Les premiers passent progressivement de situations simples vers des problèmes plus difficiles. Le second alimente de son côté un ensemble de cas utilisés pour réparer le World Model. Une barrière entre erreur utile et hallucination

PROWL-2 ajoute un mécanisme appelé fidelity gate pour relier ces deux apprentissages.

Le système reprend régulièrement les situations considérées comme prioritaires pour les agents et compare les trajectoires imaginées par le World Model aux trajectoires réellement enregistrées. Lorsqu’un écart devient trop important, le scénario est temporairement retiré de l’entraînement des agents.

La trajectoire correspondante sert alors à améliorer le World Model. Le scénario ne revient dans le curriculum des agents qu’après plusieurs vérifications confirmant que sa prédiction est redevenue suffisamment fidèle.

Une faiblesse découverte par les agents peut donc devenir une nouvelle donnée d’entraînement pour leur environnement simulé, avant que celui-ci ne leur soumette à nouveau le problème. Jusqu’à 91 % de gain relatif dans StarCraft II

Odyssey a évalué le framework sur les neuf scénarios du StarCraft Multi-Agent Challenge v2, qui modifie les unités et leurs positions initiales afin d’empêcher les agents de mémoriser un combat fixe.

Selon les résultats publiés par l’équipe, PROWL-2 obtient la meilleure performance moyenne sur les neuf configurations et atteint jusqu’à 91 % de gain relatif par rapport au World Model utilisé comme baseline.

Sur certains scénarios retenus pour l’analyse qualitative, les écarts sont importants. En Terran 5v5, PROWL-2 atteint 87,5 % de victoires contre 7,5 % pour le baseline sur 40 simulations de test. Le Terran 10v11 passe de 2,5 % à 55 %. En Zerg 10v10, le résultat communiqué atteint 90 % contre 0 %.

Ces chiffres proviennent des évaluations réalisées par Odyssey sur son propre framework. Des quadrupèdes doivent aussi apprendre à se coordonner

L’expérience quitte ensuite StarCraft pour le Multi-Agent Quadruped Environment, un environnement simulé où plusieurs robots doivent coordonner précisément leurs déplacements.

Dans Gate-3, trois quadrupèdes doivent franchir une ouverture étroite sans se bloquer ni entrer en collision. Après 1,5 million d’étapes d’entraînement, Odyssey mesure 70,4 % de réussite avec PROWL-2 contre 29,8 % pour le baseline.

Shepherd-Hard demande à deux quadrupèdes de conduire ensemble neuf moutons vers une zone cible. Le taux de réussite passe ici de 7,3 % à 28,2 %. Faire évoluer simultanément l’agent et son environnement

PROWL-2 ne remplace ni l’algorithme d’apprentissage de la policy ni l’architecture du World Model. Le framework détermine plutôt quelles expériences doivent servir à entraîner les agents et lesquelles doivent d’abord servir à corriger la simulation.

Odyssey relie cette mécanique à une recherche plus large sur les systèmes capables d’accumuler continuellement de nouvelles expériences. L’entreprise considère cette co-évolution entre agents et World Models comme une piste vers des formes d’apprentissage ouvertes et, à plus long terme, vers la superintelligence. Cette dernière interprétation reste une position de recherche formulée par Odyssey, et non un résultat démontré par les expériences de PROWL-2.