Echoverse entraîne les agents dans des applications synthétiques

La suite Echoverse de Microsoft Research apprend aux agents à manipuler des applications complexes. Les performances de navigation web augmentent de 30 %.

Echoverse est une collection d’applications synthétiques conçues pour apprendre aux agents à naviguer dans des interfaces, modifier des données et mener des tâches en plusieurs étapes. Contrairement à une simple reproduction visuelle d’un site, chaque environnement possède son propre système de données, ses règles, ses autorisations et un mécanisme chargé de vérifier le résultat réel des actions.

Microsoft Research a construit dix environnements reproduisant des usages comme la messagerie, le calendrier, la banque, la santé, la réservation ou la gestion de code. Deux autres se concentrent sur des difficultés précises rencontrées par les agents, notamment les sélecteurs de dates et les systèmes de filtres imbriqués, déclinés sous de nombreuses formes.

Entraîné sur les douze environnements, un modèle Qwen3.5 de 9 milliards de paramètres est passé d’un score moyen de 36,5 % à 67,1 %. Il se rapproche ainsi des 80,7 % obtenus par GPT-5.4 et le dépasse sur certains scénarios, dont EchoBank et plusieurs tests de filtrage. Les progrès se retrouvent aussi sur des sites extérieurs à l’entraînement, avec une hausse de 66,5 % à 71,5 % sur WebVoyager.

Les essais montrent toutefois que la quantité ne suffit pas. Des copies superficielles d’Allrecipes et Hugging Face ont parfois dégradé les performances, tandis que des versions reproduisant réellement les dépendances entre plusieurs étapes ont amélioré les résultats. La diversité des environnements transfère également davantage de compétences vers le web réel que la répétition massive de tâches similaires.

Echoverse sert enfin de support à l’apprentissage par renforcement. Les actions sont vérifiées directement dans la base de données de l’application, ce qui permet de récompenser un changement réellement effectué plutôt qu’une réponse simplement plausible. Sur cinq environnements, cette phase a fait progresser les performances sur des tâches conservées pour l’évaluation de 58 % à 69 %. Microsoft publie quatre environnements avec leur code, leurs données et leurs systèmes de vérification.