Qwen-AgentWorld, un World Model qui simule les environnements d'agents
Alibaba lance Qwen-AgentWorld, un world model de 35B paramètres simulant sept environnements réels pour entraîner et évaluer les agents IA de façon autonome.
Qwen, le laboratoire d'Alibaba, ouvre Qwen-AgentWorld, qu'il décrit comme un world model langagier. L'idée prend les agents à revers : on a beaucoup entraîné les modèles à agir dans des environnements, jamais à modéliser ces environnements eux-mêmes, c'est-à-dire à prédire ce qui survient ensuite étant donné un état et l'action d'un agent. C'est ce que vise ce modèle, qui simule sept types d'environnements au sein d'un seul, quatre en mode texte (un terminal, un moteur de recherche, des serveurs d'API via MCP, un environnement de code) et trois en interface graphique (un navigateur, un système d'exploitation, Android). La modélisation de l'environnement y est l'objectif d'entraînement dès le départ, via un pipeline en trois temps (pré-entraînement continu, fine-tuning supervisé, RL), et non une greffe tardive sur un LLM généraliste.
Qwen explore deux usages. Comme simulateur découplé, le modèle remplace l'environnement réel pendant l'entraînement par renforcement d'un agent : il prédit la réponse de l'environnement à chaque action, ce qui ouvre, selon le laboratoire, une échelle et un contrôle que le réel n'autorise pas, jusqu'à dépasser un entraînement mené en conditions réelles. Comme modèle de fondation, un échauffement à la prédiction d'état se transfère ensuite à des tâches d'agent multi-tours, y compris hors de son domaine d'entraînement.
Le modèle ouvert, une architecture MoE de 35 milliards de paramètres dont 3 activés et une fenêtre de 256K tokens, arrive sur Hugging Face et ModelScope, accompagné d'AgentWorldBench, un banc d'évaluation sur les sept domaines adossé à des observations réelles.