Trois agents pour faire du smartphone un environnement d’exécution

Qwen Intelligence rassemble trois agents spécialisés dans la planification, l’exécution d’actions sur smartphone et la création de contenus. Alibaba accompagne cette architecture d’une série de benchmarks ouverts consacrés aux tâches mobiles, aux interactions entre applications et à l’utilisation sur appareils réels.

Un agent pour planifier, un autre pour agir

Le prochain terrain des agents IA tient dans une poche. Avec Qwen Intelligence, Alibaba assemble trois systèmes spécialisés pour répartir les différentes étapes d’une tâche réalisée depuis un smartphone.

Le Mobile Planner Agent interprète la demande, la décompose et coordonne les outils ou agents nécessaires à son exécution. Le Mobile-Use Agent prend ensuite en charge les interactions avec le téléphone. Son fonctionnement privilégie les API lorsqu’elles sont accessibles et revient à l’interface graphique lorsqu’une opération nécessite de manipuler directement une application.

Le troisième composant, Mobile Creative Agent, se concentre sur la production de contenus à partir d’une instruction courte. Qwen indique notamment une première génération d’image en environ trois secondes, soit près de deux fois plus rapidement que les systèmes retenus dans sa comparaison. Ce résultat provient des propres évaluations d’Alibaba. Planifier avec des outils, de la mémoire et plusieurs agents

Le Mobile Planner Agent ne se limite pas à produire une suite d’étapes. Son architecture combine un Planner Model avec un système qui conserve l’état de la tâche, récupère des éléments en mémoire, appelle des outils et des Skills, puis délègue certaines opérations à des sous-agents spécialisés.

L’exécution reste intégrée à la boucle de planification. Lorsqu’un outil échoue ou renvoie un résultat inattendu, le planner peut réviser la procédure plutôt que poursuivre une séquence définie à l’avance.

Sur MobilePA-Bench, le Qwen-Planner-Agent 27B obtient 77,05 % au score global dans les résultats publiés par Alibaba. GPT-6 Astra atteint 76,84 %, Claude Opus 5 75,71 % et Qwen 3.8 Max 71,77 % dans cette même évaluation. Le benchmark couvre l’utilisation d’outils, la mémoire, les Skills et la coordination entre sous-agents. Passer de l’API à l’écran du téléphone

Le Mobile-Use Agent s’occupe de l’exécution. Il peut rechercher une information, comparer des options, organiser une action ou traverser plusieurs applications en combinant appels d’outils et manipulation de l’interface.

Alibaba publie 82,1 % de réussite sur MobileWorld et 92,2 % sur MobileWorld-Real, ce dernier évaluant l’agent sur de véritables appareils. La page technique actuelle indique également 97,5 % sur AndroidDaily.

Le système ne se limite pas au smartphone. Les évaluations publiées couvrent aussi l’utilisation d’un ordinateur et d’un navigateur, avec 79,5 % sur OSWorld-Verified et 73,6 % sur WebArena. Ces résultats restent ceux rapportés par l’équipe Qwen dans son propre environnement d’évaluation. Des benchmarks mobiles ouverts en parallèle

Alibaba publie également les environnements utilisés pour mesurer ces agents. MobilePA-Bench évalue la planification dans un environnement mobile interactif et persistant plutôt qu’à partir d’une simple liste statique d’appels API.

Le benchmark contient 1 705 tâches et 212 outils répartis entre 13 domaines fonctionnels. Il teste également la collaboration entre sous-agents, l’utilisation d’informations mémorisées et l’appel de Skills préconfigurés.

MobileWorld se concentre davantage sur l’exécution et les parcours impliquant plusieurs applications. Qwen complète l’ensemble avec MobileWorld-Real pour les appareils physiques et MobileWorld-Safety pour les comportements liés à la sécurité.

Qwen Intelligence réunit ainsi planification, manipulation d’interfaces et génération de contenus dans une même architecture mobile, tandis que ses différents composants restent documentés séparément à travers leurs rapports et benchmarks.