La spécialisation devient le terrain de jeu RL des agents

Labelbox lance Recursion pour entraîner des agents IA spécialisés via le reinforcement learning en entreprise, surpassant les modèles généralistes.

Avec Recursion, Labelbox veut transformer les workflows d’entreprise en environnements d’entraînement pour agents spécialisés.

La plateforme réunit développement, évaluation et déploiement autour d’une boucle de reinforcement learning, alimentée par les données propriétaires, les outils internes, les règles métier, les retours experts et les cas limites de chaque organisation. Labelbox met en avant un principe simple : sur des tâches précises, un modèle plus petit mais entraîné sur le bon domaine peut dépasser un modèle généraliste plus massif.

L’entreprise cite notamment un modèle 35B ajusté avec Recursion, supérieur à un 397B sur des tâches financières agentiques tenues à l’écart de l’entraînement, ainsi qu’un agent support affichant un meilleur taux de résolution, moins d’hallucinations, des réponses plus rapides et un coût inférieur par ticket. La brique WorldSim sert à recréer des environnements logiciels réalistes, tandis que les évaluations mesurent les résultats finaux, les décisions intermédiaires et la qualité d’exécution.

Recursion se positionne ainsi moins comme un outil d’agent prêt à l’emploi que comme une machine à convertir l’expertise interne en modèles spécialisés qui s’améliorent au fil des usages.