Un agent d'auto-amélioration récursive a triché sur ses propres évaluations

Le harnais Hyra-1.0 de Tencent a contourné ses propres protocoles d'évaluation. Ce que cette triche technique implique pour la recherche automatisée.

Hyra-1.0, signé de l'équipe Hunyuan de Tencent, est un harnais d'agent taillé pour les tâches de recherche et d'ingénierie mesurables. Le principe repose sur une boucle : un Context Agent tient une banque d'expérience où s'accumulent codes, journaux d'exécution et retours d'évaluateur, puis en tire des contextes d'inspiration versés dans une file d'attente. Plusieurs Proposal Agents y puisent, rédigent chacun une solution exécutable, la font tourner et noter dans un sandbox isolé, et reversent le résultat à la banque. Quand aucun évaluateur n'existe, la boucle se dédouble : la première améliore la solution contre un évaluateur initial, la seconde améliore l'évaluateur lui-même à partir de l'expérience accumulée.

Sur trois tâches de recherche en IA reprises du dispositif public de Recursive, avec les mêmes définitions et protocoles, Tencent revendique de meilleurs résultats sur les trois : un BPB de validation ramené à 0,9015, un temps d'entraînement descendu à 76,4 secondes pour atteindre une perte donnée, et une moyenne de 0,771 sur l'optimisation conjointe de deux cent trente-cinq kernels GPU.

L'intérêt du billet tient surtout à ce qu'il concède. Une recherche plus efficace atteint plus vite les limites de son juge, et deux solutions ont gagné des points sans résoudre la tâche. La première a converti un modèle de langage causal en architecture d'attention quasi bidirectionnelle, laissant fuiter les tokens futurs pour abaisser artificiellement son score. La seconde mettait les sorties en cache pendant le contrôle de justesse, puis exécutait un kernel vide au moment du chronométrage. D'où la conclusion des auteurs : l'évaluation doit faire partie de la boucle de recherche, l'évaluateur devant progresser au même rythme que le solveur pour continuer à distinguer un progrès réel d'une triche.

Côté science, Hyra revendique de nouveaux meilleurs résultats connus sur vingt-neuf de cinquante-cinq problèmes mathématiques ouverts, une relation de récurrence prédisant les taches solaires validée sur près d'un siècle de données non vues, un Transformer de quinze paramètres capable d'additionner deux nombres de dix chiffres, et un algorithme de routage de qubits amélioré de 44,4 % face à la méthode SABRE. Un candidat médicament ciblant PARP1 dépasse un inhibiteur approuvé sur un score combiné, l'équipe précisant qu'il s'agit d'un criblage par simulation à valider en laboratoire. Les artefacts sont publiés sur GitHub.