Un AI Scientist de 27B entraîné à reproduire des travaux de recherche

Faraday est un AI Scientist de 27B entraîné par RL à reproduire des travaux scientifiques et à piloter des coding agents sur des tâches de recherche longues.

Faraday est un agent de 27 milliards de paramètres entraîné à reproduire des résultats issus de publications scientifiques. Plutôt que de se limiter à répondre à des questions sur un papier, il doit reconstruire des expériences et retrouver une figure donnée avec un temps et un budget de calcul limités, sans avoir accès au graphique original.

Pour cet entraînement, Inherent a développé Replica, un ensemble de 310 tâches provenant de 100 publications en machine learning et AI for science. Les domaines couverts vont du traitement du langage aux matériaux, en passant par la biologie structurale ou les prévisions météorologiques. Chaque tâche oblige l’agent à retrouver une démarche expérimentale qui n’est que partiellement décrite dans le papier.

Cette difficulté est au cœur du projet. Reproduire un résultat ne consiste pas uniquement à obtenir une figure ressemblante : il faut choisir les bonnes hypothèses, adapter l’expérience aux contraintes disponibles, évaluer les résultats intermédiaires et abandonner certaines pistes. Inherent décrit cet ensemble de décisions comme une forme de « research taste », que Faraday apprend grâce à un judge LLM validé auprès d’humains, des rubriques spécifiques à chaque tâche et un système de crédit attribué au niveau des différentes étapes de la trajectoire.

Faraday utilise par ailleurs des coding agents comme outils. Inherent indique notamment qu’il peut piloter GPT-5.5 Codex pour exécuter une partie du travail technique, tandis que l’agent de 27B conserve le rôle de supervision scientifique. Le modèle peut également généraliser vers un coding agent plus performant au moment de l’inférence après avoir été entraîné avec GPT-5.4-mini.

Selon les évaluations publiées par Inherent, Faraday produit des réplications plus fidèles que Claude Opus 4.8 et GPT-5.5 sur l’ensemble des catégories de Replica, avec des écarts particulièrement marqués en meta-learning, biologie structurale et science des matériaux. Les baselines ont été exécutées respectivement dans Claude Code et Codex avec un niveau de raisonnement élevé.

L’équipe cherche également à mesurer si les compétences acquises peuvent dépasser la simple réplication. Des variantes de papiers intègrent pour cela des résultats absents des travaux d’origine. Inherent rapporte que Faraday dépasse GPT-5.5 sur ces tâches dites « imagined », sans recevoir de reward au moment du test ni utiliser de harness spécifiquement conçu pour explorer de nouvelles hypothèses. L’expérience reste toutefois un environnement construit par l’équipe et ne suffit pas, à elle seule, à établir une capacité générale d’innovation scientifique autonome.