gget virus, la couche déterministe d'Anthropic pour fiabiliser les agents IA en biologie

Anthropic fiabilise les agents IA en biologie avec gget virus, un outil qui fait grimper la précision des modèles de 16,9% à 99,7% sur sa base VirBench.

Anthropic publie une étude où Laura Luebbert et son équipe soutiennent que l'infrastructure des données biologiques doit être repensée pour les agents IA. Le constat de départ : confrontés à une tâche pourtant basique, récupérer des séquences virales dans la base NCBI Virus, les meilleurs agents scientifiques actuels (Claude, Biomni OSS, Edison Analysis, GPT) ne sont pas fiables. Sur leur benchmark VirBench, qui réunit 120 requêtes réalistes couvrant 40 pathogènes avec des comptes vérifiés à la main, les précisions moyennes s'étalent de 16,9 % à 91,3 %, et un même modèle renvoie souvent des réponses différentes à une requête identique posée trois fois.

La cause tient moins au raisonnement qu'à l'absence d'une couche d'exécution déterministe : une grande partie de la logique de filtrage de NCBI Virus ne vit que dans son interface web, ce qui en fait un calvaire à automatiser, exactement le "click tax" qu'Andrej Karpathy décrivait pour le développement logiciel. Les conséquences sont concrètes : sur des séquences d'Ebolavirus liées à l'épidémie de virus Bundibugyo en cours en RDC, des jeux de données incomplets décalaient la date estimée d'origine de l'épidémie ou faussaient l'analyse des cibles d'anticorps thérapeutiques.

Pour y remédier, l'équipe a développé gget virus en collaboration avec le NCBI, une couche qui orchestre les API sous-jacentes (REST, Datasets, E-utilities), gère le batching des gros volumes et renvoie des sorties standardisées et tracées. Une fois cet outil fourni aux agents, la précision dépasse 90 % pour tous, culminant à 99,7 % avec GPT-5.5, et la variabilité entre exécutions disparaît, rendant le choix du modèle presque indifférent. Les auteurs nuancent toutefois : même si les modèles finissent par savoir naviguer seuls dans ces portails, déléguer la tâche à un agent à chaque fois resterait trop coûteux, trop lent et trop difficile à auditer pour un usage scientifique de routine.