Anthropic publie BioMysteryBench, un benchmark de bioinformatique pour Claude
Anthropic lance BioMysteryBench, un benchmark de bioinformatique où Claude Opus 4.6 atteint 77,4 % de réussite, surpassant parfois les experts humains.
Anthropic a publié les résultats de BioMysteryBench, un benchmark composé de 99 questions de bioinformatique conçu pour évaluer la capacité de ses modèles à mener des analyses scientifiques sur des jeux de données réels et bruités. Les questions, rédigées par des experts du domaine, portent principalement sur des données brutes de séquençage ADN ou ARN, complétées par quelques tâches en protéomique et métabolomique. Chaque réponse repose sur une vérité terrain objective, validée expérimentalement ou par métadonnées, plutôt que sur l'interprétation d'un chercheur, ce qui distingue ce protocole d'autres références comme BixBench ou SciGym. Sur les 76 problèmes résolus au moins une fois par un panel humain, Claude Opus 4.6 affiche 77,4 % de réussite. Sur les 23 problèmes que les experts n'ont pas su trancher, Claude Mythos Preview atteint 30 %, et plusieurs modèles dépassent déjà la performance d'un panel de cinq spécialistes. Anthropic identifie deux stratégies récurrentes employées par Claude : la mobilisation directe de connaissances issues de l'entraînement (ontologies, mécanismes biologiques, méta-analyses) et la convergence de plusieurs méthodes lorsque le modèle hésite sur la réponse à donner. L'analyse de fiabilité conduite par Mythos Preview met toutefois en évidence une fragilité notable sur les tâches difficiles : près de la moitié des bonnes réponses obtenues sur ce sous-ensemble proviennent d'une seule réussite sur cinq tentatives, signe que le modèle parvient à la solution sans pouvoir la reproduire de manière stable. En parallèle, Genentech et Roche ont publié CompBioBench, un benchmark proche dont les conclusions vont dans le même sens, avec un score de 81 % pour Opus 4.6. BioMysteryBench est accessible publiquement, et Anthropic invite la communauté à soumettre d'autres tâches de recherche vérifiables à scienceblog@anthropic.com.