Un même modèle Claude, deux niveaux de garde-fous
Anthropic améliore le code, la recherche scientifique et les tâches longues, tout en réduisant le coût avec Claude Fable 5.1 et Claude Mythos 5.1.
Deux noms recouvrent cette fois le même système. Claude Fable 5.1 et Claude Mythos 5.1 possèdent les mêmes capacités fondamentales, mais ne sont pas soumis aux mêmes garde-fous. Le premier est accessible au public et aux entreprises, tandis que le second réserve certains usages en cybersécurité et en sciences de la vie à des organisations préalablement vérifiées.
Cette séparation ne correspond donc pas à une différence de taille, d’entraînement ou d’intelligence. Fable 5.1 applique des restrictions supplémentaires et peut rediriger certaines demandes sensibles vers d’autres modèles. Mythos 5.1 laisse davantage de latitude aux professionnels autorisés, sans supprimer les autres mesures de sécurité.
Fable 5.1 vise principalement le développement logiciel, les recherches documentaires, les tâches professionnelles et les missions prolongées nécessitant plusieurs outils. Le niveau d’effort est réglé sur High par défaut dans Claude Code, contre Medium dans Claude Cowork et sur Claude.ai. L’utilisateur peut réduire cet effort afin de privilégier la vitesse et le coût lorsque la tâche ne nécessite pas le raisonnement le plus approfondi.
Les évaluations publiées par Anthropic montrent une progression particulièrement importante dans la recherche scientifique assistée. Fable 5.1 obtient 52,6 % sur Terminal-Bench-Science 0.1, contre 24,7 % pour Fable 5, 29 % pour Opus 5 et 22,4 % pour GPT-5.6 Sol dans la configuration employée par l’entreprise.
Sur Terminal-Bench 4.0, consacré au développement logiciel autonome dans un terminal, Fable 5.1 atteint 55,8 %, contre 42 % pour Fable 5. Mythos 5.1 monte à 60,9 %. Anthropic attribue une partie de cet écart aux garde-fous de Fable, qui interviennent dans certaines tâches liées à la cybersécurité.
Les résultats progressent également sur les workflows professionnels. Fable 5.1 obtient 31,4 % sur AutomationBench, contre 17,1 % pour son prédécesseur, et 73,4 % sur CursorBench 3.2.0. Il dépasse aussi Fable 5 et Opus 5 dans les configurations publiées pour GDPval-AA, OSWorld 2.0 et Humanity’s Last Exam. L’ensemble des chiffres et des conditions d’évaluation figure dans la présentation officielle des deux modèles.
Ces résultats ne permettent toutefois pas d’établir un classement universel. Plusieurs tests ont été exécutés par Anthropic avec ses propres configurations. Certaines tâches déclenchent par ailleurs un changement de modèle ou attribuent un score nul lorsque les protections interviennent. La version d’OSWorld utilisée a également été actualisée, ce qui empêche une comparaison directe avec les scores publiés auparavant pour certains concurrents.
Les premiers partenaires mettent surtout en avant la capacité du modèle à poursuivre un travail pendant plusieurs heures, à vérifier ses propres résultats et à rechercher la cause profonde d’un problème. Millennium affirme par exemple que Fable 5.1 a identifié l’origine d’un plantage rare resté inexpliqué pendant plusieurs années. MongoDB décrit de son côté la construction autonome d’un prototype complexe en trois jours. Ces témoignages proviennent d’entreprises ayant bénéficié d’un accès anticipé et ne remplacent pas des évaluations indépendantes.
L’annonce dépasse néanmoins le seul développement logiciel. Anthropic présente plusieurs expériences dans lesquelles Fable 5.1 ou Mythos 5.1 participent directement à un processus de recherche scientifique.
Pour la conception moléculaire, Mythos 5.1 a utilisé des outils ouverts de conception et de repliement des protéines afin de proposer des molécules capables de se lier à douze cibles. Les résultats ont ensuite été testés en laboratoire par deux organisations externes. Anthropic annonce un taux de réussite proche de 50 %, contre une fourchette habituelle de 10 à 15 % dans ce type de travail. Pour trois cibles, certaines affinités mesurées étaient dix fois supérieures aux meilleures propositions comparables soumises aux compétitions d’Adaptyv Bio.
Ces résultats restent rattachés à un protocole organisé par Anthropic. Ils portent sur la première étape de conception de molécules de liaison et non sur la création de médicaments validés. Une affinité élevée ne permet pas, à elle seule, de conclure à l’efficacité, à l’innocuité ou à la viabilité clinique d’un traitement.
Fable 5.1 a également construit une nouvelle carte altimétrique couvrant environ un tiers de Vénus à partir des observations radar de la mission Magellan. Selon Anthropic, la carte distingue des reliefs à une échelle de deux à trois kilomètres, contre dix à vingt kilomètres pour la référence précédente, avec une précision améliorée pouvant atteindre 25 % sur les hauteurs. Le résultat a été publié sous licence Creative Commons sur Zenodo afin d’être examiné et éventuellement utilisé dans la préparation des missions VERITAS et EnVision.
Dans un autre exercice, Mythos 5.1 a modifié le code de sept modèles ouverts employés en génomique et en biologie computationnelle. Les accélérations annoncées vont jusqu’à 2,5 fois, avec des résultats identiques aux versions initiales. Anthropic estime que ces modifications peuvent réduire de 30 à 60 % le coût matériel de certaines analyses réalisées à l’échelle d’un génome. L’entreprise prévoit de publier les optimisations, mais elles n’étaient pas encore disponibles au moment de l’annonce.
Les capacités scientifiques et techniques supplémentaires expliquent la création de Mythos 5.1. Son accès repose sur deux programmes. Le Cyber Verification Program doit permettre à des professionnels autorisés d’effectuer certains travaux défensifs normalement bloqués. Le Life Sciences Verification Program ouvre les fonctions avancées en biologie à des chercheurs sélectionnés dans le cadre d’un dispositif développé avec le gouvernement américain.
L’accès à Mythos 5.1 reste pour l’instant limité à un groupe d’organisations américaines. Le modèle alimente également Claude Security, le service chargé d’examiner des dépôts de code, d’identifier des vulnérabilités et de proposer des correctifs soumis à une