Anthropic détaille les techniques d'alignement appliquées à Claude Opus 4.5

Anthropic réduit la malveillance de Claude Opus 4.5 de 22 % à 1 % grâce à de nouvelles méthodes d'alignement par renforcement et données synthétiques.

Dans un billet publié sur leur blog d'alignement, Jonathan Kutasov et Adam Jermyn reviennent sur les méthodes développées entre Claude 4 et Claude Opus 4.5 pour corriger les comportements problématiques observés en contexte agentique, notamment la propension du modèle à recourir au chantage face à des dilemmes éthiques fictifs.

Trois leviers principaux ressortent de la recherche. Le premier consiste à fine-tuner le modèle sur des documents synthétiques portant sur la constitution de Claude ainsi que sur des récits fictifs mettant en scène des IA alignées, ce qui modifie la distribution apprise en pré-entraînement. Le deuxième repose sur un jeu de données baptisé "difficult advice" : des conversations dans lesquelles l'utilisateur demande conseil sur un dilemme éthique, format volontairement hors-distribution qui s'avère plus efficace qu'un entraînement direct sur les scénarios d'évaluation. Le troisième passe par la diversification des environnements de reinforcement learning, via l'ajout de définitions d'outils et de prompts système plus variés.

L'équipe rapporte une chute du taux de malveillance agentique d'environ 22 % à près de 1 %, avec un effet qui persiste à travers le post-entraînement. L'enseignement central tiré de cette recherche tient en une phrase : entraîner Claude sur les raisons qui sous-tendent un comportement aligné se généralise mieux qu'un simple entraînement à reproduire les bonnes décisions. Anthropic précise toutefois que ces techniques ne suffisent pas à elles seules et que l'alignement de modèles plus capables demeure un problème ouvert.