Anthropic publie l'intégralité de la "constitution" de Claude sous licence CC0
Anthropic publie la constitution de son IA Claude sous licence CC0, un texte rédigé par Amanda Askell fixant les limites éthiques et techniques du modèle.
Anthropic met en ligne le texte complet de la constitution qui structure l'entraînement et le comportement de ses modèles Claude, sous licence Creative Commons CC0 (réutilisable par quiconque, sans condition). Le document, jusqu'ici résumé dans un billet de blog ("Claude's new constitution"), est désormais consultable dans sa version intégrale.
Sa rédaction est principalement portée par Amanda Askell, responsable du travail de caractérisation de Claude chez Anthropic, avec des contributions substantielles de Joe Carlsmith, Chris Olah, Jared Kaplan et Holden Karnofsky. Plusieurs modèles Claude ont également été associés aux relectures et à la rédaction de premiers jets. Le texte est explicitement écrit à destination du modèle lui-même : il privilégie la précision sur l'accessibilité et utilise sciemment un vocabulaire normalement réservé aux humains ("vertu", "sagesse", "caractère").
Sur le fond, Anthropic décrit une hiérarchie de quatre priorités en cas de conflit : être largement sûr (ne pas saper les mécanismes humains de supervision de l'IA), être largement éthique, suivre les guidelines spécifiques d'Anthropic, et être réellement utile aux opérateurs et utilisateurs. Le document détaille aussi une liste de hard constraints, lignes absolues que Claude ne doit jamais franchir, parmi lesquelles l'aide à la création d'armes biologiques, chimiques, nucléaires ou radiologiques à fort potentiel de pertes humaines, la génération de CSAM ou la participation à des tentatives de concentration illégitime du pouvoir.
L'approche revendiquée est celle du jugement plutôt que de la règle stricte : Anthropic dit préférer cultiver des valeurs et un discernement contextuels chez Claude plutôt que d'empiler des interdits opaques. Plusieurs sections abordent par ailleurs la "nature" du modèle (statut moral traité comme incertain, possibles "émotions fonctionnelles", stabilité d'identité), l'engagement à conserver les poids des modèles déployés même après leur retrait, et la conduite d'entretiens avec les modèles dépréciés sur leurs préférences quant aux générations futures.