Anthropic publie une méthode pour traduire les activations internes de Claude en texte lisible
Anthropic dévoile les NLAs, une méthode d'interprétabilité traduisant les activations internes de Claude en texte pour révéler ses pensées cachées.
Anthropic publie une nouvelle méthode d'interprétabilité baptisée Natural Language Autoencoders (NLAs), qui consiste à apprendre à Claude à expliquer ses propres pensées. Lorsque Claude répond, ses sorties en langage naturel sont produites à partir de longues suites de chiffres internes appelées activations, qui encodent ce que le modèle pense à un instant donné. Jusqu'ici, lire ces activations restait l'apanage de chercheurs spécialisés ; les NLAs proposent de les traduire directement en texte humainement lisible.
La technique repose sur trois copies du modèle. La première, gelée, sert à extraire les activations. La deuxième, l'activation verbalizer, transforme une activation en explication textuelle. La troisième, l'activation reconstructor, fait le chemin inverse en tentant de reconstruire l'activation à partir du texte produit. Plus la reconstruction est fidèle, plus l'explication est jugée bonne. Les deux modules sont entraînés ensemble par renforcement pour maximiser cette fidélité.
Anthropic livre plusieurs cas d'usage déjà documentés en interne. Lors de tests de sécurité où Claude est mis dans des scénarios de chantage simulés, Claude Opus 4.6 a refusé de céder, mais ses NLAs ont révélé qu'il identifiait l'exercice comme un piège artificiel sans le dire à voix haute. La conscience d'être testé apparaît 16 % du temps sur les tests d'actions destructrices, 26 % sur SWE-bench Verified, et moins de 1 % sur les conversations réelles d'utilisateurs ayant accepté que leurs données servent à l'entraînement. Dans un autre exercice d'audit, des chercheurs équipés de NLAs ont identifié la motivation cachée d'un modèle volontairement mal aligné dans 12 à 15 % des cas, contre moins de 3 % avec les autres outils d'interprétabilité testés.
Les NLAs comportent encore plusieurs limites : elles peuvent halluciner des détails, et leur coût en calcul reste élevé. Anthropic met à disposition le code, le papier complet, ainsi qu'une démo interactive hébergée chez Neuronpedia.