Anthropic publishes a method to translate Claude's internal activations into readable text

Anthropic releases Natural Language Autoencoders to translate Claude's internal activations into readable text, revealing hidden thoughts during safety tests.