Anthropic détaille comment Claude automatise 95 % de ses analyses internes

Anthropic automatise 95 % de ses analyses de données internes grâce à Claude et des dossiers Markdown spécifiques, atteignant un taux de justesse de 95 %.

Pointer un agent vers un data warehouse et le laisser exécuter crée une fausse impression de précision : l'avertissement vient d'Anthropic, qui décrit dans un retour d'expérience la manière dont 95 % de ses requêtes analytiques internes sont désormais traitées par Claude, avec environ 95 % de justesse en agrégé, libérant l'équipe data pour la modélisation causale ou la prévision.

La thèse centrale : la fiabilité analytique est un problème de contexte et de vérification, pas de génération de code, l'essentiel des erreurs se ramenant à trois causes, l'ambiguïté entre les concepts d'une question et les entités du modèle de données, l'obsolescence des définitions et l'échec de récupération de la bonne information. La réponse combine des datasets canoniques uniques, un semantic layer consulté en premier par obligation et surtout des skills, ces dossiers de Markdown lus à la demande : sans eux, la justesse plafonnait à 21 % sur les évaluations internes, contre plus de 95 % ensuite et près de 99 % sur certains domaines.

L'équipe insiste sur la maintenance, la précision ayant glissé de 95 à 65 % en un mois faute de mise à jour des skills, et chiffre ses arbitrages, une revue adversariale par sous-agent gagnant 6 points de justesse au prix de 32 % de tokens et 72 % de latence en plus. Pour démarrer, elle recommande quelques datasets canoniques, quelques dizaines d'évaluations hors ligne et une skill de connaissance minimale.