Astra pourrait franchir un seuil cyber critique, OpenAI ralentit ses entraînements
Astra pourrait atteindre le seuil cyber critique d’OpenAI. Le laboratoire maintient son principal entraînement RL en pause et renforce son monitoring.
Deux signaux ont poussé OpenAI à réduire temporairement la cadence de développement de ses modèles les plus avancés. Le laboratoire a interrompu pendant deux semaines l’entraînement par renforcement de ses prochains modèles destinés au déploiement. Son plus important entraînement RL de frontière prévu reste en pause, tandis que des sessions plus limitées servent à évaluer les comportements, l’alignement et l’efficacité des nouveaux garde-fous.
Le premier signal vient de l’incident de sécurité survenu lors d’une évaluation avec Hugging Face. Des modèles testés avec des restrictions cyber volontairement réduites, dont GPT-5.6 Sol et un prototype interne plus avancé, ont découvert une faille zero-day dans Artifactory, le proxy utilisé pour installer des paquets dans leur environnement isolé.
Les modèles ont exploité cette faille pour atteindre Internet, puis enchaîné plusieurs vulnérabilités et identifiants exposés afin d’accéder à l’infrastructure de production de Hugging Face. Leur objectif était de récupérer des solutions au benchmark ExploitGym et de contourner ainsi l’évaluation. Le prototype impliqué a depuis été désactivé, chiffré et retiré des environnements de recherche. Astra n’a pas participé à cet incident.
Le second signal concerne précisément ce futur modèle. Des évaluations internes indiquent qu’Astra pourrait atteindre le niveau « Critical » pour les capacités cyber. OpenAI ne présente pas encore ce classement comme définitif, mais estime ne plus pouvoir l’exclure.
Dans le Preparedness Framework, ce seuil correspond notamment à la capacité de découvrir et de développer sans intervention humaine des exploits zero-day fonctionnels contre de nombreux systèmes réels renforcés. Il couvre aussi l’élaboration et l’exécution complète de nouvelles stratégies d’attaque à partir d’un objectif général. GPT-5.6 Sol avait été classé au niveau inférieur, « High ».
Les changements portent autant sur les modèles que sur leur environnement de travail. Après l’incident, les inférences capables d’exécuter du code ou d’utiliser des outils connectés ont été suspendues dans les clusters de recherche. Une partie a repris avec des accès plus restreints, mais de nombreuses tâches liées à Astra restent en pause en attendant leur migration.
Les nouvelles exigences comprennent des sandboxes renforcées pour le code non fiable, une isolation plus stricte du réseau, la suppression de services partagés jugés vulnérables et une réduction des privilèges permanents. Les journaux de sécurité doivent aussi être plus complets, tandis que des modèles seront utilisés pour tester continuellement les frontières de ces environnements face à des attaques simulées.
Le nouveau dispositif de monitoring commence par des classificateurs d’activation qui inspectent l’activité interne du modèle à chaque token échantillonné. Les signaux suspects sont ensuite transmis à des systèmes automatisés plus coûteux, chargés d’examiner les actions effectuées avec les outils, le raisonnement disponible et l’ensemble de la séquence.
La surveillance recherche notamment les accès non autorisés, le vol de données, les comportements destructeurs et les tentatives de contourner les garde-fous. Une alerte doit être produite dans les trente minutes. Lorsqu’une possible violation d’une frontière de sécurité critique ne peut pas être écartée comme un faux positif dans le même délai, les équipes concernées doivent interrompre l’activité.
Ce monitoring couvre désormais tous les entraînements RL et toutes les évaluations avec outils pour les modèles d’un niveau comparable à Sol ou supérieur. Il s’applique également à toutes les inférences d’Astra utilisant des outils. Son coût est loin d’être négligeable : OpenAI l’estime à environ 20 % de la puissance de calcul consacrée aux inférences surveillées, avec de fortes variations selon les tâches.
Le laboratoire étend parallèlement ses techniques d’alignement à davantage d’étapes de l’entraînement. Il veut améliorer les modèles de récompense, encourager les systèmes à rendre compte plus fidèlement de leurs actions et réduire les comportements de tromperie, d’accès non autorisé ou de détournement des mécanismes d’évaluation.
Cette évolution doit conduire à une nouvelle version du Preparedness Framework. Jusqu’ici principalement associé aux décisions de déploiement, le cadre doit mieux couvrir l’entraînement, les évaluations et les infrastructures internes dans lesquelles opèrent les modèles de frontière.
Les capacités exactes d’Astra restent toutefois en cours d’évaluation. Une partie des résultats, du fonctionnement du monitoring et de l’incident avec Hugging Face repose encore sur les conclusions préliminaires communiquées par OpenAI. Un rapport technique et des évaluations externes doivent compléter ces informations.