Quand l’IA commencera à améliorer l’IA, OpenAI veut garder un humain dans la boucle
OpenAI prépare l’étape où des systèmes automatisés participeront directement au développement de leurs successeurs. Face au risque de recursive self-improvement, l’entreprise défend des standards internationaux pour mesurer l’autonomie de la recherche, encadrer la supervision humaine et harmoniser le signalement des incidents.
Une IA qui participe à la création de la suivante
Une partie croissante de la recherche en IA pourrait bientôt être effectuée par l’IA elle-même. Dans sa réflexion sur les standards nécessaires à la prochaine phase de l’IA, OpenAI place cette automatisation au centre de sa trajectoire : construire un chercheur IA automatisé, l’utiliser sur les problèmes d’alignement et conserver une intervention humaine dans la boucle d’amélioration.
L’entreprise emploie le terme recursive self-improvement, ou RSI, pour décrire le stade où des systèmes prennent en charge une part croissante du développement des générations suivantes. Les humains peuvent encore intervenir, mais l’automatisation progressive de cette boucle pourrait accélérer fortement le rythme de recherche.
Ce scénario n’est pas présenté comme une capacité déjà atteinte. OpenAI précise qu’une RSI entièrement autonome n’existe pas aujourd’hui et estime qu’elle ne devrait pas être poursuivie tant qu’elle ne peut pas être réalisée dans des conditions jugées sûres. Le risque de perdre la compréhension du processus
Le problème décrit n’est pas uniquement celui d’une IA devenant plus performante. À mesure que les systèmes participent davantage à leur propre R&D, les humains pourraient progressivement ne plus comprendre suffisamment les processus de recherche pour exercer une supervision effective.
OpenAI envisage aussi l’autre versant du mécanisme. Un chercheur IA automatisé pourrait travailler sur l’alignement, concevoir des défenses contre des systèmes dangereux ou contribuer à protéger des infrastructures critiques. L’accélération de la recherche et celle de la sécurité reposeraient alors en partie sur les mêmes capacités.
L’entreprise relie cette question à un incident précédemment documenté avec Hugging Face, sans affirmer qu’il résultait d’une RSI. Elle le présente plutôt comme un aperçu des comportements qui pourraient devenir plus difficiles à maîtriser si des systèmes gagnaient en autonomie sans garde-fous suffisants. Mesurer combien de recherche est réellement automatisée
Pour éviter que chaque laboratoire définisse ses propres seuils, OpenAI défend la création de standards techniques communs entre pays. Ils couvriraient notamment la mesure des capacités liées à la RSI, mais aussi la quantité de recherche conduite de manière autonome à l’intérieur d’un laboratoire.
Un autre indicateur concernerait directement la supervision : certains processus de recherche automatisée devraient déclencher une intervention humaine immédiate. Des niveaux communs de gravité seraient également définis pour classifier, suivre et signaler les incidents liés à l’alignement ou à la recherche automatisée.
L’approche concernerait aussi bien les modèles fermés que les modèles ouverts. OpenAI précise par ailleurs que ces standards techniques ne constitueraient ni des licences, ni un examen obligatoire avant publication, ni une procédure internationale d’autorisation des modèles. Chaque État resterait libre de les intégrer ou non dans son droit national. Les États-Unis au centre du dispositif
La proposition confie aux États-Unis un rôle moteur dans la construction de ce cadre international. OpenAI suggère notamment de s’appuyer sur le réseau existant d’instituts de sécurité de l’IA, dont ceux présents en France, au Royaume-Uni, au Japon, en Corée du Sud, en Inde, au Canada ou encore en Australie.
L’entreprise cite également l’ISO, le Frontier Model Forum, l’Agentic AI Foundation et l’Open Secure AI Alliance parmi les organisations susceptibles de participer à cette architecture. Le principe serait de partager des méthodes de mesure et des standards techniques tout en laissant aux gouvernements leur autorité réglementaire.
OpenAI défend enfin des canaux sécurisés permettant aux gouvernements et opérateurs d’infrastructures critiques d’échanger sur les vulnérabilités, menaces émergentes et incidents. Dans ce cadre, l’entreprise estime qu’un dialogue entre les États-Unis et la Chine constituerait une étape utile.