OpenAI : des « traits bénéfiques » appris par RL généralisent l'alignement

OpenAI démontre qu'entraîner un modèle par renforcement sur des traits bénéfiques ciblés généralise et renforce son alignement face aux attaques.

Dans une étude d'alignement, OpenAI a testé une idée : entraîner un modèle par apprentissage par renforcement sur des scénarios réalistes ciblant quelques traits jugés bénéfiques, l'honnêteté, l'humilité épistémique, la transparence du raisonnement, l'ouverture à la correction, l'équité ou le souci du bien-être, en n'injectant qu'une petite dose de ces données dans un entraînement post-training par ailleurs classique.

Selon l'étude, les effets dépassent les traits visés. Le modèle ne devient pas seulement plus honnête ou plus corrigible sur les scénarios d'entraînement : il progresse aussi sur des dizaines d'évaluations indépendantes, non vues pendant l'entraînement, mesurant la tromperie, le reward hacking, les conseils nuisibles ou la sûreté, sur 44 bancs sur 53. Plus frappant, OpenAI rapporte qu'un entraînement limité au seul domaine de la santé suffit à améliorer l'alignement dans des domaines sans rapport. C'est l'image inversée du désalignement émergent, où un mauvais comportement appris sur une tâche étroite finissait par contaminer le reste.

Ces gains résisteraient en outre à la pression : prompts de persona hostiles et fine-tuning malveillant peinent davantage à faire dériver le modèle, qui demeure pourtant orientable vers des usages légitimes. OpenAI parle de persistance sélective et relie le résultat à ses travaux sur les personas, le renforcement pouvant ancrer une persona bénéfique. L'entreprise décrit le tout comme une preuve de concept précoce, en précisant que ces traits ne tranchent pas la question des valeurs qu'une IA devrait porter, laquelle relève d'une délibération collective.