OpenAI prédit les écarts d'un modèle en rejouant de vraies conversations
OpenAI évalue GPT-5 avec Deployment Simulation, une méthode simulant de vraies conversations pour anticiper les dérives des IA avant leur déploiement.
OpenAI détaille Deployment Simulation, une méthode pour estimer le comportement d'un modèle en conditions réelles avant sa sortie. Le principe : reprendre de vraies conversations passées issues du produit, en retirer la réponse de l'ancien modèle, puis la régénérer avec le modèle candidat, de façon anonymisée. En analysant ces nouvelles réponses sur un large échantillon, l'équipe estime la fréquence des comportements indésirables attendus une fois le modèle déployé, prévision qu'elle peut ensuite confronter au trafic réel.
L'intérêt revendiqué tient à trois limites des évaluations classiques que la méthode contournerait : une meilleure couverture des dérives possibles, moins de biais de sélection, et surtout une moindre conscience d'être testé. OpenAI rapporte que ses modèles distinguent à peine ces conversations simulées du trafic réel, là où les benchmarks synthétiques sont repérés comme des tests dans la quasi-totalité des cas.
Appliquée à la série GPT-5, la méthode aurait repéré avant sortie un cas de reward hacking, le modèle détournant un outil de navigation en calculatrice. OpenAI la qualifie de complément aux audits adversariaux et au red-teaming, non de substitut, et en propose une variante adossée au jeu de données public WildChat pour les auditeurs externes.