GPT-5.6 Sol a participé à l’optimisation de sa propre infrastructure

GPT-5.6 Sol réduit de 20 % le coût de fonctionnement d'OpenAI. Le modèle a réécrit ses propres composants d'exécution pour optimiser les calculs sur GPU.

La famille GPT-5.6 ne repose pas uniquement sur de nouveaux modèles. OpenAI décrit aussi une série d’améliorations apportées à l’ensemble de son infrastructure afin de réduire le coût et le temps nécessaires à chaque réponse. Ces travaux concernent la répartition des requêtes, l’exécution sur les GPU, la mise en cache et l’orchestration des outils dans Codex et ChatGPT Work.

GPT-5.6 Sol a été utilisé dans Codex pour analyser le trafic de production, tester de nouvelles configurations et réécrire certains composants chargés d’exécuter les opérations du modèle. Selon OpenAI, ces optimisations ont réduit de 20 % le coût global de fonctionnement. L’entreprise s’appuie notamment sur Triton et Gluon, deux langages open source destinés à la programmation des GPU, ainsi que sur des outils de vérification pour contrôler les modifications produites.

Le modèle a également contribué à améliorer son propre système de décodage spéculatif. Un modèle plus léger propose plusieurs tokens à l’avance, puis le modèle principal les vérifie en parallèle. GPT-5.6 Sol aurait mené des centaines d’expériences sur cette architecture et supervisé son entraînement, y compris lors de pannes matérielles ou de phases instables. OpenAI mesure un gain supérieur à 15 % sur l’efficacité de génération des tokens.

Une autre partie du travail porte sur Codex et ChatGPT Work. Pour éviter que les historiques, outils et intégrations ne saturent inutilement le contexte, les fonctions sont chargées uniquement lorsqu’elles deviennent nécessaires et les résultats des outils sont limités par défaut à 10 000 tokens. L’historique visible par le modèle reste également organisé dans un ordre fixe afin de réutiliser plus facilement les calculs déjà effectués grâce au cache.

OpenAI positionne ainsi GPT-5.6 Sol comme un modèle capable d’améliorer les systèmes qui assurent son propre fonctionnement, tandis que Terra cible un équilibre entre coût et performance et que Luna privilégie la rapidité. L’entreprise affirme que Terra atteint un niveau comparable à GPT-5.5 pour un tarif divisé par deux, tandis que Luna coûterait 80 % de moins que Sol.