GPT-6 descend en gamme avec Sol et Luna, et divise ses prix par deux

GPT-6 Sol et GPT-6 Luna complètent Astra avec deux modèles moins coûteux destinés au travail professionnel, au code et aux agents. OpenAI réduit de moitié leurs tarifs API par rapport à GPT-5.6 et améliore également le cache des longues conversations.

Astra garde le sommet, Sol et Luna réduisent la facture

Après GPT-6 Astra, la famille s’étend à deux modèles conçus pour des charges de travail moins coûteuses. GPT-6 Sol et GPT-6 Luna reprennent des méthodes d’entraînement proches de celles utilisées pour Astra, avec des améliorations revendiquées dans le travail professionnel, la factualité, le code, l’utilisation d’un ordinateur et l’alignement. Astra conserve toutefois la première place dans la gamme pour les tâches les plus exigeantes.

La différence se joue d’abord sur le coût. GPT-6 Sol passe à 2 dollars par million de tokens en entrée et 10 dollars en sortie, contre respectivement 4 et 20 dollars pour GPT-5.6 Sol au tarif promotionnel de référence. Luna descend à 0,10 dollar en entrée et 0,50 dollar en sortie, contre 0,20 et 1,20 dollar auparavant. OpenAI résume cette évolution par une baisse de 50 % sur les tarifs API des deux modèles. Sol pour les tâches longues, Luna pour réduire encore le coût

Sol occupe l’échelon intermédiaire entre Astra et Luna. Sur AutomationBench, qui mesure des workflows professionnels utilisant 47 outils, GPT-6 Sol atteint 33,2 % en effort xhigh pour un coût moyen annoncé de 0,27 dollar par tâche. Claude Opus 5 obtient 26,9 % dans l’évaluation publiée par OpenAI, avec un coût estimé 11,1 fois supérieur. Ces comparaisons restent à lire dans le cadre du protocole et des calculs de coût retenus par OpenAI.

En développement logiciel, Sol atteint 68,8 % sur DeepSWE 1.1, contre 69,9 % pour Claude Fable 5 dans sa meilleure configuration mesurée, avec un coût par tâche qu’OpenAI estime inférieur d’environ 80 %. Luna obtient 66,6 % sur le même benchmark et se rapproche, selon les évaluations publiées, de configurations intermédiaires de modèles Anthropic pour une dépense nettement inférieure.

Le même positionnement apparaît sur l’utilisation d’un ordinateur. GPT-6 Sol atteint 60,5 % sur OSWorld 2.0 offline en effort xhigh, contre 60,3 % pour Claude Opus 5 en medium dans les mesures rapportées par OpenAI. Moins d’erreurs factuelles selon les tests internes

OpenAI mesure également une baisse d’environ moitié du nombre d’erreurs de GPT-6 Sol par rapport à GPT-5.6 Sol sur son évaluation interne de factualité. Celle-ci utilise des conversations anonymisées dans lesquelles des utilisateurs avaient précédemment signalé une erreur factuelle.

Ce jeu de données est volontairement difficile et OpenAI précise lui-même qu’il n’est pas représentatif des conversations habituelles. Luna progresse également et, avec davantage d’effort de raisonnement, atteint selon l’entreprise un niveau proche de GPT-5.6 Sol pour une fraction de son coût. Le cache devient une autre variable du prix

La baisse des tarifs s’accompagne d’une modification du prompt caching. GPT-6 peut désormais conserver davantage de contexte réutilisable entre les requêtes, avec une réduction de 90 % sur les tokens d’entrée récupérés depuis le cache.

Le niveau de raisonnement et les outils disponibles peuvent aussi être modifiés sans invalider le contexte précédemment mis en cache. Des breakpoints permettent de choisir plus précisément les préfixes à conserver. GitHub indique que ces évolutions ont réduit de plus de 50 % la proportion de tokens nécessitant un nouveau traitement dans Copilot au cours des derniers mois, sur plusieurs milliards de requêtes vers les modèles OpenAI. Deux modèles classés High en cyber et biochimie

La System Card de GPT-6 apporte un autre élément absent du simple positionnement commercial. OpenAI classe Sol et Luna au niveau High pour les capacités de cybersécurité ainsi que biologiques et chimiques, tout en les maintenant sous le seuil Critical. Aucun des deux n’atteint non plus le seuil High en AI Self-Improvement.

Pour le cyber, l’écart avec Astra reste marqué sur certaines évaluations. Sur ExploitBench, GPT-6 Sol réussit au maximum 5,5 % des exercices et Luna aucun, contre 31,5 % pour Astra. OpenAI estime disposer de suffisamment d’éléments pour maintenir les deux modèles sous son seuil Critical.

GPT-6 Sol et Luna sont accessibles dans ChatGPT Work et Codex pour les comptes Plus, Pro, Business, Enterprise et Edu, ainsi que dans l’API sous `gpt-6-sol` et `gpt-6-luna`. Luna est également proposé aux utilisateurs Free et Go via l’application desktop.