Le temps long devient le terrain de Grok 4.7
SpaceXAI positionne Grok 4.7 sur le code et les missions professionnelles de longue durée, avec 500 000 tokens de contexte, un raisonnement réglable et des tarifs inchangés.
Une mission confiée à une IA ne se résume plus toujours à produire quelques lignes de texte ou à corriger une fonction isolée. Les systèmes destinés au développement doivent désormais explorer des dépôts entiers, utiliser plusieurs outils, exécuter des tests et reprendre leur travail après un échec. Dans un autre registre, ils peuvent avoir à préparer une présentation, analyser un dossier juridique ou assembler un document financier pendant plusieurs heures.
C’est sur ce terrain que SpaceXAI positionne Grok 4.7. Cette nouvelle version repose sur une base plus grande que Grok 4.6 et sur une phase d’apprentissage par renforcement prolongée, avec davantage de problèmes nécessitant plusieurs heures de travail. L’entreprise affirme avoir amélioré la capacité du système à vérifier ses propres résultats et à conserver le fil d’une mission longue.
Une IA pensée pour rester au travail
La principale évolution ne tient pas à une nouvelle interface ou à un mode de génération supplémentaire. Grok 4.7 vise d’abord les tâches dites agentiques, dans lesquelles le modèle doit planifier une série d’actions, appeler des outils, examiner leurs résultats et corriger sa trajectoire.
Cette approche concerne directement le développement logiciel. Au lieu de répondre uniquement à une question technique, le système peut parcourir un projet, modifier plusieurs fichiers, lancer les tests, inspecter les erreurs et poursuivre jusqu’à obtenir un résultat exploitable. La même logique peut servir à préparer des documents, des présentations ou des analyses mêlant plusieurs sources.
SpaceXAI indique également avoir entraîné le modèle à comprendre nativement l’environnement de Grok Bot. Cette intégration peut faciliter les échanges conversationnels et l’utilisation d’outils dans cet environnement précis. Elle invite cependant à la prudence lors des comparaisons, car les performances d’un modèle agentique dépendent aussi du logiciel qui l’entoure, des outils disponibles et des instructions qui organisent son travail. Des progrès visibles, mais pas une domination générale
Les résultats publiés montrent une progression nette par rapport à Grok 4.6. Sur CursorBench 4.0, consacré aux tâches de programmation prolongées, Grok 4.7 obtient 46,3 %, contre 40,4 % pour son prédécesseur. Il dépasse également GPT-5.6 Sol, crédité de 41,7 %, mais reste derrière Fable 5.1 et ses 51,8 %.
Le classement change selon l’épreuve. Grok 4.7 atteint 71 % sur DeepSWE v1.1, légèrement derrière GPT-5.6 Sol à 72,7 %, et 38 % sur Terminal-Bench 4.0, contre 37,3 % pour ce dernier. Fable 5.1 conserve une avance importante sur ce test avec 57,9 %.
Le nouveau modèle prend en revanche la tête du tableau fourni par SpaceXAI sur EEBench, consacré à l’ingénierie électrique, avec 64 %. Il obtient également le meilleur score présenté sur le Harvey Legal Agent Benchmark, à 19,6 %. Sur HealthBench Professional, son résultat de 56,7 % reste inférieur aux 60,5 % de GPT-5.6 Sol et aux 62,1 % de Fable 5.1.
Ces écarts empêchent de résumer Grok 4.7 à un modèle systématiquement supérieur. Sa position dépend fortement du métier, de l’environnement d’exécution et du niveau de raisonnement sélectionné. Dans le tableau de SpaceXAI, Grok 4.7 est notamment évalué en mode xHigh, tandis que les concurrents utilisent leurs propres réglages maximaux. Ces configurations ne produisent ni la même latence ni le même volume de tokens.
Les comparaisons de prix par tâche doivent être lues avec la même précaution. Le coût final dépend de la longueur du contexte, du nombre d’étapes, des appels d’outils, des tentatives infructueuses et de la quantité de texte produite. Un tarif unitaire inférieur ne garantit donc pas qu’une mission complète coûtera toujours moins cher. Le travail professionnel au-delà du code
SpaceXAI insiste aussi sur la création de documents et de présentations. Sur AA Briefcase v1.1, une évaluation portant sur des travaux de bureau étalés sur plusieurs heures, Grok 4.7 atteint 1 657 points, contre 1 546 pour Grok 4.6. Il se rapproche ainsi de Fable 5.1, placé à 1 678 points dans le tableau publié.
Sur GDPval, qui mesure des productions correspondant à différents métiers, le modèle reçoit un score Elo de 1 695. Il dépasse Grok 4.6, donné à 1 605, ainsi que GPT-6 Astra à 1 542, mais reste sous Fable 5.1 à 1 735.
Ces évaluations élargissent le positionnement du produit. Le modèle ne se limite plus à l’assistance au développement, même si le code reste son principal argument. SpaceXAI le destine également aux juristes, analystes, professionnels de santé et équipes chargées de préparer des contenus structurés. Les scores mesurent toutefois des scénarios définis et ne remplacent pas une évaluation sur les documents, règles internes et logiciels propres à chaque organisation. Jusqu’à 500 000 tokens de contexte
La documentation technique indique une fenêtre de contexte de 500 000 tokens. Grok 4.7 accepte du texte et des images en entrée, puis produit du texte. Il prend en charge les appels de fonctions et les sorties structurées, deux fonctions essentielles pour intégrer le modèle dans un agent ou un processus automatisé.
Une fenêtre aussi large permet de transmettre un dépôt conséquent, une collection de documents ou l’historique d’une mission. Elle ne signifie pas que chaque information sera utilisée avec la même précision. La sélection des fichiers, l’organisation du contexte et la conservation des décisions importantes restent déterminantes.
Le niveau de raisonnement peut être réglé sur low, medium, high ou xHigh. Le mode high est utilisé par défaut et le raisonnement ne peut pas être complètement désactivé. Le niveau xHigh accorde davantage de temps à l’analyse, au prix d’une latence et d’une consommation plus élevées. Un tarif stable, avec quelques nuances
Le tarif de base reste fixé à 2 dollars par million de tokens en entrée et 6 dollars en sortie. Les tokens d’entrée récupérés depuis le cache sont facturés 0,50 dollar par million. La documentation précise toutefois qu’un barème