Plus de continuité sur les tâches complexes avec Grok 4.6

Grok 4.6 améliore les tâches agentiques longues, le développement logiciel, le code et les projets interactifs avec de nouveaux gains sur plusieurs benchmarks

Grok 4.6 prolonge le travail engagé avec Grok 4.5 en ciblant surtout les tâches agentiques longues, le développement logiciel et les projets interactifs ou visuels. Le modèle est conçu pour rester actif sur des trajectoires comportant de nombreuses étapes, qu’il s’agisse de recherche, d’analyse, de travail dans une codebase ou de construction progressive d’une application.

xAI indique avoir allongé la phase d’entraînement supplémentaire par rapport à Grok 4.5. Le corpus combine notamment des données générées par modèle pour le raisonnement et les concepts techniques, des données d’ingénierie, puis des étapes de SFT et de reinforcement learning. Grok 4.5 a également servi à régénérer certaines trajectoires de SFT couvrant STEM, software engineering et knowledge work, avant filtrage des traces considérées comme problématiques.

Le reinforcement learning couvre plusieurs environnements agentiques, dont le développement général, l’optimisation de kernels, le web, la conception assistée par ordinateur et différents travaux de connaissance. Sur les tâches longues testées par xAI, Grok 4.6 montre davantage de comportements de vérification et de self-testing avant de poursuivre une tâche. L’entreprise met aussi en avant de meilleurs premiers résultats sur des projets visuels et interactifs, avec la capacité de construire une première version fonctionnelle puis de l’affiner au fil des retours.

Les résultats publiés placent Grok 4.6 High à 61 sur l’Artificial Analysis Intelligence Index, au même niveau que GPT-5.6 Sol Max et derrière Fable 5 Max à 62. Le modèle obtient également 1 753 sur GDPVal-AA v2, 69,9 % sur CursorBench v3.2, 65,9 % sur DeepSWE v1.1 et 61,3 % sur FrontierCode v1.1 Extended. Il progresse sensiblement par rapport à Grok 4.5 High sur l’ensemble de ces évaluations, même s’il ne prend pas systématiquement la première place face aux autres modèles comparés.

Cette orientation se retrouve particulièrement dans les benchmarks de travail agentique. Grok 4.6 atteint 57,5 % sur APEX-Agents, 56,4 % sur APEX-SWE et 26 % sur Terminal-Bench v3.0. Sur AA-Briefcase, consacré aux tâches professionnelles, xAI publie un score de 1 577, légèrement devant Fable 5 Max à 1 574 et GPT-5.6 Sol Max à 1 502 dans le tableau présenté.

Le modèle est accessible dans Cursor et Grok Build, ainsi que via l’API et plusieurs partenaires, dont OpenRouter, Vercel et Cloudflare. La tarification commence à 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. Une variante Fast est également proposée à un tarif doublé.