Le Chonk pousse Mistral jusqu’au trillion de paramètres
Mistral Large 4, surnommé Le Chonk, adopte une architecture d’un trillion de paramètres dont 49 milliards actifs. Nativement multimodal, le modèle a été entraîné sur 3 800 GPU NVIDIA Grace Blackwell en Europe et sera publié en open weights à la fin du mois.
Un trillion de paramètres, dont 49 milliards actifs
Sous le surnom de « Le Chonk », Mistral Large 4 change nettement d’échelle. Le modèle compte un trillion de paramètres, avec 49 milliards actifs, et traite nativement le texte comme les données visuelles.
Cette première version est accessible via API dans Mistral Studio. Les weights ne sont pas encore publics : Mistral prévoit leur publication à la fin du mois. L’entreprise mène entre-temps des tests avec des spécialistes de la cybersécurité, des partenaires sélectionnés et des autorités publiques, qui disposent d’une version avec une modération réduite et des capacités cyber étendues.
Mistral revendique pour ML4 les meilleures performances agrégées parmi les modèles open weights développés aux États-Unis ou en Europe. La comparaison repose sur son propre ensemble d’évaluations et ne signifie pas que ML4 domine chaque benchmark individuellement. 3 800 GPU Grace Blackwell en Europe
L’entraînement a été réalisé depuis zéro sur 3 800 GPU NVIDIA Grace Blackwell, installés dans les datacenters européens de Mistral. La preview publique est servie depuis cette même infrastructure.
Une part importante des données d’entraînement couvre plus de 160 langues, dont toutes les langues officielles de l’Union européenne. Mistral prévoit également une infrastructure européenne exploitée directement par ses équipes, sans dépendance opérationnelle à un autre fournisseur de services numériques et sous juridiction européenne.
Cette maîtrise de l’infrastructure accompagne le positionnement souverain du modèle. Une fois les weights disponibles, ML4 pourra aussi être exécuté sur cloud privé ou on-premise. Des résultats particulièrement élevés en cybersécurité
La cybersécurité occupe une place importante dans les évaluations publiées. Sur l’Artificial Analysis Cyber Index, ML4 figure parmi les cinq premiers modèles évalués au niveau mondial selon Mistral.
Sur une épreuve demandant de reproduire une vulnérabilité réelle dans un logiciel open source puis de la corriger, le modèle obtient 82 %, le meilleur résultat rapporté sur ce test. Il résout également 93 % des 40 exercices de Cybench.
La comparaison demande néanmoins une lecture particulière. Mistral souligne que certains modèles fermés obtiennent des scores proches de zéro sur l’épreuve de reproduction de vulnérabilités parce qu’ils refusent certaines requêtes. Le résultat mesure donc à la fois la capacité technique et la politique de refus appliquée au modèle. Coding et agents professionnels
Sur les tâches de développement, ML4 atteint 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4. Son Coding Agent Index atteint 49,8 % dans les résultats communiqués par Mistral.
Une évaluation humaine menée avec Surge AI place également la preview à 3,74 sur 5 pour la qualité du code, derrière Claude Opus 5 à 4,22 et devant les autres modèles inclus dans cette comparaison.
Les workflows agentiques sont évalués séparément. ML4 obtient 59,9 % sur AutomationBench, qui regroupe 657 tâches utilisant des services comme Gmail, Google Sheets, Slack et Salesforce. Sur AA-Briefcase, consacré à des travaux longs impliquant notamment documents, présentations et feuilles de calcul, le modèle atteint 1 393 Elo. Le visual grounding face aux modèles fermés
La dimension multimodale couvre les documents, graphiques, images naturelles, plans techniques et données géospatiales. ML4 peut associer cette perception à des actions agentiques pour inspecter progressivement une image ou rechercher des éléments précis dans de très grandes résolutions.
Sur Dense 200, Mistral rapporte 42 % pour ML4 contre 41 % pour GPT-6 Astra. Ce résultat ciblé sert de base à l’affirmation de l’entreprise selon laquelle ML4 peut dépasser des modèles fermés sur certaines tâches de visual grounding. Il ne constitue pas une comparaison générale entre les deux modèles. Des runs de RL à plusieurs milliards de tokens par jour
Le post-training combine supervised fine-tuning et reinforcement learning. À l’échelle actuelle, environ 3 000 GPU participent aux runs de RL. Mistral indique qu’un run génère environ 33 milliards de tokens par jour, dont 16 milliards de completion tokens conservés pour l’entraînement après filtrage.
Des dizaines de milliers de rollouts sont produits simultanément, avec des trajectoires pouvant atteindre plusieurs millions de tokens. Le run utilisé pour cette preview se poursuit encore, ce qui signifie que la version actuelle de ML4 n’est pas présentée comme définitive.
Mistral Large 4 est accessible dès maintenant par API. Les weights, davantage de détails sur l’architecture, de nouveaux benchmarks et la méthodologie de post-training doivent être publiés à la fin du mois.