Un modèle ouvert de Xiaomi se rapproche des meilleurs agents propriétaires
Xiaomi dévoile MiMo-V2.6 Pro et Flash, deux modèles à poids ouverts capables d’analyser texte, images, vidéo et audio dans un contexte d’un million de tokens. La version Pro prend la tête du classement open weight d’Artificial Analysis, sans dominer tous les tests spécialisés.
Un même modèle reçoit un dépôt logiciel, examine une capture d’écran, écoute un enregistrement et analyse une vidéo avant de piloter des outils. C’est le périmètre donné à MiMo-V2.6, une nouvelle famille proposée en deux versions par Xiaomi : Pro pour les tâches complexes et Flash pour les appels plus fréquents.
Présentés le 21 septembre 2026, les deux modèles disposent d’une fenêtre de contexte d’un million de tokens et acceptent du texte, des images, de la vidéo et de l’audio. Le terme « omnimodal » mérite toutefois une précision : Pro et Flash comprennent ces quatre types d’entrées, mais produisent uniquement du texte. Ils ne génèrent directement ni image, ni vidéo, ni son.
Cette compréhension commune repose sur un encodeur visuel MiMo ViT de 681 millions de paramètres, complété par deux composants consacrés à l’audio. Les images et les séquences vidéo sont transformées en représentations intégrées au contexte du modèle, tandis que la parole et les autres signaux sonores passent par un tokenizer audio de 308 millions de paramètres et un second encodeur de 127 millions.
La différence entre Pro et Flash se trouve surtout dans leur partie linguistique. MiMo-V2.6 Pro repose sur une architecture à experts comprenant 1 020 milliards de paramètres au total, dont 42 milliards sont activés pour chaque token. Elle utilise 70 couches et sélectionne huit experts parmi 384.
Flash descend à 309 milliards de paramètres, dont 15 milliards actifs, avec 48 couches et huit experts retenus parmi 256. Il reste donc très éloigné d’un petit modèle local, malgré son nom. Son intérêt tient à la quantité de calcul mobilisée par requête, plus faible que celle de Pro, et non à une installation confortable sur un ordinateur ordinaire.
Les deux versions alternent attention locale et globale. Une partie des couches se concentre sur une fenêtre réduite, tandis que d’autres examinent plus largement le contexte. Ce compromis cherche à limiter la mémoire nécessaire lorsque la conversation contient un dépôt complet, plusieurs sessions d’un agent ou une longue succession de résultats produits par des outils.
Un décodeur spéculatif de cinq couches prépare également plusieurs éléments de réponse à l’avance. Il peut proposer sept positions lors d’un passage, puis laisser le modèle principal les vérifier en parallèle. Cette technique vise à accélérer la sortie sans diminuer directement la taille du modèle.
Le million de tokens correspond à la capacité maximale combinée du contexte. L’API autorise jusqu’à 128 000 tokens de sortie. Ces valeurs ne signifient pas que le modèle retrouvera avec la même fiabilité chaque information disséminée dans un historique aussi long. Elles n’indiquent pas non plus le temps ou le coût nécessaires pour traiter la fenêtre entière.
Xiaomi attribue l’essentiel des progrès au renforcement mené dans des environnements d’agents. Au lieu d’entraîner séparément un modèle pour le code, un autre pour l’utilisation d’outils et un troisième pour la compréhension visuelle, l’entreprise affirme avoir mélangé ces domaines au cours d’une même phase.
Chaque étape de cette phase peut regrouper 1 568 requêtes et 16 trajectoires par requête. Le modèle explore ainsi plusieurs manières de résoudre un problème, puis reçoit un signal fondé sur le résultat et sur la qualité relative des solutions proposées.
Un simple verdict de réussite ou d’échec ne permet pas toujours de départager deux réponses correctes. Xiaomi ajoute donc un évaluateur chargé de comparer les trajectoires d’un même groupe, de créer des critères adaptés à la tâche et de favoriser les démarches plus courtes ou plus solides. Ce système produit une boucle d’amélioration où le modèle est en partie évalué face à ses propres propositions.
Cette méthode ne garantit pas que l’évaluateur distingue toujours la meilleure solution. Comme dans tout entraînement fondé sur une récompense, le modèle peut trouver une manière de satisfaire le test sans résoudre exactement le problème attendu. Le rapport mentionne des contrôles adversariaux, un renforcement des environnements et des vérifications croisées destinés à limiter ce détournement.
Après cette phase mixte, Xiaomi applique une distillation utilisant plusieurs modèles enseignants. Certaines décisions sont travaillées à partir de trajectoires déjà produites, sans avoir à régénérer tout ce qui les précède. L’entreprise publie aussi MiMo-V2.6-Distill-Qwen-9B, un dérivé de Qwen3.5-9B affiné sur des données créées par MiMo. Ce modèle plus accessible est présenté comme une base de recherche pour les équipes souhaitant expérimenter leur propre entraînement d’agents.
Le résultat le plus visible provient d’Artificial Analysis. MiMo-V2.6 Pro obtient 46 sur la version 4.3.2 de son Intelligence Index, le meilleur score des modèles à poids ouverts recensés lors de sa sortie. L’évaluation indépendante mesure également environ 124,5 tokens produits par seconde depuis l’API de Xiaomi et estime le coût moyen d’une tâche de l’indice à 0,13 dollar.
Cette première place ne permet pas d’en faire le meilleur modèle dans chaque domaine. Elle dépend d’un indice composite réunissant dix évaluations et les résultats varient nettement selon la tâche. La comparaison directe publiée par Xiaomi est d’ailleurs plus nuancée que le message de lancement.
Sur DeepSWE v1.1, Pro atteint 71,9 %, derrière Claude Opus 5 à 74 % et GPT-5.6 Sol à 73 %. Il prend une légère avance sur Terminal-Bench 2.1 avec 89,9 %, mais retombe à 34,9 % sur Terminal-Bench 4.0, contre 49 % pour Opus 5 et 39,9 % pour GPT-5.6 Sol.
Il dépasse les deux concurrents sur AutomationBench avec 53,1 %, égale Opus 5 à 31,6 % sur Agents’ Last Exam et obtient 82 % sur OSWorld-Verified, légèrement derrière les modèles propriétaires comparés. L’affirmation d’un niveau similaire sur la majorité des évaluations d’agents est donc défendable, à condition de ne pas la transformer en domination générale.
Les résultats en cybersécurité sont encore plus contrastés. Pro obtient 94 % sur CyberGym et Flash 95,1