Kimi K3 publie ses poids et ouvre trois briques de son infrastructure
Le modèle Kimi K3 de Moonshot AI livre ses poids et ses sandboxes de test. Ce que cette infrastructure ouverte change pour le développement d'agents.
Les poids complets de Kimi K3, le modèle ouvert de 2 800 milliards de paramètres de Moonshot AI, sont désormais disponibles, à la date annoncée du 27 juillet. Ils s'accompagnent d'un rapport technique et de l'ouverture d'une partie de la pile qui fait tourner le modèle : FlashKDA, les kernels d'attention maison, MoonEP, une bibliothèque de communication pour le Mixture of Experts, et AgentENV, l'infrastructure de sandbox conçue pour exécuter des environnements d'agents à grande échelle.
Le rapport lève le voile sur plusieurs partis pris. L'encodeur de vision, MoonViT-V2, a été entraîné de zéro plutôt qu'initialisé sur un modèle contrastif préexistant, un choix que Moonshot dit plus stable à l'entraînement conjoint avec le modèle de langage. L'attention alterne trois couches linéaires KDA pour une couche globale, sans encodage positionnel explicite, la position étant portée par le mécanisme récurrent lui-même, ce qui autorise l'extension jusqu'au million de tokens sans retoucher les paramètres. La fenêtre de contexte a d'ailleurs été étendue par paliers, de huit mille à un million de tokens, pour concentrer le coût du long contexte sur une fraction du budget.
Le volet infrastructure retient l'attention. Les sandboxes reposent sur des microVM isolées capables de reprendre leur exécution en une cinquantaine de millisecondes, de se mettre en pause sans consommer de ressources pendant qu'un agent attend une réponse, ou de se dupliquer pour évaluer une piste sans effet de bord. Pour donner l'échelle, Moonshot chiffre à plus de cinquante et un millions le nombre de sandboxes créées au cours de l'entraînement et de l'évaluation.
Sur les mesures, l'entreprise renvoie à des évaluations tierces. Kimi K3 obtient un indice d'intelligence de 57,1 chez Artificial Analysis et 74,7 sur l'index sectoriel de Vals, et prend la première place du WebDev Arena parmi les modèles classés par préférence humaine. Moonshot reconnaît par ailleurs que la performance globale reste en deçà des modèles propriétaires les plus puissants, en particulier sur le raisonnement de niveau recherche.