Le petit modèle d'Ant Group dit faire mieux que son grand frère à 1000 milliards
Cinq milliards de paramètres actifs par token sur cent vingt-quatre au total : c'est le rapport sur lequel InclusionAI, le laboratoire d'IA rattaché à Ant Group, positionne Ling-3.0-flash, un MoE à raisonnement hybride pensé pour les agents en production. Le laboratoire revendique des résultats équivalents ou supérieurs à ceux de son propre modèle phare à mille milliards de paramètres sur la plupart des benchmarks présentés, avec un huitième des paramètres totaux et un douzième des paramètres actifs.
L'architecture repose sur une attention linéaire hybride native : des couches KDA et MLA empilées selon un ratio de cinq pour un. Les premières prennent en charge la mémoire longue portée à moindre coût, la seconde préserve la précision de rappel que perdent les modèles purement linéaires. L'activation d'un expert sur soixante-quatre allège encore le calcul. Le contexte natif monte à 256K tokens, avec une marge annoncée vers le million, et un mode reasoning commutable permet de basculer entre réflexion et réponse directe selon la difficulté de la tâche.
Les démonstrations mises en ligne couvrent la construction d'une ville en 3D via Blender MCP, du script Python jusqu'au rendu vidéo aérien, une équipe de recherche autonome où cinq agents formulent des hypothèses, confrontent les sources et produisent un papier accompagné de slides, puis une chaîne bureautique passant par Office MCP pour mettre en forme une proposition Word et vérifier des tableaux Excel.
Le modèle est accessible sur OpenRouter, gratuitement jusqu'au 3 août 2026. Les poids ne sont pas publiés à ce stade, contrairement aux versions antérieures de la série, InclusionAI évoquant une ouverture ultérieure.