Trois modèles Nex-N2.5 pour agir, coder ou orchestrer
Nex-AGI présente Nex-N2.5 Mini, Pro et Max, trois modèles agentiques ouverts destinés au computer use, au code et aux tâches de longue durée.
Un agent ouvre Blender, modifie une scène, observe le résultat puis corrige son travail. Un autre remplit une demande de remboursement, navigue entre plusieurs écrans et vérifie que l’opération a bien été enregistrée. Nex-AGI utilise ces exemples pour présenter Nex-N2.5, une nouvelle famille de modèles pensée pour agir dans des logiciels plutôt que pour répondre uniquement dans une fenêtre de conversation.
La gamme réunit trois modèles aux fonctions différentes. Mini et Pro acceptent du texte et des images. Ils peuvent donc analyser une capture d’écran, repérer une commande dans une interface puis proposer l’action suivante. Max reçoit exclusivement du texte et cible plutôt le raisonnement complexe, la programmation et l’orchestration de longues chaînes d’outils.
Mini compte 35 milliards de paramètres. Sa configuration reprend l’architecture multimodale Qwen3.5 MoE et déclare une fenêtre de contexte de 262 144 tokens. Ses fichiers au format BF16 occupent environ 70 Go sur Hugging Face. Le modèle comporte 256 experts, dont huit sont sollicités pour chaque token. Cette activation sélective réduit le calcul effectué à chaque étape par rapport à un modèle dense de taille équivalente.
Pro est annoncé à 397 milliards de paramètres. Il prolonge la base multimodale utilisée par Nex-N2-Pro, elle-même issue de Qwen3.5-397B-A17B. Le suffixe A17B indique que seule une fraction du réseau, proche de 17 milliards de paramètres, est mobilisée pour chaque token. Cette architecture vise un compromis entre la capacité totale du modèle et le coût de son exécution.
Max change d’échelle et de fondation. Nex-AGI le décrit comme un modèle MoE de 1 600 milliards de paramètres construit à partir de DeepSeek-V4-Pro-Base. Le nombre total ne correspond pas au volume de calcul déclenché pour chaque mot, puisque le mécanisme d’experts n’en active qu’une partie. Nex-AGI ne publie pas dans sa fiche de lancement un chiffre synthétique indiquant le nombre exact de paramètres actifs par token.
Les trois versions ne forment donc pas une simple progression allant d’un petit modèle vers un très grand. Mini et Pro possèdent une composante visuelle, tandis que Max en est dépourvu. Max ne peut pas examiner directement une fenêtre de navigateur ou l’état d’un logiciel. Pour intervenir sur un ordinateur, il doit recevoir une description textuelle de l’environnement ou travailler avec un autre système chargé de la perception.
Cette distinction nuance la formule selon laquelle la famille peut utiliser un ordinateur. Le computer use de Mini et Pro suit une boucle fondée sur l’observation. L’agent reçoit une image de l’écran, interprète l’état de l’application, choisit une action, puis analyse l’image suivante pour vérifier son effet. Il peut modifier sa stratégie lorsque le bouton attendu n’apparaît pas, lorsqu’une boîte de dialogue bloque l’interface ou lorsque le résultat obtenu ne correspond pas à son objectif.
Le modèle ne contrôle pas seul la machine. Un programme extérieur doit prendre les captures, convertir ses réponses en clics, frappes au clavier ou commandes, puis lui renvoyer le nouvel état. Cette couche fixe aussi les applications accessibles, les délais, les droits accordés et les conditions d’arrêt.
Nex-AGI affirme avoir élargi les environnements utilisés pendant le post-entraînement. Les exemples couvrent les navigateurs, les logiciels de création 3D, les outils de conception assistée, les tâches administratives et certains jeux sur PC. Le but est de prolonger l’action au-delà de quelques manipulations isolées et d’apprendre au modèle à vérifier les conséquences de ses décisions.
Les démonstrations montrent cette continuité, mais elles ne donnent pas encore le taux d’échec réel sur chaque logiciel. La société ne précise pas combien de tentatives ont été nécessaires, quelles séquences ont été sélectionnées ni la part des commandes préparées à l’avance. Elles illustrent les usages visés sans constituer une mesure indépendante de fiabilité.
La capacité à se corriger ne garantit pas non plus qu’une tâche finira par réussir. Une erreur de perception peut entraîner une action incorrecte, puis servir de point de départ à plusieurs décisions supplémentaires. Sur une opération longue, l’agent doit aussi conserver les contraintes initiales, distinguer ce qui a déjà été accompli et éviter de répéter une action dont l’effet n’est pas immédiatement visible.
La taille de Max vise un autre type de continuité. Le modèle est destiné aux dépôts de code volumineux, aux recherches comprenant de nombreuses étapes et aux agents qui appellent plusieurs services. Sa configuration déclare jusqu’à 1 048 576 positions. La recette officielle de déploiement limite cependant le serveur à 262 144 tokens. La longueur inscrite dans le fichier de configuration ne correspond donc pas automatiquement à celle retenue dans l’installation recommandée.
Nex-N2.5 propose trois réglages de raisonnement. Le mode `none` produit directement une réponse, `medium` laisse le modèle choisir l’effort nécessaire et `high` active systématiquement une phase de réflexion. Le mode intermédiaire est sélectionné par défaut. La famille prend aussi en charge les appels de fonctions, ce qui autorise un agent à choisir un outil et à préparer ses paramètres dans un format exploitable par une application.
L’intégration utilise des requêtes compatibles avec le format Chat Completions d’OpenAI. Nex-AGI recommande une version personnalisée de SGLang, distribuée dans l’image Docker `nexagi/sglang:v0.5.18-nex-patch`. Mini et Pro emploient un analyseur de raisonnement Qwen3, alors que Max utilise celui de DeepSeek-R1. Les trois s’appuient sur le parseur Qwen3 Coder pour les appels d’outils.
Le matériel demandé rappelle que « petit » reste relatif. La recette publiée prévoit deux GPU H100 pour Mini et huit H100 pour Pro. Max nécessite seize H200 répartis sur deux machines. Ces configurations représentent les installations recommandées par Nex-AGI, pas nécessairement les seuls montages possibles, mais