Muse Glimmer : l’agent local open-weight que Meta vient de lâcher
Muse Glimmer est un modèle agentique de 30 milliards de paramètres conçu pour fonctionner en local, avec open weights sous licence Apache 2.0.
Muse Glimmer est un modèle de 30 milliards de paramètres conçu pour les agents exécutés directement sur un Mac ou un PC équipé d’un GPU performant. Ses open weights sont publiés sous licence Apache 2.0, avec un positionnement centré sur les assistants personnels persistants, le code local, l’appel d’outils et les workflows autonomes.
Le modèle accepte le texte et les images grâce à un encodeur de perception dédié. Il peut enchaîner des appels d’outils, maintenir un plan sur plusieurs étapes, reprendre après l’échec d’une action et fonctionner avec différents environnements d’orchestration. Meta indique également un entraînement couvrant plus de 100 langues et plusieurs niveaux d’effort de raisonnement.
Pour rendre l’exécution locale plus accessible, les poids ont été quantifiés jusqu’à environ 4 bits, ramenant la partie langage sous les 20 Go. Une version K-Quant occupe environ 17 Go, laissant de la mémoire pour le contexte, l’analyse d’images et le modèle auxiliaire utilisé pour accélérer la génération. Meta indique avoir testé l’ensemble dans des configurations disposant de 24 ou 32 Go de mémoire.
Cette accélération repose notamment sur un petit modèle DFlash chargé de proposer plusieurs tokens à l’avance, ensuite vérifiés en parallèle par Muse Glimmer. L’entreprise rapporte des vitesses compatibles avec des interactions agentiques en temps réel sur des MacBook M4 Max, M5 Max et une RTX 5090.
L’entraînement combine distillation depuis Muse Spark, données à contexte long, fine-tuning supervisé, distillation on-policy et apprentissage par renforcement. Dans une démonstration, Muse Glimmer découvre une installation Home Assistant sur le réseau local, interroge ses appareils, construit une interface web puis démarre un serveur local pour la vérifier.
Les open weights sont accessibles sur Hugging Face. Des intégrations optimisées pour llama.cpp, MLX et ExecuTorch sont annoncées dans les prochains jours, tout comme des prises en charge via Ollama, LM Studio, Unsloth, vLLM, SGLang et plusieurs fournisseurs d’inférence.