Reflection dévoile Beam, son premier grand modèle open weight
Le modèle open weight Beam de Reflection AI n'active que 23 milliards de paramètres. Une architecture pensée pour réduire le coût d'inférence du code.
Reflection AI entre dans la course aux grands modèles ouverts avec Beam, son premier modèle open weight. Présenté le 5 octobre 2026, Beam repose sur une architecture Mixture-of-Experts réunissant 501 milliards de paramètres au total, mais seulement 23 milliards activés lors de l'inférence. Reflection le destine principalement au code, au raisonnement et aux tâches agentiques.
Ce rapport entre taille totale et paramètres actifs constitue une partie centrale du positionnement de Beam. Reflection ne cherche pas uniquement à rivaliser sur les scores bruts, mais sur la quantité de ressources nécessaire pour atteindre ces performances. L'entreprise affirme notamment obtenir des résultats comparables à GLM-5.2 sur plusieurs tests de raisonnement en utilisant trois à quatre fois moins de calcul à l'inférence. Face à des modèles dépassant les 2 000 milliards de paramètres comme Qwen 3.8-Max, l'écart de ressources par token serait encore plus important. Ces mesures reposent toutefois sur les évaluations et estimations publiées par Reflection, et non sur une campagne indépendante uniforme.
Sur les tâches de développement, Beam obtient selon Reflection 80,9 sur SWE-bench Verified, 80,1 sur Terminal Bench 2.1 et 78 sur SWE-bench Multilingual. Sur DeepSWE v1.1, son score de 44,4 le place à proximité de GLM 5.2, mais derrière plusieurs modèles plus récents comme Qwen 3.8-Max, Kimi K3 ou DeepSeek V4.1 Flash. Reflection reconnaît d'ailleurs que Kimi K3 conserve un avantage en capacité brute et présente plutôt Beam comme une proposition axée sur l'efficacité.
Pour entraîner ce modèle, Reflection indique avoir commencé par un préentraînement sur 23,8 billions de tokens issus du web, de sources publiques et de jeux de données propriétaires sous licence. L'entreprise explique avoir éliminé environ 95 % des données Internet brutes au cours de ses différentes étapes de traitement et de sélection, avec une attention particulière portée au code, aux contenus techniques, aux mathématiques et aux sciences.
Le préentraînement de Beam aurait été réalisé en moins de quatre semaines sur 6 144 GPU NVIDIA GB300 NVL72. Reflection a ensuite consacré une infrastructure encore plus importante à l'apprentissage par renforcement : 10 500 GPU GB300 pendant quatre semaines, plus de 100 millions de rollouts et environ 1,3 milliard d'environnements d'exécution utilisés pour entraîner et évaluer les interactions du modèle. L'entreprise indique avoir maintenu jusqu'à 170 000 environnements simultanés pendant cette phase.
Reflection a également cherché à contrôler la quantité de raisonnement utilisée par le modèle. Beam dispose d'un paramètre de reasoning effort permettant de privilégier des réponses plus courtes et moins coûteuses ou, à l'inverse, d'allouer davantage de calcul aux tâches complexes. Pendant l'entraînement, Reflection dit avoir récompensé les solutions correctes tout en pénalisant les raisonnements inutilement longs afin d'améliorer le rapport entre performances et consommation de tokens.
Cette orientation se retrouve dans les tâches agentiques. Reflection affirme avoir observé des progrès sur la navigation web alors même que certaines phases d'entraînement ne comportaient pas directement ce type de tâches. Avec un accès au web et aux outils, Beam peut rechercher de la documentation, interroger d'autres modèles, manipuler des environnements de terminal ou s'appuyer sur des services externes pour traiter des documents. Beam reste cependant un modèle textuel : les autres modalités doivent être représentées sous une forme qu'il peut exploiter.
Reflection montre par exemple Beam construisant une carte en temps réel du métro new-yorkais après avoir recherché la documentation de la MTA, générant un jeu 3D avec p5.js ou préparant automatiquement un notebook de fine-tuning pour un modèle Gemma. Ces démonstrations sont fournies par Reflection et doivent donc être considérées comme des exemples sélectionnés plutôt que comme des évaluations indépendantes de son comportement général.
Le modèle offre également une longueur de contexte effective annoncée à 1 million de tokens. Reflection explique l'avoir obtenue pendant une phase intermédiaire d'entraînement utilisant notamment de grands dépôts de code, des documents longs et des tâches nécessitant de conserver des informations sur une durée étendue.
Beam n'est toutefois pas encore entièrement disponible en téléchargement. Au 8 octobre, l'organisation officielle de Reflection sur Hugging Face n'héberge encore aucun modèle public. Reflection propose actuellement un accès anticipé à certains utilisateurs et prévoit de publier dans le courant du mois les poids, le rapport technique, la model card ainsi que les outils destinés aux développeurs. Les poids doivent être distribués sous licence Apache 2.0, avec les ressources nécessaires pour exécuter, évaluer et fine-tuner Beam.
Cette ouverture fait partie d'un positionnement plus large de Reflection. L'entreprise veut proposer à la fois des modèles ouverts, les logiciels nécessaires pour les personnaliser et une infrastructure permettant de les déployer via son API, dans un cloud privé, sur site ou dans des environnements isolés.
Beam arrive ainsi dans un paysage où certains des modèles ouverts les plus performants proviennent désormais de laboratoires chinois. Reflection ne prétend pas systématiquement les dépasser : ses propres tableaux placent encore Kimi, Qwen, GLM ou DeepSeek devant Beam sur plusieurs évaluations. Son pari est différent. Avec seulement 23 milliards de paramètres actifs sur 501 milliards au total, l'entreprise cherche à rapprocher les performances de cette frontière tout en réduisant le coût nécessaire pour les exploiter. La publication effective des poids et les évaluations indépendantes permettront désormais de mesurer jusqu'où cet avantage se confirme.