Halo garde les modèles dans Hugging Face tout en distribuant leur entraînement
White Circle publie Halo, un framework open source de post-training qui ajoute entraînement distribué, parallélisme MoE et reinforcement learning aux modèles Hugging Face sans imposer de nouvelle implémentation ni de format de checkpoint propriétaire.
Entre TRL et les frameworks conçus pour les grands clusters
À mesure qu’un modèle grossit, son post-training finit par dépasser la mémoire disponible sur un seul GPU. Passer à une infrastructure distribuée peut alors imposer de réimplémenter son architecture, convertir ses checkpoints et maintenir une seconde représentation du modèle.
Halo cherche à conserver le modèle directement dans l’écosystème Hugging Face. Une architecture chargée au format Hugging Face reste dans ce format pendant l’entraînement et ressort sous forme de checkpoints SafeTensors compatibles avec `frompretrained`.
Le framework ajoute quatre formes de parallélisme : Expert Parallelism pour répartir les experts des modèles MoE, Context Parallelism pour distribuer les longues séquences, Tensor Parallelism pour répartir les multiplications matricielles et Expert-Tensor Parallelism pour découper un expert entre plusieurs GPU. Ces modes peuvent être configurés depuis un fichier YAML et certains peuvent être combinés entre eux. Jusqu’à 2,8× le débit de TRL dans les tests de White Circle
Sur `gpt-oss-20b`, White Circle mesure entre 2,3 et 2,8 fois le throughput de stock TRL selon les configurations, avec une consommation mémoire maximale inférieure dans les comparaisons correspondantes. Les tests utilisent le même FlashAttention, les mêmes kernels Liger, la fused cross-entropy et les mêmes grouped-GEMM des deux côtés afin de limiter les différences liées aux optimisations externes.
À 4k tokens et batch 1, Halo atteint par exemple 9 009 tokens/s/GPU contre 3 885 pour stock TRL dans le protocole publié. Avec une configuration privilégiant la mémoire, Expert Parallelism ramène l’utilisation à 26 Go par GPU contre 47,6 Go pour TRL ZeRO-3. Ces chiffres ont été obtenus par White Circle sur des NVIDIA B300 et ne constituent pas un benchmark indépendant.
L’écart n’est pas constant. À 256k tokens, le gain de throughput tombe à 1,3×. Face à Megatron-LM, Halo prend également l’avantage sur plusieurs configurations d’Expert Parallelism, mais Megatron repasse légèrement devant à EP8 dans le test publié par l’équipe. Un wrapper plutôt qu’une réécriture du modèle
L’intégration d’une nouvelle famille passe principalement par un wrapper autour des blocs concernés. White Circle oppose cette méthode aux frameworks qui maintiennent leur propre implémentation de chaque architecture.
L’équipe mesure 127 lignes de code pour l’un de ses wrappers Halo, contre 627 à 1 925 lignes dans deux exemples Megatron-Bridge qu’elle utilise comme comparaison. Le cas Laguna-S-2.1 de Poolside descend à 44 lignes, tandis que LFM2.5-8B-A1B de Liquid AI nécessite environ 120 lignes pour ajouter EP, ETP et leur combinaison.
Cette architecture s’étend au post-training : SFT, DPO, KTO, GRPO, RLVR, distillation, reward modeling et entraînement d’embeddings utilisent la même couche distribuée. Halo prend également en charge LoRA sur plusieurs modes de parallélisme. Le reinforcement learning partage la même infrastructure
Pour le RL agentique et multi-turn, Halo utilise SGLang comme moteur principal de rollouts dans un environnement séparé du trainer. SGLang génère les trajectoires pendant que Halo entraîne le modèle et synchronise les nouveaux paramètres via NCCL. Avec plusieurs serveurs, la génération du batch suivant peut avoir lieu pendant l’entraînement du batch courant.
Le framework gère également des environnements où le modèle appelle des outils, exécute du code, utilise MCP ou effectue des recherches. Le même socle peut donc passer d’un fine-tuning supervisé à des boucles de RL avec environnement externe sans changer d’infrastructure d’entraînement. Un test sur 177 millions de tokens
White Circle s’est servi de Halo pour fine-tuner GLM-4.7-Flash-Coder sur 177 millions de tokens de traces agentiques. Sur SWE-rebench-V2, le taux de tâches résolues est passé de 33,15 % à 41,65 % après SFT, soit une progression relative de 26 % dans l’évaluation publiée par l’équipe.
Halo est publié sous licence Apache 2.0. Le dépôt GitHub de Halo contient le framework, ses configurations et le harness utilisé pour reproduire les comparaisons avec TRL.