Aleph Alpha mise sur 3,46 milliards de paramètres actifs pour son modèle souverain

Aleph Alpha publie Kolibri, un modèle open weights bilingue allemand-anglais de 78 milliards de paramètres, dont environ 3 milliards actifs par token. Sous licence Apache 2.0, il combine architecture Mixture-of-Experts, contexte jusqu’à un million de tokens et plusieurs niveaux de raisonnement.

Un modèle de 78 milliards de paramètres qui n’en active qu’une fraction

Kolibri compte 78,1 milliards de paramètres, mais son architecture Mixture-of-Experts n’en mobilise qu’environ 3,46 milliards par token. Ce choix place l’efficacité d’inférence au centre du modèle développé par Aleph Alpha pour des usages en entreprise, dans l’administration publique ou encore l’industrie et l’aérospatial.

Le modèle peut être récupéré avec ses weights sur Hugging Face sous licence Apache 2.0. Son déploiement peut donc rester sur l’infrastructure de l’organisation, sans transmettre les données internes à un service d’inférence tiers.

Kolibri fonctionne nativement en allemand et en anglais et propose quatre niveaux d’effort de raisonnement : none, low, medium et high. La fenêtre de contexte peut atteindre un million de tokens, contre 65 536 pour Kolibri Origin, son prédécesseur expérimental de 30,6 milliards de paramètres. 384 experts derrière le modèle

Les 50 couches de Kolibri utilisent une architecture MoE avec 384 experts, dont six sont activés. Seules dix couches travaillent sur l’ensemble du contexte, les 40 autres utilisant une fenêtre glissante limitée à 512 tokens.

Aleph Alpha explique avoir retenu la configuration 78B après avoir également expérimenté des architectures allant jusqu’à 123B. Dans ses tests, deux H100 peuvent traiter simultanément 18 requêtes de 256 000 tokens avec le modèle 78B, contre trois pour la variante 123B. Le 78B décode également 28 % plus rapidement dans cette comparaison interne.

L’entraînement principal a mobilisé 768 GPU NVIDIA B200. Il comprend 20 000 milliards de tokens de pré-entraînement sur 21 jours, suivis de 3 440 milliards de tokens en mid-training puis de 200 milliards consacrés à l’adaptation aux longs contextes. L’allemand représente plus d’un cinquième du pré-entraînement

La dimension bilingue ne repose pas uniquement sur des textes traduits depuis l’anglais. 21,3 % des tokens de pré-entraînement sont en allemand, soit environ 4 300 milliards sur les 20 000 milliards du premier cycle.

Aleph Alpha a constitué une partie de ce corpus directement depuis le web allemand, en adaptant ses filtres aux particularités de la langue. D’autres documents allemands ont été reformulés pour multiplier leurs formes linguistiques sans modifier leur origine culturelle.

Un tokenizer bilingue de 128 000 entrées, baptisé UniBPE, accompagne ce travail. Il combine des éléments de BPE et de Unigram afin de mieux respecter la morphologie des mots, en particulier les composés allemands. Selon les mesures publiées par Aleph Alpha, Kolibri obtient la meilleure compression de l’allemand parmi les tokenizers comparés dans son rapport. Apprendre aussi à ne pas répondre

Une partie du post-training concerne explicitement le grounding. Des exemples où la réponse correcte est « I don't know » sont intégrés aux données afin d’éviter qu’une absence d’information soit systématiquement remplacée par une supposition.

Aleph Alpha utilise également son protocole Merlin-Arthur. Arthur correspond au modèle entraîné. Merlin produit des contextes contenant les éléments nécessaires à une réponse, tandis que Morgana retire les preuves pertinentes afin de pousser le modèle vers une hallucination. Arthur doit apprendre à distinguer les deux situations.

Sur le jeu public AA-Omniscience, Aleph Alpha rapporte que Kolibri s’abstient plutôt que de fournir une réponse incorrecte dans 44 % des cas concernés, contre 15 % pour Kolibri Origin. Les résultats restent issus des évaluations conduites par l’entreprise. Un entraînement automatisé entre deux générations

Kolibri succède à Kolibri Origin après trois mois d’itération entre leurs pré-entraînements respectifs. Le nombre total de paramètres est passé de 30,6 à 78,1 milliards, le volume de pré-entraînement de 7 510 à 20 000 milliards de tokens et la longueur maximale travaillée pendant l’entraînement de 65 536 à 262 144 tokens.

Pendant les 21 jours du pré-entraînement de Kolibri, Aleph Alpha rapporte 38 interruptions imprévues, environ une toutes les 10 000 heures-GPU. Le pipeline a automatiquement déplacé les tâches sur d’autres machines et repris depuis les checkpoints sans intervention manuelle.

Le modèle est disponible en open weights sous Apache 2.0. Son exécution avec vLLM passe actuellement par le package `aleph-alpha-inference`, avec raisonnement et tool calling pris en charge. Les contextes supérieurs à 262 144 tokens nécessitent une configuration explicite pour étendre la longueur jusqu’à 1 048 576 tokens.