Poids ouverts, format fermé
Fermion Research publie Neutrino-1 8B, un modèle ultra-léger pour ordinateurs portables dont le format fermé bloque l'usage sur Ollama et LM Studio.
Fermion Research publie trois modèles sous licence Apache 2.0, Neutrino-1 8B et deux déclinaisons à 0,6 milliard de paramètres. L'argument tient dans la taille : les 8,19 milliards de paramètres du plus gros tiennent dans un téléchargement de 2,56 gigaoctets et 3,88 sur disque, là où un modèle équivalent en 16 bits en pèse seize. Un même fichier, à l'octet près, se charge sur une carte H100 comme sur un MacBook de 16 gigaoctets, servi par un moteur unique.
Le format range chacune des 252 matrices de projection dans une famille ternaire, où chaque poids se réduit à un choix entre moins, zéro et plus, assorti d'un facteur d'échelle par ligne. 62,6 % des poids y valent exactement zéro. Les tables de vocabulaire échappent à ce traitement et restent en int8, pour près d'un tiers du fichier. L'entreprise précise que les extensions qu'elle apporte à cette famille ne sont pas publiées.
Le petit modèle sert de brouillon au grand. Il propose jusqu'à sept tokens que le 8B valide en une seule passe groupée, ne gardant que le préfixe sur lequel les deux s'accordent. Fermion annonce 763 tokens par seconde sur H100 sur les sorties les plus prévisibles, contre 396 sans ce dispositif, et publie une vérification peu commune dans ce registre, 27 648 tokens consécutifs produits à l'identique avec et sans brouillon.
Deux réserves ressortent d'une lecture croisée des documents. L'annonce affirme que le modèle a été entraîné nativement dans son format de diffusion, sans version en pleine précision arrondie après coup. La fiche technique publiée sur Hugging Face le décrit pour sa part comme un dérivé de Qwen3-8B obtenu par entraînement tenant compte de la quantification, puis post-entraîné. Les deux formulations ne se recouvrent pas. Cette même fiche donne par ailleurs, sur l'appel d'outils et le suivi d'instructions, des scores inférieurs à ceux de l'annonce, 65,31 et 73,17 contre 68,9 et 77,2. Enfin les poids sont ouverts, mais pas le format : le paquet GGUF ne se charge que dans la version modifiée de llama.cpp publiée par l'éditeur, ni dans llama.cpp d'origine, ni dans Ollama, ni dans LM Studio.