L’architecture qui prépare Qwen4 s’ouvre avec Qwen3.8-Flash-Next

Qwen3.8-Flash-Next ouvre les poids d’une architecture annonçant Qwen4, avec 6 milliards de paramètres activés et un contexte natif de 262K.

Augmenter la capacité d’un modèle sans faire progresser son coût de calcul au même rythme constitue le principal objectif de Qwen3.8-Flash-Next. Cette version multimodale répartit ses connaissances entre un réseau d’experts, une mémoire fondée sur des suites de tokens et une nouvelle forme d’attention destinée aux très longs contextes.

Qwen présente cette publication comme un premier aperçu de l’architecture en préparation pour Qwen4. Il ne s’agit donc pas d’une première version de Qwen4, mais d’un modèle expérimental permettant d’évaluer plusieurs choix techniques avant leur éventuelle intégration dans la prochaine génération.

Deux produits proches doivent être distingués. Qwen3.8-Flash-Next désigne la version expérimentale dont les poids, la configuration et le rapport technique sont disponibles au téléchargement. Qwen3.8-Flash correspond à la version de production proposée sur QwenCloud, enrichie d’un contexte d’un million de tokens par défaut et d’outils intégrés.

La fiche de Qwen3.8-Flash-Next décrit un modèle de langage causal accompagné d’un encodeur visuel. Il peut recevoir du texte, des images et des vidéos, puis produire du texte. Ses usages annoncés couvrent la conversation, la programmation, les agents, l’analyse d’interfaces, les graphiques, les documents et les vidéos longues.

La partie principale contient 125 milliards de paramètres, mais environ 6 milliards sont sollicités pour traiter chaque token. Cette différence repose sur une architecture Mixture of Experts : le modèle possède 512 experts, mais n’en active que dix spécialisés et un partagé à chaque passage.

Le chiffre de 6 milliards ne décrit donc ni la taille du téléchargement ni la mémoire totale nécessaire. Il mesure la portion du réseau utilisée pour un token donné. L’ensemble des poids doit toujours être stocké et rendu accessible afin que le système puisse sélectionner des experts différents selon le contenu.

À ces 125 milliards s’ajoutent 51 milliards de paramètres consacrés aux embeddings N-gram et environ 4 milliards pour le module de prédiction multitoken. Selon cette manière de compter, l’ensemble dépasse ainsi 180 milliards de paramètres, même si seule une fraction intervient directement dans chaque étape de calcul.

Les 51 milliards d’embeddings N-gram jouent un rôle différent de celui des experts. Le rapport technique explique qu’ils sont organisés en tables associées à des bigrammes et trigrammes. De courtes suites de tokens servent de clés pour retrouver un vecteur mémorisé, ensuite ajouté à la représentation traitée par le modèle.

Cette mémoire se situe au deuxième niveau du réseau et comprend 20 millions d’entrées. Son adressage étant déterministe, les tables peuvent rester dans la mémoire hôte et être préparées pendant le traitement de la première couche. Elles n’ont donc pas besoin d’occuper en permanence la mémoire de l’accélérateur.

Ce choix permet d’ajouter une grande quantité d’informations avec peu de calcul supplémentaire. Il ne rend toutefois pas le modèle léger. Les fichiers de référence publiés sur Hugging Face représentent environ 360 Go et sont répartis en 131 fragments principaux. Un déploiement dans leur précision d’origine exige donc une infrastructure importante, même si une partie de la mémoire est déportée vers la RAM du serveur.

Des versions quantifiées peuvent réduire cette occupation, avec un compromis possible sur la qualité, la vitesse ou la longueur de contexte utilisable. La présence de poids téléchargeables ne signifie donc pas que le modèle complet fonctionnera confortablement sur un ordinateur personnel. Les équipes devront également disposer d’une bande passante mémoire suffisante pour alimenter les tables N-gram depuis la mémoire hôte.

Le deuxième changement concerne la circulation des informations dans le contexte. L’architecture alterne trois couches Gated DeltaNet avec une couche Qwen Sparse Attention. Gated DeltaNet condense progressivement les tokens précédents dans un état de taille fixe, ce qui évite de relire tout le contexte à chaque étape.

Cette mémoire condensée peut cependant perdre certains détails précis. Une couche d’attention plus directe intervient donc après chaque groupe de trois couches afin de retrouver des informations particulières dans les tokens antérieurs. Le modèle combine ainsi une lecture récurrente peu coûteuse avec des recherches plus ciblées dans le contexte.

Qwen Sparse Attention ne compare pas systématiquement chaque token avec tous ceux qui le précèdent. Le système commence par repérer des microblocs susceptibles d’être utiles, puis concentre le traitement sur les zones retenues. Cette sélection doit limiter l’augmentation du calcul lorsque la conversation, le document ou le dépôt de code devient très long.

Le rapport mesure un gain de 7,6 fois pour la phase de lecture initiale et de 4,9 fois pendant la génération à un million de tokens. Ces chiffres portent sur le module d’attention comparé à une implémentation dense dans les conditions du test. Ils ne représentent pas une accélération équivalente de l’ensemble du modèle ni une comparaison directe avec les API concurrentes.

Une autre nouveauté, Gated Residual, élargit le flux résiduel en quatre branches. Chaque couche utilise des portes pour déterminer quelles informations lire et quelle quantité réinjecter. Cette organisation cherche à augmenter la capacité du modèle tout en maintenant la stabilité d’un entraînement de grande taille.

Qwen indique que cette architecture a terminé son entraînement sans pic anormal de perte ni fluctuation inhabituelle des gradients. Cette observation concerne le processus interne décrit par l’équipe et ne garantit pas à elle seule la stabilité des sorties produites après le déploiement. Elle montre surtout que les modifications n’ont pas rendu l’entraînement plus fragile aux échelles testées.

La méthode d’optimisation combine également Muon et AdamW. Muon est appliqué aux matrices pour lesquelles son opération d’orthogonalisation est jugée utile, tandis qu’AdamW reste