Les poids de Qwen-Image-2.1 s’ouvrent, pas son usage commercial
Alibaba publie Qwen-Image-2.1, un modèle de génération et d’édition d’images de 7 milliards de paramètres. Transparence RGBA native, dix images de référence et retouches locales sont au programme, mais la licence reste limitée aux usages non commerciaux.
n fond transparent généré directement, jusqu’à dix visuels de référence et un contrôle local des retouches : le nouveau modèle de la famille Qwen-Image veut réunir création et édition dans un format plus compact. Ses poids peuvent être téléchargés depuis le 20 septembre 2026, avec une restriction importante : leur exploitation commerciale nécessite une autorisation distincte. Un même modèle pour créer et modifier
Qwen-Image-2.1 est conçu pour produire une image à partir d’une instruction comme pour transformer un contenu existant. Le modèle peut modifier un élément précis, préserver l’apparence d’une personne ou d’un produit et combiner plusieurs références au sein d’une même composition.
Son composant de génération visuelle compte 7 milliards de paramètres et repose sur 32 couches DiT à flux unique. Cette architecture est sensiblement plus compacte que celle du premier Qwen-Image, qui comptait 20 milliards de paramètres. Le dépôt complet reste toutefois conséquent : l’ensemble des fichiers publiés sur Hugging Face représente environ 33,1 Go, car il comprend également l’encodeur textuel, le VAE et les autres composants nécessaires au fonctionnement du pipeline.
Le qualificatif « léger » doit donc être compris relativement aux grands modèles visuels concurrents. Alibaba ne publie pas de configuration matérielle minimale officielle, mais propose un déchargement partiel vers la mémoire centrale pour les machines dont la mémoire graphique est limitée. La transparence devient native
La principale nouveauté fonctionnelle concerne le format RGBA. Le modèle peut générer une image accompagnée de son canal alpha, extraire un sujet d’une photographie ou modifier directement un contenu transparent.
Cette approche évite une étape séparée de détourage et facilite la création de ressources destinées au design, au commerce en ligne, aux présentations ou aux interfaces. Elle ne transforme cependant pas chaque génération en document multicouche entièrement éditable : la sortie correspond à une image RGBA, et non à une pile structurée comparable à celle d’un logiciel de composition. Jusqu’à dix images de référence
Le modèle accepte jusqu’à dix références au sein d’une même requête. Elles peuvent servir à préserver un visage, reprendre l’apparence d’un produit, appliquer une direction artistique ou construire une scène réunissant plusieurs sujets.
Les modifications locales peuvent être indiquées avec un cercle, une zone peinte ou un masque distinct. Qwen présente notamment des usages autour de l’essayage virtuel, des portraits de groupe, des infographies, des panoramas et de la typographie intégrée aux images. La conservation stricte de l’identité ou des détails commerciaux reste néanmoins une promesse du fournisseur, à vérifier sur chaque production. Une accélération fondée sur la réutilisation du contexte
Pour réduire le coût de traitement, Qwen-Image-2.1 combine une attention à plusieurs niveaux de granularité avec la réutilisation d’un cache de clés et de valeurs. Lorsqu’une ou plusieurs images servent de références, certaines représentations déjà calculées peuvent ainsi être conservées entre les étapes de génération.
Alibaba affirme que ce mécanisme accélère fortement les requêtes comportant plusieurs images. Le modèle est présenté comme plus rapide et plus économique que de nombreux systèmes propriétaires, mais le lancement ne fournit pas de tableau indépendant permettant de comparer la latence sur une machine, une définition et un nombre d’étapes identiques.
L’exemple officiel utilise 40 étapes et une sortie carrée de 2048 × 2048. D’autres formats sont documentés, jusqu’à 2752 × 1536 pour le 16:9. La vitesse réellement observée dépendra donc du matériel, du format, du nombre de références et des réglages choisis. Des performances mesurées avec le benchmark de Qwen
Dans son propre Qwen-Image-Bench, Alibaba attribue à Qwen-Image-2.1 un score global de 60,28. Ce résultat le placerait en tête des modèles à poids téléchargeables évalués et devant plusieurs services fermés, tout en le maintenant derrière six systèmes propriétaires dans le classement global.
Cette comparaison doit être lue avec précaution. Qwen-Image-Bench a été conçu par l’équipe Qwen avec des artistes professionnels. Il comprend 1 000 instructions réparties entre cinq grands axes d’évaluation, puis utilise un évaluateur automatisé complété par des annotations humaines. Il fournit un cadre détaillé, mais il ne constitue pas une validation indépendante des affirmations commerciales du lancement. Des poids téléchargeables sous licence non commerciale
L’expression « open weights » est exacte : les fichiers du modèle peuvent être téléchargés, inspectés et modifiés. Elle ne signifie cependant pas que tous les usages sont autorisés.
La Qwen Research License réserve l’utilisation, la reproduction, la modification et la redistribution aux activités non commerciales de recherche et d’évaluation. Une licence séparée doit être demandée à Alibaba pour intégrer le modèle ou ses dérivés à un produit commercial.
Le texte impose également certaines obligations de redistribution et, dans des situations particulières, la mention « Built with Qwen » ou « Improved using Qwen ». Il est régi par le droit chinois, avec compétence attribuée aux juridictions de Hangzhou. Qwen-Image-2.1 doit donc être décrit comme un modèle à poids ouverts sous licence de recherche, et non comme une solution librement exploitable dans n’importe quel contexte. Disponibilité
Les poids, le code d’exemple et les instructions de déploiement sont proposés sur Hugging Face, ModelScope et GitHub. Le pipeline officiel repose notamment sur PyTorch, Diffusers, Transformers et Accelerate.
Aucun fournisseur d’inférence n’est actuellement proposé directement depuis la fiche Hugging Face, et Alibaba n’y indique ni tarif d’API ni mémoire minimale. L’intérêt immédiat concerne donc surtout les chercheurs, les développeurs et les studios capables d’héberger ou d’optimiser eux-mêmes le modèle.