Qwen-Image-3.0 pousse la génération d’images vers les contenus réellement exploitables

Le modèle Qwen-Image-3.0 génère des infographies denses et du texte lisible à 10 pixels. Ce que cette précision change pour la création de documents.

Avec Qwen-Image-3.0, Alibaba concentre ses progrès autour de trois axes : la densité du contenu, la précision des détails et l’étendue des connaissances mobilisées.

Le modèle accepte des instructions pouvant atteindre 4 500 tokens. Il peut ainsi produire en une seule génération des compositions complexes, comme une grille d’infographies, un storyboard, une page de journal, un support pédagogique ou plusieurs interfaces imbriquées. Dans sa démonstration, Qwen génère notamment neuf contenus techniques distincts dans une même image, avec textes, formules, schémas et illustrations.

La précision progresse également sur les petits éléments. L’équipe revendique un texte lisible jusqu’à 10 px, y compris dans des articles scientifiques contenant des équations, des indices et des caractères spéciaux. Le modèle travaille aussi les textures fines, comme la peau, les cheveux, le papier ou les coups de pinceau, et peut restaurer une œuvre endommagée en conservant son style d’origine.

Qwen-Image-3.0 prend nativement en charge douze langues, plus de cent styles artistiques et différents types d’interfaces, du site web au jeu vidéo en passant par le livestream. Il peut également enrichir une image existante avec des annotations scientifiques, des informations taxonomiques ou des éléments issus d’une recherche en ligne.

La génération et l’édition sont accessibles depuis Qwen Studio.