Iris-3B veut générer l’image directement, sans passer par un espace latent

Le modèle Iris-3B de Speridlabs génère des images directement en espace pixel. Une alternative open weight de 3 milliards de paramètres face au latent.

Speridlabs présente Iris-3B, un modèle text-to-image open weight de 3 milliards de paramètres qui prend une direction technique encore assez rare à cette échelle : générer directement l’image en espace image, sans passer par un VAE chargé de compresser puis reconstruire le visuel. Le projet est entièrement ouvert, avec les poids disponibles sur Hugging Face, le code, une démonstration et une licence Apache 2.0.

La proposition est intéressante parce qu’elle remet en question l’une des briques devenues presque standard dans la génération d’images moderne. Les modèles de diffusion latente comme Stable Diffusion ou plusieurs architectures plus récentes ne travaillent généralement pas directement sur l’image finale. Ils compressent d’abord cette image dans une représentation plus compacte, effectuent la génération dans cet espace, puis utilisent un décodeur pour revenir au rendu visible.

Iris-3B tente de supprimer cette étape intermédiaire. Pourquoi retirer le VAE ?

Le principal avantage des modèles latents est leur efficacité. Travailler sur une représentation compressée réduit fortement la quantité de calcul nécessaire pour générer une image haute résolution.

Cette compression a néanmoins une contrepartie : certaines informations fines peuvent être perdues ou déformées avant même que le modèle génératif n’intervienne. Speridlabs pointe notamment les textures, les petits détails et certaines structures précises, qui peuvent être affectés par les biais introduits par la représentation latente.

Le papier consacré à Iris-3B explore donc l’hypothèse qu’un modèle directement entraîné en espace image pourrait mieux préserver ces informations. Les auteurs ne se limitent pas à la génération text-to-image : ils testent également cette représentation sur l’estimation de profondeur et la restauration ou super-résolution d’images.

Cette hypothèse n’aboutit toutefois pas à une victoire nette. Les chercheurs indiquent eux-mêmes ne pas observer d’amélioration significative et systématique du simple fait de supprimer le latent sur ces tâches en aval. Sur l’estimation de profondeur, Iris-3B atteint un niveau comparable à une variante latente de FLUX.2 Klein, tandis que sur la restauration DIV2K ×4, les variantes travaillant directement en espace image ne dépassent pas le modèle latent correspondant.

C’est probablement l’un des aspects les plus intéressants du projet : Speridlabs publie aussi les résultats qui ne confirment pas son hypothèse initiale. Un transformer de 3 milliards de paramètres

Iris-3B est un flow-matching transformer de 3 milliards de paramètres.

Les images sont découpées en blocs de 16 × 16, puis traitées par une architecture composée de huit blocs dual-stream, où texte et image disposent de poids distincts, suivis de seize blocs single-stream. Un petit Pixel Transformer head, ou PiT head, reconstruit ensuite directement les valeurs de chaque bloc sous forme d’image.

Le texte est encodé par un Qwen3-VL-4B-Instruct gelé, utilisé uniquement comme encodeur. Le modèle image lui-même compte donc 3 milliards de paramètres, auxquels vient s’ajouter cet encodeur de texte externe.

Speridlabs utilise également une représentation positionnelle 2D RoPE, ce qui permet à un même ensemble de poids de fonctionner avec différents ratios et différentes résolutions jusqu’à environ un mégapoint d’image.

Le modèle a été entraîné de zéro avec un curriculum progressif : 256 × 256, puis 512 × 512, puis 1024 × 1024, avant une phase de supervised fine-tuning en 1024. La fiche Hugging Face indique un total de 665 000 étapes d’entraînement. Des images générées directement en 1024

En utilisation standard, Iris-3B produit des images autour de 1024 × 1024, avec une centaine d’étapes de génération et un CFG réglé à 3 dans la configuration par défaut. Les poids représentent environ 12 Go et nécessitent actuellement un GPU NVIDIA avec CUDA pour l’exécution locale proposée par Speridlabs.

Le modèle accepte aussi les ratios natifs jusqu’à environ un mégapoint plutôt que d’imposer systématiquement un carré.

Côté prompting, rien de particulièrement exotique : Speridlabs recommande des descriptions simples en anglais et prend en charge les negative prompts, les seeds fixes et les traitements par lots.

La société reconnaît cependant plusieurs limites familières aux modèles d’image actuels. Le rendu de texte dans l’image n’est pas toujours fiable, tout comme le respect exact du nombre d’objets demandés. Pour les impressions de grande taille, elle recommande encore l’usage d’un outil d’agrandissement. Des performances proches de modèles beaucoup plus gros

Sur les benchmarks publiés par Speridlabs, Iris-3B reste compétitif face à plusieurs architectures latentes plus lourdes.

Le modèle atteint 0,798 sur GenEval, 86,52 sur DPG, 0,857 sur LongText et 0,540 sur OneIG.

Sur OneIG, il se situe pratiquement au niveau de Qwen-Image 20B, annoncé à 0,539 dans le tableau utilisé par Speridlabs, alors qu’Iris-3B compte environ sept fois moins de paramètres dans son backbone génératif. Il reste en revanche derrière Qwen-Image sur GenEval, DPG et LongText.

Z-Image 6B obtient également de meilleurs scores sur plusieurs de ces mesures, mais Speridlabs précise que ses propres résultats sont obtenus sans réécriture des prompts et sans stratégie best-of-N.

Ces comparaisons doivent rester prudentes, car certains modèles utilisent des protocoles différents et tous les résultats ne proviennent pas nécessairement d’une campagne d’évaluation parfaitement homogène. Générer et comprendre avec le même backbone

L’autre objectif d’Iris-3B est de tester si un modèle génératif peut également servir de fondation pour des tâches de compréhension visuelle.

Speridlabs le présente ainsi comme un general vision learner et compare cette approche à celle de modèles spécialisés comme DINOv2.

Le modèle est adapté à l’estimation monoculaire de profondeur ainsi qu’à la restauration et à la super-résolution d’images. L’idée est que la représentation acquise en apprenant à reconstruire directement