Reve 2.0 mise sur les layouts pour rendre l'image éditable comme du code

Reve 2.0 révolutionne la génération d'images IA avec son système de Layouts modifiables et son modèle Qwen, se classant deuxième de l'Arena Text-to-Image.

Reve sort la deuxième version majeure de son modèle. Plutôt que de générer une image directement depuis un prompt, Reve 2.0 s'appuie sur une représentation intermédiaire baptisée Layout : un plan structuré et hiérarchique où chaque élément reçoit une position, une taille, une description locale et des attributs optionnels comme la couleur ou une référence d'image. Le principe rappelle ce que HTML est à une page web ou SVG à un dessin vectoriel : l'image devient lisible et modifiable région par région, par un humain comme par un agent IA. Derrière, un Large Layout Model unifié, construit par poursuite d'entraînement de LLM open source (Qwen) sur des milliards d'images annotées, accepte layouts, instructions et images de référence, puis effectue le rendu en 4K natif. Deuxième de l'Arena Text-to-Image, devant Nano Banana 2 et GPT-Image-1.5 et derrière le seul GPT-Image-2, le modèle est revendiqué meilleur générateur 4K au monde, un niveau atteint selon l'équipe avec dix fois moins de GPU que les grands laboratoires. Ses ablations internes indiquent que les modèles à layout surpassent les générateurs à prompt de taille équivalente, la qualité progressant avec le nombre de régions décrites. Le modèle se teste sur app.reve.com, l'API étant attendue d'ici une semaine.

L'avis des utilisateurs

L'accueil est nettement enthousiaste sur 𝕏 comme sur Reddit, où les discussions se sont multipliées dès les premières heures. Ce qui frappe les testeurs n'est pas tant la qualité brute que le changement de méthode : on passe de la bataille de prompts à la conception d'un layout que l'IA se charge de rendre, une logique comparée par certains à une PAO de l'ère IA et perçue comme un outil de production plutôt qu'un générateur aléatoire. Les créatifs retiennent surtout la possibilité d'intervenir : sélectionner une région, la modifier et itérer sans dégradation de l'image. Les bémols restent ponctuels. Un designer venu du cinéma place le modèle derrière Grok Imagine et Midjourney sur une esthétique Giallo des années 70, signe que le résultat dépend fortement du style demandé.