Boogu-Image, un modèle open source unifié pour générer et éditer des images

Boogu-Image-0.1 est un modèle d'IA open source unifié qui génère et édite des images en s'appuyant sur les technologies de compréhension de DeepSeek.

Une nouvelle famille de modèles d'images, Boogu-Image-0.1, rejoint l'open source sous licence Apache 2.0, avec la même brique pour générer et éditer. Le projet Boogu en défend la thèse dès le départ : c'est la compréhension qui tire la génération. Concrètement, l'équipe s'appuie sur des modèles de compréhension open source, dont ceux de DeepSeek, pour mieux interpréter les prompts complexes et le contexte.

La famille couvre plusieurs usages : un modèle Base orienté qualité et texte dense, une variante Turbo distillée qui génère en trois ou quatre étapes avec un fort accent photoréaliste, un modèle Edit pour la retouche par instruction, et une version quantifiée fp8 pour les machines contraintes. Le rendu de texte bilingue chinois-anglais, sur affiches, documents ou interfaces, figure parmi les points forts revendiqués.

Côté performances, l'équipe revendique un entraînement avec environ dix fois moins de données que des concurrents open source, et un niveau comparable aux meilleurs systèmes fermés dans bien des cas, le tout sur ses propres comparatifs, dont une arène maison montée faute d'accès à LM Arena. Fait plus rare, Boogu publie aussi une longue liste de limites assumées, du savoir encyclopédique en retrait à une cohérence d'édition encore instable. Modèles, code et démos sont accessibles sur GitHub, Hugging Face et via ComfyUI.