Z-Image-Engineer-V6, fine-tune communautaire pour booster Z-Image-Turbo

Le fine-tune Z-Image-Engineer-V6 de BennyDaBall optimise le modèle Z-Image-Turbo d'Alibaba via SMART DoRA pour enrichir les prompts et la composition d'image.

Côté open source, Z-Image-Turbo s'est imposé fin 2025 : ce modèle text-to-image d'Alibaba (Tongyi-MAI) de 6 milliards de paramètres génère en 8 étapes sous la seconde, tient sur 16 Go de VRAM, et figure en tête des modèles open weights sur l'Artificial Analysis Image Arena, notamment pour son rendu de texte bilingue.

Autour de ce modèle, un développeur, BennyDaBall, vient de publier Z-Image-Engineer-V6, un fine-tune communautaire de 4 milliards de paramètres (encodeur Qwen) à double usage. En local (LM Studio, llama.cpp), il fait office de prompt enhancer : un prompt minimal devient une description structurée (composition, éclairage, matières, profondeur), débarrassée des formules creuses type « 8k, masterpiece ». Dans ComfyUI, il remplace l'encodeur texte d'origine de Z-Image-Turbo pour produire un conditionnement différent à partir d'un même seed.

L'entraînement s'appuie sur une méthode maison, SMART DoRA, et ses régularisateurs censés éviter les boucles répétitives. L'auteur le reconnaît lui-même : l'outil améliore l'adhérence à la composition, sans garantir un seed parfait à chaque fois.