DiffusionGemma : Google teste la diffusion de texte pour accélérer l'inférence locale

DiffusionGemma de Google DeepMind accélère l'inférence locale par quatre grâce à la génération de texte par diffusion de 256 tokens en parallèle.

Google DeepMind publie DiffusionGemma, un modèle expérimental ouvert sous licence Apache 2.0 qui rompt avec la génération token par token des LLM autorégressifs. Issu de la famille Gemma 4 et des recherches Gemini Diffusion, ce Mixture of Experts de 26 milliards de paramètres (3,8 milliards actifs à l'inférence) génère des blocs de 256 tokens en parallèle, sur le principe des générateurs d'images qui affinent progressivement un bruit initial. Résultat revendiqué : une inférence jusqu'à quatre fois plus rapide, soit plus de 1 000 tokens par seconde sur un H100 et plus de 700 sur une RTX 5090, le tout dans 18 Go de VRAM une fois quantisé.

L'attention bidirectionnelle, où chaque token voit tous les autres, ouvre des usages que les modèles séquentiels gèrent mal : édition in-line, code infilling, structures non linéaires comme les séquences d'acides aminés. Le modèle s'autocorrige aussi en réévaluant le bloc entier à chaque passe. Google précise les limites : la qualité de sortie reste inférieure à Gemma 4 standard, et l'avantage de vitesse s'estompe en serving cloud à fort débit, où le batching sature déjà le matériel. Le gain vise donc l'inférence locale et les faibles concurrences.

Les poids sont disponibles sur Hugging Face, avec support vLLM, MLX et Transformers, llama.cpp à venir, et des kernels NVFP4 optimisés avec NVIDIA.