Gemma 4 12B, le multimodal sans encodeurs qui tient sur un laptop

Google lance Gemma 4 12B, un modèle multimodal sans encodeurs qui traite l'audio et les images en local sur PC avec seulement 16 Go de mémoire unifiée.

Pas d'encodeur visuel, pas d'encodeur audio : Gemma 4 12B fait entrer images et sons directement dans le backbone du modèle. Google DeepMind comble ainsi l'écart entre le E4B pensé pour l'edge et le 26B en Mixture of Experts, avec un modèle de taille intermédiaire qui est aussi le premier de la gamme à accepter nativement l'audio.

Là où les modèles multimodaux classiques s'appuient sur des encodeurs séparés, sources de latence et de consommation mémoire, la vision passe ici par un simple module d'embedding (une multiplication matricielle, des embeddings positionnels et des normalisations) et le signal audio brut est projeté directement dans l'espace des tokens texte. Le résultat approche les performances du 26B sur les benchmarks standards pour moins de la moitié de l'empreinte mémoire et tourne en local avec 16 Go de VRAM ou de mémoire unifiée, des drafters en Multi-Token Prediction réduisant encore la latence.

La démonstration officielle le montre transcrire, mettre en forme et traduire la voix entièrement hors ligne. Publié sous licence Apache 2.0, le modèle se télécharge sur Hugging Face et Kaggle, s'exécute via LM Studio, Ollama, llama.cpp, MLX ou vLLM, se fine-tune avec Unsloth et s'accompagne d'un Skills Repository officiel destiné aux agents, la famille Gemma 4 venant par ailleurs de franchir les 150 millions de téléchargements.