Texte, son, vidéo : un même espace de recherche avec EmbeddingGemma 2
La recherche locale croise texte, images, audio et vidéo avec EmbeddingGemma 2, un modèle de Google à 740 millions de paramètres sous licence Apache 2.0.
Texte, code, images, sons et vidéos peuvent désormais être rapprochés dans un même espace de recherche avec EmbeddingGemma 2. Ce modèle de Google DeepMind transforme les contenus en représentations numériques, appelées embeddings, dont la proximité traduit une similarité de sens. Une requête écrite peut ainsi retrouver un passage audio, ou une note vocale servir à chercher une séquence vidéo. Le traitement peut s’effectuer directement sur l’appareil, hors ligne. Les poids sont téléchargeables sur Hugging Face, sous licence Apache 2.0, qui autorise les usages commerciaux.
L’architecture distingue les composants selon les besoins. Sur les 740 millions de paramètres du modèle complet, 270 millions suffisent pour le texte et le code ; la vision en ajoute 170 millions, l’audio 300 millions. Les modules inutilisés peuvent rester déchargés. Après quantification, les mesures publiées sur un Google Pixel 11 Pro descendent à environ 191 Mo de mémoire active pour les poids de la version texte et 567 Mo pour le modèle multimodal complet. Ces chiffres décrivent une configuration optimisée sur un matériel précis, sans représenter la consommation totale d’une application de recherche et de sa base documentaire.
Le stockage des représentations offre un autre réglage : les vecteurs de 768 dimensions peuvent être raccourcis jusqu’à 128, divisant leur taille par six. Le compromis touche la qualité des résultats : la fiche technique réserve plutôt ce réglage minimal aux usages textuels et signale une dégradation plus marquée en multimodal. La fenêtre de 8 192 tokens accueille, avec les réglages par défaut, environ 5,5 minutes d’audio, 29 images ou 58 images extraites d’une vidéo. Ces capacités partagent le même budget : mêler plusieurs formats réduit la quantité disponible pour chacun.
Les évaluations publiées par Google montrent surtout une progression sur le code : le score MTEB Code passe de 68,76 à 78,68, soit 9,92 points supplémentaires par rapport à la première version. Ces résultats concernent le modèle en pleine précision. Pour explorer les usages, les démonstrations Google AI Edge proposent une recherche dans les médias locaux et le repérage de moments précis dans des vidéos. Associé à un modèle génératif comme Gemma 4, le système peut aussi retrouver des fichiers locaux puis fournir les passages pertinents à une réponse construite à partir de ces documents.