veilletech.fr
7 oct. Feed du jour
#06 IA Article

EmbeddingGemma 2 : texte, image et audio, en local

Une phrase pour retrouver un son. Sur votre machine, sans API.

Google DeepMind publie EmbeddingGemma 2, un modèle d'embeddings de 740 millions de paramètres sous Apache 2.0 qui place texte, code, images, audio et vidéo dans un même espace vectoriel. Conçu pour tourner en local, il produit des vecteurs tronquables de 768 à 128 dimensions et accepte 8K jetons de contexte. Ollama 0.40, sorti le même jour, l'exécute sur MLX par défaut sur Apple Silicon.

2 min de lectureintermédiairevidéo 1:17
Partager
Sommaire5 sections
  1. Ce qui se passe
  2. Les chiffres utiles
  3. Pourquoi ça compte
  4. Comment s'y prendre
  5. À retenir

Ce qui se passe

Google DeepMind publie EmbeddingGemma 2, successeur du modèle d'embeddings texte EmbeddingGemma, téléchargé plus de 20 millions de fois selon Google. Cette version place texte, code, images, audio et vidéo dans un seul espace vectoriel. Licence Apache 2.0, 740 millions de paramètres : une taille pensée pour tourner sur l'appareil.

Les chiffres utiles

Ces résultats sont ceux de Google ; le détail figure dans la fiche du modèle.

Pourquoi ça compte

Retrouver un extrait audio à partir d'une phrase, ou une image à partir d'une description, demandait jusqu'ici un modèle par modalité ou une API distante. Un seul petit modèle ouvert ramène cette recherche croisée sur une machine ordinaire, sans que les données en sortent. Construit sur l'architecture Gemma 4, dont il partage le tokenizer texte et l'encodeur audio, il s'associe aussi à Gemma 4 dans une chaîne RAG locale à l'empreinte mémoire réduite.

La licence pèse lourd pour ce type de modèle. Un index rassemble souvent des millions de vecteurs ; si le modèle qui les a produits disparaît d'une API, tout est à recalculer. Simon Willison l'a relevé à la sortie : pour des embeddings, un modèle fermé et seulement hébergé a peu de sens.

Comment s'y prendre

Les poids sont sur Hugging Face et Kaggle. Le modèle est pris en charge dès la sortie par transformers, sentence-transformers, vLLM, llama.cpp (GGUF), SGLang, MLX, LM Studio, transformers.js et Ollama ; Unsloth documente le fine-tuning.

Sur Mac, Ollama 0.40, publié le même jour, fait tourner par défaut sur MLX les architectures que ce moteur sait exécuter, embeddinggemma-2 compris :

Terminal
ollama pull embeddinggemma-2

Avant de migrer un index existant : des vecteurs issus de deux modèles différents ne se comparent pas. Mieux vaut évaluer sur un échantillon du corpus, avec de vraies requêtes, puis réindexer en entier.

Source : EmbeddingGemma 2: An open, lightweight multimodal embedding model, blog Google, 6 octobre 2026. Voir aussi la release Ollama v0.40.0.