Ce qui se passe
Google DeepMind publie EmbeddingGemma 2, successeur du modèle d'embeddings texte EmbeddingGemma, téléchargé plus de 20 millions de fois selon Google. Cette version place texte, code, images, audio et vidéo dans un seul espace vectoriel. Licence Apache 2.0, 740 millions de paramètres : une taille pensée pour tourner sur l'appareil.
Les chiffres utiles
- Modulaire : 270 M de paramètres suffisent pour le texte seul ; l'encodeur vision (170 M) et l'encodeur audio (300 M) s'ajoutent au besoin.
- Dimensions : 768 par défaut, tronquables à 512, 256 ou 128 grâce au Matryoshka Representation Learning, soit jusqu'à six fois moins de place dans une base vectorielle.
- Contexte : 8K jetons, quatre fois la première version — jusqu'à 5,5 minutes d'audio, 29 images ou 58 images de vidéo, combinables.
- Mémoire : une fois quantifié, environ 191 Mo de RAM active pour le texte seul et 567 Mo en multimodal, mesurés par Google sur un Pixel 11 Pro.
- Code : 78,68 sur MTEB Code, contre 68,76 pour la première version.
Ces résultats sont ceux de Google ; le détail figure dans la fiche du modèle.
Pourquoi ça compte
Retrouver un extrait audio à partir d'une phrase, ou une image à partir d'une description, demandait jusqu'ici un modèle par modalité ou une API distante. Un seul petit modèle ouvert ramène cette recherche croisée sur une machine ordinaire, sans que les données en sortent. Construit sur l'architecture Gemma 4, dont il partage le tokenizer texte et l'encodeur audio, il s'associe aussi à Gemma 4 dans une chaîne RAG locale à l'empreinte mémoire réduite.
La licence pèse lourd pour ce type de modèle. Un index rassemble souvent des millions de vecteurs ; si le modèle qui les a produits disparaît d'une API, tout est à recalculer. Simon Willison l'a relevé à la sortie : pour des embeddings, un modèle fermé et seulement hébergé a peu de sens.
Comment s'y prendre
Les poids sont sur Hugging Face et Kaggle. Le modèle est pris en charge dès la sortie par transformers, sentence-transformers, vLLM, llama.cpp (GGUF), SGLang, MLX, LM Studio, transformers.js et Ollama ; Unsloth documente le fine-tuning.
Sur Mac, Ollama 0.40, publié le même jour, fait tourner par défaut sur MLX les
architectures que ce moteur sait exécuter, embeddinggemma-2 compris :
ollama pull embeddinggemma-2Avant de migrer un index existant : des vecteurs issus de deux modèles différents ne se comparent pas. Mieux vaut évaluer sur un échantillon du corpus, avec de vraies requêtes, puis réindexer en entier.
Source : EmbeddingGemma 2: An open, lightweight multimodal embedding model, blog Google, 6 octobre 2026. Voir aussi la release Ollama v0.40.0.