Intelligence artificielle

Google lance EmbeddingGemma 2 pour la recherche multimodale sur les appareils

Google a annoncé EmbeddingGemma 2, un modèle ouvert doté de capacités d’intégration multimodale pour le texte, les images, l’audio et la vidéo dans un espace unifié, conçu pour fonctionner localement sur les appareils. Le modèle comprend 740 millions de paramètres et prend en charge un contexte allant jusqu’à 8 000 tokens, avec des possibilités de réduction de la consommation de stockage et de mémoire.

2026-10-06
5 min de lecture
5 vues
certi.news Editorial Team
Google lance EmbeddingGemma 2 pour la recherche multimodale sur les appareils

Google a lancé le modèle EmbeddingGemma 2, un modèle d’intégration multimodale qui relie le texte, les images, l’audio et la vidéo, ainsi que le code, au sein d’un espace de représentation unifié. Le modèle cible les développeurs qui souhaitent créer localement sur les appareils des solutions de recherche sémantique, de récupération d’informations et des applications RAG, sans envoyer les données vers des serveurs externes.

Le modèle compte 740 millions de paramètres et est publié sous licence Apache 2.0, autorisée à des fins commerciales. Google affirme qu’il repose sur l’architecture Gemma 4 et qu’il peut, par exemple, trouver un extrait vidéo précis à partir d’une note vocale, ou effectuer des recherches dans de longs enregistrements audio au moyen d’une requête textuelle, en utilisant un modèle multimodal unique.

Que propose concrètement le modèle ?

Le principal intérêt d’EmbeddingGemma 2 réside dans le regroupement de différents types de données au sein d’une représentation commune, ce qui permet d’effectuer des opérations de recherche et de récupération intermodales. Il peut être utilisé pour rechercher dans une bibliothèque multimédia à partir d’un texte ou d’une image, identifier des moments précis dans une vidéo au moyen d’une requête textuelle ou vocale, ou prendre en charge la récupération locale de fichiers avant de transmettre les résultats à un modèle génératif tel que Gemma 4 afin de fournir le contexte et le raisonnement.

  • Il dispose d’une fenêtre de contexte de 8 000 tokens, soit quatre fois celle du précédent EmbeddingGemma, avec la prise en charge de 5,5 minutes d’audio, de 29 images ou de 58 images vidéo.
  • Les vecteurs de sortie peuvent être réduits de 768 dimensions à 512, 256 ou 128 dimensions à l’aide de la technique Matryoshka Representation Learning, ce qui pourrait réduire jusqu’à six fois l’espace de stockage et la consommation mémoire dans les bases de données vectorielles.
  • Il propose une configuration plus légère pour les tâches exclusivement textuelles, avec des encodeurs facultatifs pour la vision et l’audio afin de prendre en charge l’utilisation multimodale.
  • Après quantification, Google affirme que la consommation de mémoire active s’élève à environ 191 mégaoctets pour les seuls poids textuels et à environ 567 mégaoctets pour le modèle multimodal complet sur un Google Pixel 11 Pro.

Amélioration pour le code et fonctionnement local

Selon Google, EmbeddingGemma 2 a obtenu une amélioration de 9,92 points au test MTEB Code, passant de 68,76 à 78,68, ce qui le rend adapté à l’indexation des bases de code, à la recherche sémantique dans celles-ci et à la prise en charge de la récupération pour les agents de programmation. L’entreprise affirme également qu’il obtient de solides résultats au regard de sa taille dans les tâches liées au texte, à la vision et à l’audio, et qu’il surpasse dans certaines comparaisons des modèles spécialisés plus de deux fois plus grands.

Le fonctionnement local nécessite relativement peu de ressources et peut contribuer à réduire la latence, à préserver la confidentialité des données et à permettre le travail hors ligne. En outre, le partage avec Gemma 4 du tokenizer de texte et de l’encodeur audio peut réduire la mémoire totale requise lors de la création d’un pipeline local combinant récupération et raisonnement.

Outils de disponibilité et limites

Google a mis les poids du modèle à disposition via Hugging Face et Kaggle, avec une disponibilité ultérieure attendue via Model Garden dans Gemini Enterprise Agent Platform. Il peut être déployé à l’aide de Google AI Edge MediaPipe ou de LiteRT et prend également en charge des environnements et outils tels que transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio, ainsi que transformers.js et WebGPU pour le navigateur.

Cela signifie qu’EmbeddingGemma 2 ne se limite pas à une expérience de recherche prête à l’emploi, mais fournit un composant pouvant être intégré à diverses applications locales. Toutefois, les chiffres de performance et de mémoire présentés ici sont fournis par Google, tandis que l’adéquation réelle du modèle dépendra du type de données, de la précision de récupération requise, des contraintes matérielles et des résultats de tests indépendants. L’annonce n’a pas non plus précisé les conditions détaillées pour chaque cas d’utilisation ni le calendrier de disponibilité du modèle dans Model Garden.

Source de l’actualité
Google Official News
Ouvrir la source originale ↗
c
Auteur

certi.news Editorial Team

Dans la même catégorie

À lire également

Voir toutes les actualités