Inteligencia artificial

Google lanza EmbeddingGemma 2 para la búsqueda multimodal en dispositivos

Google ha anunciado EmbeddingGemma 2, un modelo abierto con capacidades de embeddings multimodales para texto, imágenes, audio y vídeo dentro de un espacio unificado, diseñado para funcionar localmente en dispositivos. El modelo cuenta con 740 millones de parámetros y admite un contexto de hasta 8.000 tokens, con capacidades para reducir el consumo de almacenamiento y memoria.

2026-10-06
4 min de lectura
5 visitas
certi.news Editorial Team
Google lanza EmbeddingGemma 2 para la búsqueda multimodal en dispositivos

Google ha lanzado el modelo EmbeddingGemma 2, un modelo de embeddings multimodales que conecta texto, imágenes, audio y vídeo, además de código, dentro de un espacio de representación unificado. El modelo está dirigido a desarrolladores que quieren crear aplicaciones de búsqueda semántica, recuperación y RAG localmente en dispositivos, sin enviar los datos a servidores externos.

El modelo cuenta con 740 millones de parámetros y se publica bajo una licencia Apache 2.0 con permiso para uso comercial. Google afirma que está basado en la arquitectura Gemma 4 y que, por ejemplo, puede encontrar un fragmento de vídeo específico mediante una nota de voz, o buscar en grabaciones de audio largas usando una consulta de texto, todo ello con un único modelo multimodal.

¿Qué ofrece el modelo en la práctica?

El aspecto más destacado de EmbeddingGemma 2 es la combinación de distintos tipos de datos en una representación común, lo que permite realizar operaciones de búsqueda y recuperación entre modalidades. Puede utilizarse para buscar dentro de una biblioteca multimedia mediante texto o imagen, identificar momentos concretos de un vídeo mediante una consulta textual o de voz, o permitir la recuperación local de archivos antes de pasar los resultados a un modelo generativo como Gemma 4 para proporcionar contexto y razonamiento.

  • Cuenta con una ventana de contexto de 8.000 tokens, cuatro veces más que el EmbeddingGemma anterior, con compatibilidad para hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo.
  • Los vectores de salida pueden reducirse de 768 dimensiones a 512, 256 o 128 dimensiones mediante la técnica Matryoshka Representation Learning, lo que podría reducir hasta seis veces el espacio de almacenamiento y el consumo de memoria en bases de datos vectoriales.
  • Ofrece una configuración más ligera para tareas exclusivamente textuales, con codificadores opcionales de visión y audio para admitir el uso multimodal.
  • Tras la cuantización, Google afirma que el consumo de memoria activa es de aproximadamente 191 megabytes para los pesos exclusivamente textuales y de unos 567 megabytes para el modelo multimodal completo en un teléfono Google Pixel 11 Pro.

Mejoras en el código y ejecución local

Según Google, EmbeddingGemma 2 logró una mejora de 9,92 puntos en la prueba MTEB Code, al pasar de 68,76 a 78,68, lo que lo hace adecuado para indexar repositorios de código, realizar búsquedas semánticas en ellos y respaldar la recuperación para agentes de programación. La empresa también afirma que obtiene resultados sólidos en relación con su tamaño en tareas de texto, visión y audio, y que supera en algunas comparaciones a modelos especializados más de dos veces mayores.

La ejecución local requiere recursos relativamente limitados y puede ayudar a reducir la latencia, preservar la privacidad de los datos y permitir el trabajo sin conexión. Además, compartir con Gemma 4 el tokenizador de texto y el codificador de audio podría reducir la memoria total necesaria al crear una canalización local que combine recuperación y razonamiento.

Herramientas de disponibilidad y limitaciones

Google ha puesto los pesos del modelo a disposición a través de Hugging Face y Kaggle, y se espera una disponibilidad posterior mediante Model Garden en Gemini Enterprise Agent Platform. Puede desplegarse con Google AI Edge MediaPipe o LiteRT, y también es compatible con entornos y herramientas como transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama y LMStudio, además de transformers.js y WebGPU para el navegador.

Esto significa que EmbeddingGemma 2 no se limita a ofrecer una experiencia de búsqueda lista para usar, sino que proporciona un componente que puede integrarse en diversas aplicaciones locales. Sin embargo, las cifras de rendimiento y memoria mencionadas aquí han sido proporcionadas por Google, mientras que la idoneidad real del modelo seguirá dependiendo del tipo de datos, la precisión de recuperación requerida, las limitaciones del hardware y los resultados de pruebas independientes. El anuncio tampoco especificó las condiciones detalladas para cada caso de uso ni el calendario de disponibilidad del modelo en Model Garden.

Fuente de la noticia
Google Official News
Abrir fuente original ↗
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias