Google запустила модель EmbeddingGemma 2 — мультимодальную модель встраивания, которая объединяет тексты, изображения, аудио и видео, а также код в едином пространстве представлений. Модель предназначена для разработчиков, желающих создавать семантический поиск, системы извлечения и приложения RAG локально на устройствах, не отправляя данные на внешние серверы.
Модель содержит 740 миллионов параметров и выпускается по разрешительной лицензии Apache 2.0, допускающей коммерческое использование. Google утверждает, что она построена на архитектуре Gemma 4 и, например, может находить конкретный фрагмент видео по голосовой заметке или выполнять поиск в длинных аудиозаписях по текстовому запросу с использованием одной мультимодальной модели.
Что модель предлагает на практике?
Ключевая особенность EmbeddingGemma 2 заключается в объединении разных типов данных в общем представлении, что позволяет выполнять кросс-модальный поиск и извлечение. Модель можно использовать для поиска по медиатеке с помощью текста или изображения, определения конкретных моментов в видео по текстовому или голосовому запросу, а также для локального извлечения файлов перед передачей результатов генеративной модели, такой как Gemma 4, для обеспечения контекста и рассуждений.
- Модель имеет контекстное окно объёмом 8 тысяч токенов — в четыре раза больше, чем у предыдущей EmbeddingGemma, — с поддержкой до 5,5 минуты аудио, 29 изображений или 58 кадров видео.
- Выходные векторы размерностью 768 можно сократить до 512, 256 или 128 измерений с помощью технологии Matryoshka Representation Learning, что может уменьшить объём хранилища и потребление памяти в векторных базах данных до шести раз.
- Предусмотрена облегчённая конфигурация только для текстовых задач с опциональными кодировщиками изображений и аудио для поддержки мультимодального использования.
- После квантования Google заявляет, что активное потребление памяти составляет около 191 мегабайта для весов только текстовой модели и около 567 мегабайт для полной мультимодальной модели на смартфоне Google Pixel 11 Pro.
Улучшения в работе с кодом и локальный запуск
По данным Google, EmbeddingGemma 2 продемонстрировала улучшение на 9,92 пункта в тесте MTEB Code: результат вырос с 68,76 до 78,68. Это делает модель подходящей для индексации и семантического поиска по кодовым базам, а также для поддержки извлечения данных агентами программирования. Компания также утверждает, что модель показывает высокие результаты для своего размера в текстовых, визуальных и аудиозадачах и в некоторых сравнениях превосходит более чем вдвое большие специализированные модели.
Для локального запуска требуются относительно ограниченные ресурсы, что может помочь сократить задержку, сохранить конфиденциальность данных и обеспечить работу без подключения к сети. Кроме того, совместное использование модели с Gemma 4 в инструменте токенизации текста и аудиокодировщике может снизить общий объём памяти, необходимый для создания локального конвейера, объединяющего извлечение и рассуждение.
Средства доступности и ограничения
Google предоставила веса модели через Hugging Face и Kaggle; позднее ожидается её появление в Model Garden на платформе Gemini Enterprise Agent Platform. Модель можно развёртывать с помощью Google AI Edge MediaPipe или LiteRT. Она также поддерживает такие среды и инструменты, как transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, а также transformers.js и WebGPU для браузера.
Это означает, что EmbeddingGemma 2 не ограничивается готовым поисковым экспериментом, а предоставляет компонент, который можно интегрировать в различные локальные приложения. Однако приведённые здесь показатели производительности и памяти предоставлены Google, тогда как фактическая пригодность модели будет зависеть от типа данных, требуемой точности извлечения, ограничений оборудования и результатов независимых тестов. В объявлении также не указаны подробные условия для каждого варианта использования или график доступности модели в Model Garden.