Искусственный интеллект

Google запускает EmbeddingGemma 2 для мультимодального поиска на устройствах

Google объявила о выпуске EmbeddingGemma 2 — открытой модели с возможностями мультимодального встраивания текста, изображений, аудио и видео в единое пространство, предназначенной для локальной работы на устройствах. Модель содержит 740 миллионов параметров и поддерживает контекст объёмом до 8 тысяч токенов, а также возможности снижения потребления хранилища и памяти.

2026-10-06
3 мин. чтения
5 просмотров
certi.news Editorial Team
Google запускает EmbeddingGemma 2 для мультимодального поиска на устройствах

Google запустила модель EmbeddingGemma 2 — мультимодальную модель встраивания, которая объединяет тексты, изображения, аудио и видео, а также код в едином пространстве представлений. Модель предназначена для разработчиков, желающих создавать семантический поиск, системы извлечения и приложения RAG локально на устройствах, не отправляя данные на внешние серверы.

Модель содержит 740 миллионов параметров и выпускается по разрешительной лицензии Apache 2.0, допускающей коммерческое использование. Google утверждает, что она построена на архитектуре Gemma 4 и, например, может находить конкретный фрагмент видео по голосовой заметке или выполнять поиск в длинных аудиозаписях по текстовому запросу с использованием одной мультимодальной модели.

Что модель предлагает на практике?

Ключевая особенность EmbeddingGemma 2 заключается в объединении разных типов данных в общем представлении, что позволяет выполнять кросс-модальный поиск и извлечение. Модель можно использовать для поиска по медиатеке с помощью текста или изображения, определения конкретных моментов в видео по текстовому или голосовому запросу, а также для локального извлечения файлов перед передачей результатов генеративной модели, такой как Gemma 4, для обеспечения контекста и рассуждений.

  • Модель имеет контекстное окно объёмом 8 тысяч токенов — в четыре раза больше, чем у предыдущей EmbeddingGemma, — с поддержкой до 5,5 минуты аудио, 29 изображений или 58 кадров видео.
  • Выходные векторы размерностью 768 можно сократить до 512, 256 или 128 измерений с помощью технологии Matryoshka Representation Learning, что может уменьшить объём хранилища и потребление памяти в векторных базах данных до шести раз.
  • Предусмотрена облегчённая конфигурация только для текстовых задач с опциональными кодировщиками изображений и аудио для поддержки мультимодального использования.
  • После квантования Google заявляет, что активное потребление памяти составляет около 191 мегабайта для весов только текстовой модели и около 567 мегабайт для полной мультимодальной модели на смартфоне Google Pixel 11 Pro.

Улучшения в работе с кодом и локальный запуск

По данным Google, EmbeddingGemma 2 продемонстрировала улучшение на 9,92 пункта в тесте MTEB Code: результат вырос с 68,76 до 78,68. Это делает модель подходящей для индексации и семантического поиска по кодовым базам, а также для поддержки извлечения данных агентами программирования. Компания также утверждает, что модель показывает высокие результаты для своего размера в текстовых, визуальных и аудиозадачах и в некоторых сравнениях превосходит более чем вдвое большие специализированные модели.

Для локального запуска требуются относительно ограниченные ресурсы, что может помочь сократить задержку, сохранить конфиденциальность данных и обеспечить работу без подключения к сети. Кроме того, совместное использование модели с Gemma 4 в инструменте токенизации текста и аудиокодировщике может снизить общий объём памяти, необходимый для создания локального конвейера, объединяющего извлечение и рассуждение.

Средства доступности и ограничения

Google предоставила веса модели через Hugging Face и Kaggle; позднее ожидается её появление в Model Garden на платформе Gemini Enterprise Agent Platform. Модель можно развёртывать с помощью Google AI Edge MediaPipe или LiteRT. Она также поддерживает такие среды и инструменты, как transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, а также transformers.js и WebGPU для браузера.

Это означает, что EmbeddingGemma 2 не ограничивается готовым поисковым экспериментом, а предоставляет компонент, который можно интегрировать в различные локальные приложения. Однако приведённые здесь показатели производительности и памяти предоставлены Google, тогда как фактическая пригодность модели будет зависеть от типа данных, требуемой точности извлечения, ограничений оборудования и результатов независимых тестов. В объявлении также не указаны подробные условия для каждого варианта использования или график доступности модели в Model Garden.

Источник новости
c
Автор

certi.news Editorial Team

В той же категории

Вам также может понравиться

Все новости