Inteligência artificial

Google lança o EmbeddingGemma 2 para pesquisa multimodal em dispositivos

A Google anunciou o EmbeddingGemma 2, um modelo aberto com capacidades de incorporação multimodal para textos, imagens, áudio e vídeo em um espaço unificado, projetado para funcionar localmente em dispositivos. O modelo tem 740 milhões de parâmetros e oferece suporte a um contexto de até 8 mil tokens, com recursos para reduzir o consumo de armazenamento e memória.

2026-10-06
4 min de leitura
5 visualizações
certi.news Editorial Team
Google lança o EmbeddingGemma 2 para pesquisa multimodal em dispositivos

A Google lançou o modelo EmbeddingGemma 2, um modelo de incorporação multimodal que conecta textos, imagens, áudio e vídeo, além de código, em um espaço de representação unificado. O modelo é voltado a desenvolvedores que desejam criar pesquisa semântica, recuperação e aplicações de RAG localmente em dispositivos, sem enviar os dados para servidores externos.

O modelo tem 740 milhões de parâmetros e é lançado sob a licença Apache 2.0, permitida para uso comercial. A Google afirma que ele é baseado na arquitetura Gemma 4 e pode, por exemplo, encontrar um trecho específico de vídeo usando uma anotação de voz ou pesquisar gravações de áudio longas por meio de uma consulta textual, usando um único modelo multimodal.

O que o modelo oferece na prática?

O principal destaque do EmbeddingGemma 2 é reunir diferentes tipos de dados em uma representação compartilhada, permitindo realizar operações de pesquisa e recuperação entre modalidades. Ele pode ser usado para pesquisar em uma biblioteca de mídia por texto ou imagem, identificar momentos específicos em um vídeo por meio de uma consulta textual ou de áudio, ou oferecer suporte à recuperação local de arquivos antes de passar os resultados a um modelo generativo, como o Gemma 4, para fornecer contexto e raciocínio.

  • Ele tem uma janela de contexto de 8 mil tokens, quatro vezes maior que a do EmbeddingGemma anterior, com suporte a até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo.
  • Os vetores de saída podem ser reduzidos de 768 dimensões para 512, 256 ou 128 dimensões usando a técnica Matryoshka Representation Learning, o que pode diminuir em até seis vezes o espaço de armazenamento e o consumo de memória em bancos de dados vetoriais.
  • Oferece uma configuração mais leve para tarefas exclusivamente textuais, com codificadores opcionais de visão e áudio para oferecer suporte ao uso multimodal.
  • Após a quantização, a Google afirma que o consumo de memória ativa é de aproximadamente 191 megabytes para os pesos exclusivamente textuais e de aproximadamente 567 megabytes para o modelo multimodal completo em um telefone Google Pixel 11 Pro.

Melhorias no código e execução local

Segundo a Google, o EmbeddingGemma 2 obteve uma melhoria de 9,92 pontos no teste MTEB Code, passando de 68,76 para 78,68, o que o torna adequado para indexar bases de código, realizar pesquisas semânticas nelas e oferecer suporte à recuperação por agentes de programação. A empresa também afirma que ele alcança resultados fortes em relação ao seu tamanho nas tarefas de texto, visão e áudio, superando, em algumas comparações, modelos especializados mais de duas vezes maiores.

A execução local exige recursos relativamente limitados e pode ajudar a reduzir a latência, preservar a privacidade dos dados e permitir o trabalho offline. Além disso, o compartilhamento do modelo com o Gemma 4 na ferramenta de codificação de texto e no codificador de áudio pode reduzir a memória total necessária ao criar um pipeline local que combine recuperação e inferência.

Ferramentas de disponibilidade e limitações

A Google disponibilizou os pesos do modelo no Hugging Face e no Kaggle, com disponibilidade posterior prevista por meio do Model Garden na Gemini Enterprise Agent Platform. Ele pode ser implantado usando o Google AI Edge MediaPipe ou o LiteRT e também oferece suporte a ambientes e ferramentas como transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama e LMStudio, além de transformers.js e WebGPU para o navegador.

Isso significa que o EmbeddingGemma 2 não se limita a uma experiência de pesquisa pronta, mas oferece um componente que pode ser integrado a diversas aplicações locais. No entanto, os números de desempenho e memória apresentados aqui foram fornecidos pela Google, enquanto a adequação efetiva do modelo continuará dependendo do tipo de dados, da precisão de recuperação necessária, das limitações do hardware e dos resultados de testes independentes. O anúncio também não especificou condições detalhadas para cada caso de uso nem um cronograma de disponibilidade do modelo no Model Garden.

Fonte da notícia
Google Official News
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias