Google이 텍스트, 이미지, 오디오, 동영상과 코드를 통합 표현 공간에 연결하는 멀티모달 임베딩 모델 EmbeddingGemma 2를 출시했다. 이 모델은 데이터를 외부 서버로 전송하지 않고 기기에서 로컬로 시맨틱 검색, 검색 및 RAG 애플리케이션을 구축하려는 개발자를 대상으로 한다.
이 모델은 7억 4,000만 개의 파라미터로 구성되며 상업적으로 허용되는 Apache 2.0 라이선스로 출시된다. Google에 따르면 Gemma 4 아키텍처를 기반으로 하며, 하나의 멀티모달 모델을 사용해 음성 메모로 특정 동영상 클립을 찾거나 텍스트 질의로 긴 오디오 녹음을 검색할 수 있다.
이 모델이 실제로 제공하는 기능은?
EmbeddingGemma 2의 가장 중요한 특징은 서로 다른 유형의 데이터를 공통 표현으로 통합해 모달리티를 넘나드는 검색 및 검색 작업을 가능하게 한다는 점이다. 텍스트나 이미지로 미디어 라이브러리를 검색하고, 텍스트 또는 음성 질의를 통해 동영상의 특정 순간을 찾거나, 결과를 Gemma 4와 같은 생성 모델에 전달하기 전에 파일을 로컬에서 검색해 컨텍스트와 추론을 제공하는 데 사용할 수 있다.
- 8,000토큰의 컨텍스트 윈도우를 제공한다. 이는 이전 EmbeddingGemma의 4배이며, 최대 5.5분의 오디오, 29개의 이미지 또는 58개의 동영상 프레임을 지원한다.
- Matryoshka Representation Learning 기술을 사용해 출력 벡터를 768차원에서 512, 256 또는 128차원으로 축소할 수 있으며, 이를 통해 벡터 데이터베이스의 저장 공간과 메모리 사용량을 최대 6배까지 줄일 수 있다.
- 텍스트 전용 작업을 위한 더 가벼운 구성을 제공하며, 멀티모달 사용을 지원하기 위해 비전 및 오디오 인코더를 선택적으로 사용할 수 있다.
- Google에 따르면 양자화 후 활성 메모리 사용량은 Google Pixel 11 Pro에서 텍스트 전용 가중치의 경우 약 191MB, 전체 멀티모달 모델의 경우 약 567MB다.
코드 및 로컬 실행 성능 향상
Google에 따르면 EmbeddingGemma 2는 MTEB Code 테스트에서 9.92포인트 향상되어 68.76에서 78.68로 상승했으며, 코드베이스 색인과 코드베이스의 시맨틱 검색, 코딩 에이전트 검색 지원에 적합하다. 또한 회사는 이 모델이 텍스트, 비전 및 오디오 작업에서 크기에 비해 강력한 결과를 내며, 일부 비교에서 두 배 이상 큰 전문 모델보다 뛰어난 성능을 보인다고 밝혔다.
로컬 실행에는 비교적 제한적인 리소스만 필요하며, 응답 시간을 줄이고 데이터 개인정보를 보호하며 오프라인 작업을 가능하게 하는 데 도움이 될 수 있다. 또한 텍스트 토크나이저와 오디오 인코더를 Gemma 4와 공유하므로 검색과 추론을 결합한 로컬 파이프라인을 구축할 때 필요한 총 메모리를 줄일 수 있다.
지원 도구와 제한 사항
Google은 Hugging Face와 Kaggle을 통해 모델 가중치를 제공했으며, Gemini Enterprise Agent Platform의 Model Garden을 통한 후속 제공도 예상된다. Google AI Edge MediaPipe 또는 LiteRT를 사용해 배포할 수 있으며, transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio와 같은 환경 및 도구를 지원한다. 또한 브라우저용 transformers.js와 WebGPU도 지원한다.
이는 EmbeddingGemma 2가 즉시 사용할 수 있는 검색 기능에만 국한되지 않고 다양한 로컬 애플리케이션에 통합할 수 있는 구성 요소를 제공한다는 의미다. 그러나 여기에 제시된 성능 및 메모리 수치는 Google이 제공한 것이며, 실제 모델의 적합성은 데이터 유형, 필요한 검색 정확도, 하드웨어 제약, 독립 테스트 결과에 따라 달라질 수 있다. 또한 발표에서는 모든 사용 사례에 대한 세부 조건이나 Model Garden에서의 모델 제공 일정이 명시되지 않았다.