GoogleはEmbeddingGemma 2モデルを発表した。これはテキスト、画像、音声、動画に加え、コードも統一された表現空間内で結び付けるマルチモーダル埋め込みモデルである。外部サーバーにデータを送信せず、デバイス上でセマンティック検索、検索・取得、RAGアプリケーションをローカルに構築したい開発者を対象としている。
モデルは7億4,000万パラメータを備え、商用利用が許可されたApache 2.0ライセンスで提供される。Googleによると、Gemma 4アーキテクチャを基盤としており、例えば1つのマルチモーダルモデルを使って、音声メモから特定の動画クリップを見つけたり、テキストクエリで長時間の音声録音を検索したりできる。
モデルが実際に提供するもの
EmbeddingGemma 2の最大の特徴は、異なる種類のデータを共通表現にまとめる点にある。これにより、メディアをまたいだ検索・取得が可能になる。テキストまたは画像でメディアライブラリ内を検索したり、テキストまたは音声のクエリで動画内の特定の場面を特定したり、結果をGemma 4のような生成モデルに渡してコンテキストと推論を提供する前に、ファイルをローカルで取得したりできる。
- 8,000トークンのコンテキストウィンドウを備える。これは従来のEmbeddingGemmaの4倍であり、最大5.5分の音声、29枚の画像、または58フレームの動画をサポートする。
- Matryoshka Representation Learning技術を使い、出力ベクトルを768次元から512、256、128次元へ縮小できる。これにより、ベクトルデータベースのストレージ容量とメモリ使用量を最大6分の1に削減できる可能性がある。
- テキストのみのタスク向けに、より軽量な構成を提供する。マルチモーダル利用をサポートするため、視覚および音声エンコーダーはオプションで使用できる。
- Googleによると、量子化後のアクティブメモリ使用量は、Google Pixel 11 Pro上でテキスト専用の重みに約191MB、完全なマルチモーダルモデルに約567MBとなる。
コードとローカル実行の改善
Googleによると、EmbeddingGemma 2はMTEB Codeベンチマークで9.92ポイントの改善を達成し、スコアは68.76から78.68に上昇した。これにより、コードベースのインデックス作成やセマンティック検索、コーディングエージェントによる検索・取得の支援に適したモデルとなっている。また同社は、テキスト、視覚、音声のタスクでサイズに対して高い性能を発揮し、一部の比較では2倍以上大きい専門モデルを上回るとしている。
ローカル実行に必要なリソースは比較的少なく、応答時間の短縮、データのプライバシー維持、オフラインでの動作を可能にするのに役立つ。また、テキスト用エンコーダーと音声エンコーダーをGemma 4と共有することで、検索・取得と推論を組み合わせたローカルパイプラインの構築時に必要な総メモリ量を削減できる可能性がある。
提供ツールと制限
GoogleはHugging FaceとKaggleを通じてモデルの重みを提供しており、Gemini Enterprise Agent PlatformのModel Gardenでも今後提供される見込みである。Google AI Edge MediaPipeまたはLiteRTを使ってデプロイできるほか、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioなどの環境やツールにも対応する。さらに、ブラウザー向けのtransformers.jsとWebGPUもサポートする。
これは、EmbeddingGemma 2がすぐに使える検索体験にとどまらず、さまざまなローカルアプリケーションに統合できるコンポーネントであることを意味する。ただし、ここで示した性能とメモリの数値はGoogleが提示したものであり、モデルの実際の適合性は、データの種類、求められる検索精度、ハードウェアの制約、独立したテストの結果に左右される。また、発表では、各ユースケースの詳細な条件や、Model Gardenでのモデル提供時期も明らかにされていない。