Google hat das Modell EmbeddingGemma 2 auf den Markt gebracht. Dabei handelt es sich um ein multimodales Einbettungsmodell, das Texte, Bilder, Audio und Video sowie Code in einem einheitlichen Repräsentationsraum miteinander verbindet. Das Modell richtet sich an Entwickler, die semantische Suche, Retrieval und RAG-Anwendungen lokal auf Geräten erstellen möchten, ohne Daten an externe Server zu senden.
Das Modell verfügt über 740 Millionen Parameter und wird unter einer kommerziell zulässigen Apache-2.0-Lizenz veröffentlicht. Google zufolge basiert es auf der Gemma-4-Architektur und kann beispielsweise mithilfe einer Sprachnotiz einen bestimmten Videoclip finden oder lange Audioaufnahmen über eine Textabfrage durchsuchen – mit einem einzigen multimodalen Modell.
Was bietet das Modell in der Praxis?
Der wichtigste Punkt bei EmbeddingGemma 2 ist die Zusammenführung verschiedener Datentypen in einer gemeinsamen Repräsentation, wodurch medienübergreifende Such- und Retrieval-Vorgänge möglich werden. Es kann verwendet werden, um eine Mediathek per Text oder Bild zu durchsuchen, bestimmte Momente in Videos über eine Text- oder Audioabfrage zu finden oder das lokale Retrieval von Dateien zu unterstützen, bevor die Ergebnisse an ein generatives Modell wie Gemma 4 weitergeleitet werden, um Kontext und Schlussfolgerungen bereitzustellen.
- Das Modell verfügt über ein Kontextfenster von 8.000 Tokens, also dem Vierfachen des vorherigen EmbeddingGemma, und unterstützt bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes.
- Die Ausgabeverktoren können mithilfe der Technik Matryoshka Representation Learning von 768 Dimensionen auf 512, 256 oder 128 Dimensionen reduziert werden. Dadurch lassen sich der Speicherplatz und der Arbeitsspeicherbedarf in Vektordatenbanken möglicherweise um bis zu das Sechsfache senken.
- Es bietet eine leichtere Konfiguration für reine Textaufgaben sowie optionale Vision- und Audio-Encoder zur Unterstützung multimodaler Nutzung.
- Nach der Quantisierung beträgt der aktive Arbeitsspeicher laut Google etwa 191 Megabyte für die reine Textgewichtung und etwa 567 Megabyte für das vollständige multimodale Modell auf einem Google Pixel 11 Pro.
Verbesserungen bei Code und lokalem Betrieb
Google zufolge erzielte EmbeddingGemma 2 im MTEB-Code-Test eine Verbesserung um 9,92 Punkte und stieg von 68,76 auf 78,68. Dadurch eignet es sich für die Indizierung von Codebasen, die semantische Suche darin und die Unterstützung des Retrievals für Programmieragenten. Das Unternehmen erklärt außerdem, dass das Modell gemessen an seiner Größe starke Ergebnisse bei Text-, Vision- und Audioaufgaben erzielt und in einigen Vergleichen mehr als doppelt so große spezialisierte Modelle übertrifft.
Der lokale Betrieb erfordert vergleichsweise begrenzte Ressourcen und kann dazu beitragen, die Latenz zu verringern, den Datenschutz zu wahren und die Arbeit ohne Verbindung zu ermöglichen. Da das Modell außerdem das Text-Tokenisierungswerkzeug und den Audio-Encoder mit Gemma 4 gemeinsam nutzt, kann sich der insgesamt erforderliche Speicherbedarf beim Aufbau einer lokalen Pipeline für Retrieval und Inferenz verringern.
Verfügbare Tools und Einschränkungen
Google hat die Modellgewichte über Hugging Face und Kaggle bereitgestellt; eine spätere Verfügbarkeit über Model Garden in der Gemini Enterprise Agent Platform wird erwartet. Das Modell kann mit Google AI Edge MediaPipe oder LiteRT bereitgestellt werden. Außerdem unterstützt es Umgebungen und Tools wie transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama und LMStudio sowie transformers.js und WebGPU für den Browser.
Das bedeutet, dass EmbeddingGemma 2 nicht auf eine fertige Sucherfahrung beschränkt ist, sondern eine Komponente bereitstellt, die in verschiedene lokale Anwendungen integriert werden kann. Die hier genannten Leistungs- und Speicherangaben stammen jedoch von Google. Wie gut das Modell tatsächlich geeignet ist, hängt weiterhin von der Art der Daten, der erforderlichen Retrieval-Genauigkeit, den Hardwarebeschränkungen und den Ergebnissen unabhängiger Tests ab. Die Ankündigung legte außerdem keine detaillierten Bedingungen für alle Anwendungsfälle oder einen Zeitplan für die Verfügbarkeit des Modells in Model Garden fest.