Google, metinleri, görüntüleri, sesi ve videoyu, ayrıca kodu, ortak bir temsil uzayında birleştiren çok modlu bir yerleştirme modeli olan EmbeddingGemma 2'yi kullanıma sundu. Model, verileri harici sunuculara göndermeden anlamsal arama, geri getirme ve RAG uygulamalarını cihazlarda yerel olarak geliştirmek isteyen geliştiricileri hedefliyor.
Model 740 milyon parametreyle geliyor ve ticari kullanıma izin veren Apache 2.0 lisansı kapsamında sunuluyor. Google, modelin Gemma 4 mimarisi üzerine kurulduğunu ve tek bir çok modlu model kullanarak örneğin sesli bir notla belirli bir video klibini bulabildiğini veya uzun ses kayıtlarında metin sorgusuyla arama yapabildiğini belirtiyor.
Model pratikte ne sunuyor?
EmbeddingGemma 2'nin öne çıkan noktası, farklı veri türlerini ortak bir temsil içinde bir araya getirmesi. Bu sayede ortamlar arası arama ve geri getirme işlemleri gerçekleştirilebiliyor. Model; bir medya kitaplığında metin veya görüntüyle arama yapmak, video içinde metin ya da sesli sorgu aracılığıyla belirli anları belirlemek veya sonuçları bağlam ve akıl yürütme sağlamak üzere Gemma 4 gibi üretici bir modele aktarmadan önce dosyaların yerel olarak geri getirilmesini desteklemek için kullanılabiliyor.
- 8 bin tokenlık bir bağlam penceresine sahip; bu, önceki EmbeddingGemma'nın dört katına karşılık geliyor. Model, 5,5 dakikaya kadar ses, 29 görüntü veya 58 video karesini destekliyor.
- Matryoshka Representation Learning tekniği kullanılarak çıktı vektörleri 768 boyuttan 512, 256 veya 128 boyuta düşürülebiliyor. Bu da vektör veritabanlarında depolama alanı ve bellek tüketimini altı kata kadar azaltabilir.
- Yalnızca metin görevleri için daha hafif bir yapı sunuyor; çok modlu kullanımı desteklemek üzere isteğe bağlı görüntü ve ses kodlayıcıları bulunuyor.
- Google, niceleme sonrasında etkin bellek tüketiminin yalnızca metin ağırlıkları için yaklaşık 191 megabayt, Google Pixel 11 Pro'da tam çok modlu model için ise yaklaşık 567 megabayt olduğunu belirtiyor.
Kodda ve yerel çalıştırmada iyileşme
Google'a göre EmbeddingGemma 2, MTEB Code testinde 9,92 puanlık bir iyileşme kaydetti ve 68,76'dan 78,68'e yükseldi. Bu da modeli kod tabanlarını dizinlemek, bunlarda anlamsal arama yapmak ve programlama aracıları için geri getirmeyi desteklemek açısından uygun hale getiriyor. Şirket ayrıca modelin metin, görüntü ve ses görevlerinde boyutuna göre güçlü sonuçlar verdiğini ve bazı karşılaştırmalarda iki katından daha büyük özel modelleri geride bıraktığını belirtiyor.
Yerel çalıştırma nispeten sınırlı kaynaklar gerektiriyor ve yanıt süresini azaltmaya, veri gizliliğini korumaya ve çevrim dışı çalışmayı mümkün kılmaya yardımcı olabilir. Modelin metin kodlayıcısını ve ses kodlayıcısını Gemma 4 ile paylaşması da geri getirme ve akıl yürütmeyi birleştiren yerel bir işlem hattı oluşturulurken gereken toplam belleği azaltabilir.
Kullanılabilirlik araçları ve kısıtlamalar
Google, model ağırlıklarını Hugging Face ve Kaggle üzerinden kullanıma sundu; Gemini Enterprise Agent Platform içindeki Model Garden üzerinden daha sonra sunulması bekleniyor. Model, Google AI Edge MediaPipe veya LiteRT kullanılarak dağıtılabiliyor. Ayrıca transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama ve LMStudio gibi ortam ve araçları; bunun yanı sıra tarayıcı için transformers.js ve WebGPU'yu destekliyor.
Bu, EmbeddingGemma 2'nin hazır bir arama deneyimiyle sınırlı olmadığı, çeşitli yerel uygulamalara entegre edilebilecek bir bileşen sunduğu anlamına geliyor. Bununla birlikte burada verilen performans ve bellek rakamları Google tarafından sağlanıyor. Modelin gerçek uygunluğu ise veri türüne, gereken geri getirme doğruluğuna, donanım kısıtlamalarına ve bağımsız testlerin sonuçlarına bağlı olmaya devam edecek. Duyuruda ayrıca her kullanım senaryosu için ayrıntılı koşullar veya modelin Model Garden'da kullanılabilirlik takvimi belirtilmedi.