أطلقت Google نموذج EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط يربط النصوص والصور والصوت والفيديو، إضافة إلى الشيفرة، داخل فضاء تمثيل موحد. ويستهدف النموذج المطورين الذين يريدون بناء البحث الدلالي والاسترجاع وتطبيقات RAG محلياً على الأجهزة، من دون إرسال البيانات إلى خوادم خارجية.
يأتي النموذج بوزن 740 مليون معامل، ويصدر بموجب ترخيص Apache 2.0 المسموح تجارياً. وتقول Google إنه مبني على معمارية Gemma 4، ويستطيع مثلاً العثور على مقطع فيديو محدد باستخدام مذكرة صوتية، أو البحث في تسجيلات صوتية طويلة عبر استعلام نصي، باستخدام نموذج واحد متعدد الوسائط.
ما الذي يقدمه النموذج عملياً؟
تتمثل أبرز نقطة في EmbeddingGemma 2 في جمع أنواع مختلفة من البيانات ضمن تمثيل مشترك، ما يتيح إجراء عمليات بحث واسترجاع عابرة للوسائط. ويمكن استخدامه للبحث داخل مكتبة وسائط بالنص أو الصورة، وتحديد لحظات معينة في الفيديو عبر استعلام نصي أو صوتي، أو دعم استرجاع الملفات محلياً قبل تمرير النتائج إلى نموذج توليدي مثل Gemma 4 لتوفير السياق والاستدلال.
- يضم نافذة سياق من 8 آلاف رمز، أي أربعة أضعاف EmbeddingGemma السابق، مع دعم ما يصل إلى 5.5 دقائق من الصوت أو 29 صورة أو 58 إطار فيديو.
- يمكن تقليص متجهات الإخراج من 768 بُعداً إلى 512 أو 256 أو 128 بُعداً باستخدام تقنية Matryoshka Representation Learning، بما قد يخفض مساحة التخزين واستهلاك الذاكرة في قواعد البيانات المتجهية بما يصل إلى ستة أضعاف.
- يوفر إعداداً أخف للمهام النصية فقط، مع مشفرات اختيارية للرؤية والصوت لدعم الاستخدام متعدد الوسائط.
- بعد التكميم، تقول Google إن استهلاك الذاكرة النشطة يبلغ نحو 191 ميغابايت للأوزان النصية فقط ونحو 567 ميغابايت للنموذج متعدد الوسائط الكامل على هاتف Google Pixel 11 Pro.
تحسن في الشيفرة وتشغيل محلي
بحسب Google، حقق EmbeddingGemma 2 تحسناً قدره 9.92 نقاط في اختبار MTEB Code، مرتفعاً من 68.76 إلى 78.68، ما يجعله مناسباً لفهرسة قواعد الشيفرة والبحث الدلالي فيها ودعم استرجاع وكلاء البرمجة. كما تقول الشركة إنه يحقق نتائج قوية بالنسبة إلى حجمه في مهام النص والرؤية والصوت، ويتفوق في بعض المقارنات على نماذج متخصصة أكبر بأكثر من الضعف.
يتطلب التشغيل المحلي موارد محدودة نسبياً، ويمكن أن يساعد على تقليل زمن الاستجابة والحفاظ على خصوصية البيانات وإتاحة العمل دون اتصال. كما أن مشاركة النموذج مع Gemma 4 في أداة ترميز النص ومشفر الصوت قد تخفض الذاكرة الإجمالية المطلوبة عند بناء خط أنابيب محلي يجمع الاسترجاع والاستدلال.
أدوات الإتاحة والقيود
أتاحت Google أوزان النموذج عبر Hugging Face وKaggle، مع إتاحة لاحقة متوقعة عبر Model Garden في Gemini Enterprise Agent Platform. ويمكن نشره باستخدام Google AI Edge MediaPipe أو LiteRT، كما يدعم بيئات وأدوات مثل transformers وsentence-transformers وMLX وvLLM وllama.cpp وSGLang وOllama وLMStudio، إضافة إلى transformers.js وWebGPU للمتصفح.
يعني ذلك أن EmbeddingGemma 2 لا يقتصر على تجربة بحث جاهزة، بل يوفر مكوّناً يمكن دمجه في تطبيقات محلية متعددة. ومع ذلك، فإن أرقام الأداء والذاكرة الواردة هنا مقدمة من Google، بينما ستظل ملاءمة النموذج الفعلية مرتبطة بنوع البيانات، ودقة الاسترجاع المطلوبة، وقيود العتاد، ونتائج الاختبارات المستقلة. كما لم يحدد الإعلان شروطاً تفصيلية لكل حالات الاستخدام أو جدول توافر النموذج في Model Garden.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.