الذكاء الاصطناعي

Google تطلق EmbeddingGemma 2 للبحث متعدد الوسائط على الأجهزة

أعلنت Google عن EmbeddingGemma 2، وهو نموذج مفتوح بقدرات تضمين متعددة الوسائط للنصوص والصور والصوت والفيديو ضمن فضاء موحد، ومصمم للعمل محلياً على الأجهزة. يضم النموذج 740 مليون معامل، ويدعم سياقاً يصل إلى 8 آلاف رمز، مع إمكانات لتقليل استهلاك التخزين والذاكرة.

06 أكتوبر 2026
3 دقائق قراءة
10 قراءة
certi.news Editorial Team
Google تطلق EmbeddingGemma 2 للبحث متعدد الوسائط على الأجهزة

أطلقت Google نموذج EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط يربط النصوص والصور والصوت والفيديو، إضافة إلى الشيفرة، داخل فضاء تمثيل موحد. ويستهدف النموذج المطورين الذين يريدون بناء البحث الدلالي والاسترجاع وتطبيقات RAG محلياً على الأجهزة، من دون إرسال البيانات إلى خوادم خارجية.

يأتي النموذج بوزن 740 مليون معامل، ويصدر بموجب ترخيص Apache 2.0 المسموح تجارياً. وتقول Google إنه مبني على معمارية Gemma 4، ويستطيع مثلاً العثور على مقطع فيديو محدد باستخدام مذكرة صوتية، أو البحث في تسجيلات صوتية طويلة عبر استعلام نصي، باستخدام نموذج واحد متعدد الوسائط.

ما الذي يقدمه النموذج عملياً؟

تتمثل أبرز نقطة في EmbeddingGemma 2 في جمع أنواع مختلفة من البيانات ضمن تمثيل مشترك، ما يتيح إجراء عمليات بحث واسترجاع عابرة للوسائط. ويمكن استخدامه للبحث داخل مكتبة وسائط بالنص أو الصورة، وتحديد لحظات معينة في الفيديو عبر استعلام نصي أو صوتي، أو دعم استرجاع الملفات محلياً قبل تمرير النتائج إلى نموذج توليدي مثل Gemma 4 لتوفير السياق والاستدلال.

  • يضم نافذة سياق من 8 آلاف رمز، أي أربعة أضعاف EmbeddingGemma السابق، مع دعم ما يصل إلى 5.5 دقائق من الصوت أو 29 صورة أو 58 إطار فيديو.
  • يمكن تقليص متجهات الإخراج من 768 بُعداً إلى 512 أو 256 أو 128 بُعداً باستخدام تقنية Matryoshka Representation Learning، بما قد يخفض مساحة التخزين واستهلاك الذاكرة في قواعد البيانات المتجهية بما يصل إلى ستة أضعاف.
  • يوفر إعداداً أخف للمهام النصية فقط، مع مشفرات اختيارية للرؤية والصوت لدعم الاستخدام متعدد الوسائط.
  • بعد التكميم، تقول Google إن استهلاك الذاكرة النشطة يبلغ نحو 191 ميغابايت للأوزان النصية فقط ونحو 567 ميغابايت للنموذج متعدد الوسائط الكامل على هاتف Google Pixel 11 Pro.

تحسن في الشيفرة وتشغيل محلي

بحسب Google، حقق EmbeddingGemma 2 تحسناً قدره 9.92 نقاط في اختبار MTEB Code، مرتفعاً من 68.76 إلى 78.68، ما يجعله مناسباً لفهرسة قواعد الشيفرة والبحث الدلالي فيها ودعم استرجاع وكلاء البرمجة. كما تقول الشركة إنه يحقق نتائج قوية بالنسبة إلى حجمه في مهام النص والرؤية والصوت، ويتفوق في بعض المقارنات على نماذج متخصصة أكبر بأكثر من الضعف.

يتطلب التشغيل المحلي موارد محدودة نسبياً، ويمكن أن يساعد على تقليل زمن الاستجابة والحفاظ على خصوصية البيانات وإتاحة العمل دون اتصال. كما أن مشاركة النموذج مع Gemma 4 في أداة ترميز النص ومشفر الصوت قد تخفض الذاكرة الإجمالية المطلوبة عند بناء خط أنابيب محلي يجمع الاسترجاع والاستدلال.

أدوات الإتاحة والقيود

أتاحت Google أوزان النموذج عبر Hugging Face وKaggle، مع إتاحة لاحقة متوقعة عبر Model Garden في Gemini Enterprise Agent Platform. ويمكن نشره باستخدام Google AI Edge MediaPipe أو LiteRT، كما يدعم بيئات وأدوات مثل transformers وsentence-transformers وMLX وvLLM وllama.cpp وSGLang وOllama وLMStudio، إضافة إلى transformers.js وWebGPU للمتصفح.

يعني ذلك أن EmbeddingGemma 2 لا يقتصر على تجربة بحث جاهزة، بل يوفر مكوّناً يمكن دمجه في تطبيقات محلية متعددة. ومع ذلك، فإن أرقام الأداء والذاكرة الواردة هنا مقدمة من Google، بينما ستظل ملاءمة النموذج الفعلية مرتبطة بنوع البيانات، ودقة الاسترجاع المطلوبة، وقيود العتاد، ونتائج الاختبارات المستقلة. كما لم يحدد الإعلان شروطاً تفصيلية لكل حالات الاستخدام أو جدول توافر النموذج في Model Garden.

مصدر الخبر
كيف أعددنا هذا الخبر؟

اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة، لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة. اقرأ سياستنا التحريرية.

c
كاتب المقال

certi.news Editorial Team

certi.news Editorial Team

The certi.news editorial team monitors technical sources and reconstructs news, verifying facts and context prior to publication.

ما الذي تحتاج معرفته

أطلقت Google نموذج EmbeddingGemma 2 مفتوح المصدر للتضمين متعدد الوسائط، إذ يوحّد النصوص والصور والصوت والفيديو والشيفرة ضمن فضاء تمثيل واحد ويعمل محلياً على الأجهزة. يضم 740 مليون معامل ونافذة سياق تصل إلى 8000 رمز، لكن أرقام الأداء والذاكرة الواردة تعتمد على اختبارات Google ولم تُدعَم هنا باختبارات مستقلة.

  • يستهدف النموذج البحث الدلالي والاسترجاع وتطبيقات RAG محلياً دون إرسال البيانات إلى خوادم خارجية.
  • يدعم البحث العابر للوسائط، مثل العثور على مقطع فيديو باستخدام مذكرة صوتية أو استرجاع تسجيلات صوتية باستعلام نصي.
  • يتيح تقليص متجهات الإخراج من 768 إلى 512 أو 256 أو 128 بُعداً، ما قد يخفض التخزين والذاكرة في قواعد البيانات المتجهية بما يصل إلى ستة أضعاف.
  • تقول Google إن النموذج حقق تحسناً في اختبار MTEB Code من 68.76 إلى 78.68.
  • تتوفر أوزان النموذج عبر Hugging Face وKaggle، ويمكن نشره باستخدام Google AI Edge MediaPipe أو LiteRT وأدوات وأطر عمل أخرى.
  • أرقام الأداء واستهلاك الذاكرة مقدمة من Google، وقد تختلف الملاءمة العملية وفق البيانات والعتاد واحتياجات الاسترجاع.

أسئلة شائعة

ما هو EmbeddingGemma 2؟

هو نموذج تضمين متعدد الوسائط من Google يربط النصوص والصور والصوت والفيديو والشيفرة ضمن فضاء تمثيل موحد، ومصمم للعمل محلياً على الأجهزة.

ما أنواع البيانات التي يدعمها النموذج؟

يدعم النصوص والصور والصوت والفيديو والشيفرة، مع إمكانات للبحث والاسترجاع العابر للوسائط.

كم يبلغ حجم النموذج وما نافذة سياقه؟

يضم النموذج 740 مليون معامل، ويدعم نافذة سياق تصل إلى 8000 رمز.

أين يمكن الحصول على EmbeddingGemma 2؟

أتاحت Google أوزان النموذج عبر Hugging Face وKaggle، مع إتاحة لاحقة متوقعة عبر Model Garden في Gemini Enterprise Agent Platform.

من نفس التصنيف

مقالات قد تهمك

عرض كل الأخبار