الذكاء الاصطناعي

كيف يقرّب LEMUR البحث بالتفاعل المتأخر من فهارس المتجهات التقليدية في txtai؟

يشرح مقال من مجتمع Hugging Face دمج LEMUR مع txtai لتحويل تمثيلات البحث متعددة المتجهات إلى متجهات ثابتة قابلة للفهرسة، إلى جانب إضافة خيار mean centering لمعالجة هندسة متجهات الرموز في بعض النماذج. وتظهر النتائج تحسناً ملحوظاً في اختبارات محدودة، لكنها لا ترقى إلى تعميم الأفضلية على جميع النماذج أو طرق الفهرسة.

17 أغسطس 2026
6 دقائق قراءة
2 قراءة
فريق تحرير certi.news
كيف يقرّب LEMUR البحث بالتفاعل المتأخر من فهارس المتجهات التقليدية في txtai؟

يعالج دمج LEMUR في txtai مشكلة عملية في نماذج الاسترجاع بالتفاعل المتأخر: هذه النماذج تحتفظ بمتجه لكل رمز في الاستعلام أو الوثيقة، ما يمنحها تفاصيل أدق من تمثيل كل نص بمتجه واحد، لكنه يجعل استخدامها مع فهارس البحث الكثيف التقليدية أكثر صعوبة. ويقدم txtai مساراً يحول هذا التمثيل متعدد المتجهات إلى متجه ثابت الأبعاد يمكن البحث عنه عبر النوع نفسه من الفهارس، مع إضافة خيار قابل للضبط باسم mean centering لتحسين الاستفادة من الاختلافات الاتجاهية في متجهات الرموز عندما تكون شديدة التشابه.

المادة، المنشورة في 13 أغسطس 2026 على مدونة Hugging Face كمقال مجتمعي كتبه Morgan Carr، تستعرض الدافع وراء التغيير، ونتائج تجارب محددة، وطريقة تدريب وتحميل أثر LEMUR في txtai. وهي لا تقدم النتيجة كترتيب عام بين تقنيات الاسترجاع، إذ اقتصرت المقارنات على نموذج واحد وثلاث مجموعات بيانات وجهاز واحد وبحث دقيق.

من عدة متجهات إلى متجه قابل للفهرسة

في البحث بالتفاعل المتأخر، تُقارن كل رموز الاستعلام برموز الوثيقة باستخدام MaxSim؛ إذ يُحتفظ بأقوى تطابق لكل رمز في الاستعلام ثم تُجمع هذه القيم. أما LEMUR، أو Learned Multi-Vector Retrieval، فيتعلم ترميزاً ثابت الأبعاد يحاول تقريب نتيجة هذا التفاعل مع الحفاظ على إمكانية استخدام فهرس متجهات تقليدي.

يتكون أثر LEMUR في txtai من مشفر للميزات، وإحصاءات تطبيع المخرجات، وعينة من متجهات الرموز. أثناء الاستدلال، يتحول الاستعلام إلى مجموع لميزات متعلمة، بينما تمثل الوثيقة بمجموعة من أوزان المربعات الصغرى العادية فوق العينة المخزنة. ويصبح الضرب الداخلي بين المتجهين الثابتين تقريباً للنتيجة الأصلية الخاصة بالتفاعل المتأخر.

الأثر الناتج خاص بمجموعة البيانات المستخدمة في التدريب، ولا بد من تدريبه قبل تحميل فهرس embeddings في txtai. كما يحفظ الأثر في صورة config.json وmodel.safetensors. ويتيح الإعداد epochs=100 مسار MLP الموجه للجودة، بينما يختار epochs=0 ميزات ELM عشوائية حتمية باعتبارها بديلاً أقل كلفة.

اختيار بيانات التدريب كان عاملاً حاسماً

أظهرت تجربة إزالة المكونات على مجموعة nfcorpus أن توزيع المتجهات المستخدم لتعلم خريطة الميزات يؤثر أكثر من بعض اختيارات التدريب الأخرى. فعندما دُرّب MLP على متجهات رموز مشفر البيانات، بلغ NDCG@10 قيمة 0.15870، وهي أقل من نتيجة ELM غير المدرب البالغة 0.19187. وعند استخدام متجهات مشفر الاستعلام ارتفعت النتيجة إلى 0.24868، ثم وصلت إلى 0.25534 بعد اختيار عدد العصور اعتماداً على التحقق.

وفق التحليل الوارد في المادة، فسّر اختيار توزيع التعلم 93% من التحسن المقاس بين تجربة متجهات البيانات والنتيجة النهائية، بينما ساهم اختيار العصور بالتحسن المتبقي البالغ 7%. لذلك يضبط LemurTrainer افتراضياً learncategory على query، مع إتاحة اختيار data أو تمرير مجموعة تعلم منفصلة.

ما الذي أظهره الاختبار المقارن؟

استخدمت المقارنة نموذج colbert-ir/colbertv2.0، وبطاقة NVIDIA GeForce RTX 4080 SUPER، وtorch 2.13.0+cu130، وبحث Faiss دقيقاً عبر IDMap,Flat. وقورنت نسخة MUVERA الافتراضية بعرض 10,240 بُعداً، ونسخة MUVERA مختزلة إلى 2,048 بُعداً، مع LEMUR بترميز MLP بعرض 2,048 بُعداً.

  • على nfcorpus، سجل LEMUR قيمة 0.25524 مقابل 0.16299 لـMUVERA بالحجم نفسه، و0.23544 لـMUVERA بالحجم الافتراضي.
  • على scifact، سجل LEMUR قيمة 0.54910 مقابل 0.36757 لـMUVERA المختزلة، و0.50021 للنسخة الافتراضية.
  • على arguana، سجل LEMUR قيمة 0.42556 مقابل 0.26280 لـMUVERA المختزلة، و0.34614 للنسخة الافتراضية.

يعادل ذلك تحسناً على MUVERA بالحجم نفسه بنسبة 56.6% في nfcorpus، و49.4% في scifact، و61.9% في arguana. أما مقارنةً بمتجه MUVERA الافتراضي، فبلغ التحسن 8.4% و9.8% و22.9% على الترتيب. كما استخدمت فهارس LEMUR في القياس خُمس مساحة فهارس MUVERA الافتراضية، لأن عرض المتجه انخفض من 10,240 إلى 2,048 بُعداً.

لكن نطاق هذه الأرقام مهم: لم تُستكمل تجربتا fiqa وscidocs من مجموعة البيانات المطلوبة، كما أن القياسات اعتمدت نموذجاً واحداً وجهازاً واحداً وبحثاً دقيقاً. ويستخدم txtai البحث الدقيق حتى 5,000 صف، ثم ينتقل إلى فهرس IVF. وفي تجربة scifact، خفض IVF الافتراضي NDCG@10 لـLEMUR بنسبة 43% مقارنة بالبحث الدقيق، مقابل انخفاض 25% لـMUVERA. لذلك لا يمكن افتراض أن نتيجة البحث الدقيق ستبقى نفسها عند التوسع أو استخدام بحث تقريبي.

لماذا أضيف mean centering؟

عند الانتقال من ColBERTv2 إلى lightonai/LateOn، وجد الاختبار أن متجهات الرموز كانت شديدة التماثل الاتجاهي. ففي عينة من 5,000 زوج، بلغ متوسط تشابه جيب التمام بين المتجهات 0.9508، وكان انتشار MaxSim يساوي 0.0559. وبعد طرح متوسط المجموعة وإعادة التطبيع، انخفض التشابه إلى 0.0033 وارتفع انتشار MaxSim إلى 0.4772. لا يمثل ذلك مقياس استرجاع بحد ذاته، لكنه يشير إلى أن التمركز أتاح للمرمز ثابت الأبعاد مساحة اتجاهية أكبر لالتقاطها.

أكدت اختبارات الاسترجاع أن الفائدة تعتمد على النموذج. ففي مصفوفة LateOn، كان التمركز على مستوى الدفعة أقوى من إيقافه أو استخدام متوسط المجموعة في الخلايا الأربع المقاسة. وعلى سبيل المثال، ارتفعت نتيجة LEMUR على nfcorpus من 0.00000 دون تمركز إلى 0.33309 مع تمركز الدفعة، بينما ارتفعت على scifact من 0.04985 إلى 0.69016. لكن التجارب على ColBERTv2 أظهرت أن التمركز قد يكون محايداً أو يضر MUVERA، ولذلك لم يُقدَّم كخيار عالمي غير مشروط.

القاعدة الافتراضية في التغييرات المدمجة تفعّل تمركز الدفعة عندما يحتوي النموذج المحمل على أكثر من طبقة خطية من torch.nn.Linear. أما النماذج ذات الصفر أو الطبقة الواحدة فتحافظ على سلوكها السابق، مع إمكانية تجاوز القرار يدوياً. يحدث التمركز بعد تطبيع متجهات الرموز وقبل LEMUR أو MUVERA، ثم تُجرى عملية تطبيع أخرى. ويمكن اختيار نطاق document أو batch أو collection، كما يقبل نطاق collection متوسطاً مضمناً أو ملف Safetensors يحتوي على center.mean.

ما الذي يتغير عملياً للمستخدم؟

يتطلب استخدام LEMUR خطوة تدريب مستقلة قبل إنشاء الفهرس، كما يجب أن تكون إعدادات المتجهات أثناء التدريب متسقة مع إعدادات التحميل. ويعرض المثال المنشور استخدام center: true مع أثر LEMUR وتثبيت Faiss على IDMap,Flat عندما يكون البحث الدقيق عملياً. أما الإصدار المنشور الأحدث من txtai في المادة فهو v9.12.0، في حين تستهدف التغييرات المدمجة v9.13.0؛ ولتجربة المصدر السابق للإصدار يمكن تثبيت نسخة master من مستودع GitHub في بيئة معزولة.

الخلاصة العملية ليست أن LEMUR أو التمركز يتفوقان في كل حالة، بل أن txtai أصبح يوفر أداتين منفصلتين لمشكلتين مختلفتين: LEMUR لتقليص تمثيل التفاعل المتأخر إلى متجه ثابت، والتمركز لمعالجة هندسة متجهات رموز غير ملائمة لبعض النماذج. وتبقى الحاجة قائمة إلى اختبارات أوسع عبر نماذج ومجموعات بيانات وفهارس تقريبية مضبوطة قبل تعميم النتائج.

مصدر الخبر
ف
كاتب المقال

فريق تحرير certi.news

فريق التحرير

فريق تحرير certi.news يتابع المصادر التقنية ويعيد بناء الأخبار بالعربية مع مراجعة الحقائق والسياق قبل النشر.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات