المصطلحات
Prefill: مرحلة معالجة السياق الأولي في استدلال نماذج المحولات
Prefill هي مرحلة من استدلال نماذج المحولات تعالج الإدخال والسياق الأولي قبل توليد الاستجابة. ترتبط هذه المرحلة بإنتاجية حسابية مرتفعة، وتظهر أهميتها في أداء وكلاء البرمجة والبنى التحتية للاستدلال.
Prefill هي المرحلة الأولى في استدلال نماذج المحولات، وتختص بمعالجة مطالبة المستخدم والسياق المرتبط بها قبل بدء توليد الرموز. ويشير الوصف المتاح للمصطلح إلى أنها مرحلة تتطلب إنتاجية حسابية مرتفعة.
كيف تعمل مرحلة Prefill؟
في أثناء Prefill يعالج النموذج الإدخال الأولي، مثل المطالبة والملفات أو المعلومات المضافة إلى السياق. بعد ذلك تبدأ مرحلة Decode، التي تنشئ الرموز المكونة للاستجابة.
Prefill مقابل Decode
- Prefill: معالجة السياق الأولي، وترتبط بكثافة العمليات الحسابية وإنتاجية المعالجة.
- Decode: توليد الاستجابة رمزاً بعد رمز، وترتبط بدرجة أكبر بالذاكرة والوصول إلى ذاكرة KV-cache.
لماذا تهم Prefill في الأداء؟
توضح المواد المصدرية أن زمن معالجة السياق قد يشكل الجزء الأكبر من وقت بعض مهام التحقيق في الملفات ووكلاء البرمجة، بدلاً من أن يذهب كله إلى توليد الرد. لذلك يمكن أن تؤثر سرعة Prefill في زمن الاستجابة العملي، خصوصاً عندما يتعامل النموذج مع سياق كبير أو ملفات متعددة.
في تجربة JetBrains لتشغيل Junie محلياً، ركزت التحسينات على عمليات المصفوفات المرتبطة بمرحلة Prefill، وذكرت الشركة زيادة تقارب 40% في معدل معالجتها بعد استخدام حسابات بدقة 8-bit في أجزاء من طبقات الانتباه على أجهزة Mac المزودة بمعالج M5. هذه النتيجة تخص اختبارات JetBrains وإعداداتها، ولا تمثل قياساً عاماً لكل العتاد أو النماذج.
إدارة السياق وذاكرة KV-cache
يمكن تقليل إعادة معالجة السياق عبر الاحتفاظ بالمعلومات داخل الجلسة وإعادة استخدام بيانات KV-cache. وذكرت JetBrains أنها عدّلت Junie بحيث يضيف الطلبات الجديدة إلى سياق متحرك، مع إعادة استخدام الذاكرة التي عولجت في الطلبات السابقة. كما أضافت منطقاً لتخزين البادئة حتى طلب المستخدم من أجل إعادة استخدامها في المهام اللاحقة داخل المشروع نفسه.
Prefill في البنية التحتية للاستدلال
تصف إحدى المواد الاستدلال بأنه يتكون من مرحلتي Prefill وDecode، وتقترح أن تخصَّص لكل مرحلة عناقيد عتادية وبرمجية مناسبة لطبيعة عملها. ويستند هذا التوجه إلى اختلاف المتطلبات: فـPrefill كثيفة الحساب، بينما تعتمد Decode بدرجة أكبر على الذاكرة.
لا يعني ذلك أن كل أنظمة الذكاء الاصطناعي تستخدم بنية منفصلة فعلياً لكل مرحلة؛ فالمصادر تعرض هذا بوصفه اتجاهاً أو نموذجاً معمارياً في بعض البنى.
الخلاصة
Prefill هي معالجة الإدخال والسياق قبل توليد الاستجابة. فهمها مهم عند تقييم أداء الاستدلال، لأن سرعة النموذج لا تعتمد على معدل توليد الرموز وحده، بل تشمل أيضاً كفاءة معالجة السياق وإدارة الذاكرة وإعادة استخدام KV-cache.