تشير تجربة منشورة في مدونة Hugging Face إلى أن تدريب نماذج اللغة الصغيرة جداً على كميات ضخمة من البيانات قد يؤدي إلى تراجع الأداء بدلاً من تحسينه. ففي تجربة على نموذج يضم 0.9 مليون معلمة، بلغ مؤشر INT ذروته عند تدريب النموذج على 20 مليار رمز، أي بنسبة تقارب 22 ألف رمز لكل معلمة، ثم انخفض تدريجياً حتى وصل إلى 3.31 عند 180 مليار رمز، بتراجع قدره 27.3% عن الذروة.
أجرى التجربة Banaxi من Banaxi-Tech، ونُشرت بوصفها مقالاً من المجتمع على Hugging Face في 12 أغسطس 2026. وتركز المادة على سؤال عملي يواجه مطوري النماذج الصغيرة: إلى أي حد يمكن رفع نسبة الرموز إلى المعلمات قبل أن يتحول التدريب الإضافي إلى إفراط ضار؟
تجربة بنسبة تدريب غير مسبوقة
اعتمدت التجربة على نموذج صغير للغاية يتكون من ست طبقات، وبُعد خفي يبلغ 96، ووحدة SwiGLU متوسطة بحجم 380، إضافة إلى GQA بتكوين 6Q/2KV ومفردات تضم 384 رمزاً وسياق بطول 8 آلاف. واستُخدم محسن Muon للمعلمات ثنائية الأبعاد بمعدل تعلم أقصى قدره 7e-2، بينما استُخدم AdamW لبقية المعلمات بمعدل تعلم أقصى يبلغ 4e-3.
تولى التدريب معالجة 200 مليار رمز من مجموعتي FineWeb-HQ وCosmopedia v2، وهو ما يعادل نحو 222 ألف رمز لكل معلمة، أو قرابة 220 ضعف النسبة المرتبطة بقاعدة Chinchilla التي تبلغ نحو 20 رمزاً لكل معلمة. وكان منطق التجربة أن المفردات الصغيرة، البالغة 384 رمزاً، تحمل معلومات أقل في كل رمز مقارنة بمفردات تقليدية من 32 ألف رمز، كما أنها تترك عدداً أكبر نسبياً من المعلمات لطبقات المحول.
قُيّمت نقاط التحقق باستخدام حزمة Open SLM القياسية، التي تشمل ARC-Easy وARC-Challenge وHellaSwag وPIQA، إلى جانب ArithMark-2/3، ثم جُمعت النتائج في مؤشر INT Index.
الذروة عند 20 مليار رمز ثم تراجع مستمر
سجل مؤشر INT Index أعلى قيمة له، وهي 4.55، عند نقطة 20 مليار رمز. بعد ذلك تراجع مع استمرار التدريب، فوصل إلى 3.31 عند 180 مليار رمز. ووفق المادة، كان هذا الانخفاض مستمراً مع بعض الضوضاء، ولم تستعد أي نقطة لاحقة مستوى الذروة.
تكشف نتائج الاختبارات الفردية الصورة نفسها. فعند مقارنة نقطة 20 مليار رمز بنقطة 180 ملياراً، ارتفعت نتيجة ARC-Easy من 26.98 إلى 28.32، لكن النتائج انخفضت في الاختبارات الثلاثة الأخرى: تراجعت PIQA من 53.54 إلى 52.07، وARC-Challenge من 22.27 إلى 21.25، وHellaSwag من 29.01 إلى 28.06. وانخفض المتوسط من 32.95 إلى 32.43.
ولم يفسر مؤلف التجربة التراجع بأنه نتيجة مباشرة لخفض معدل التعلم في آخر 10% من التدريب. فقد جرى تقييم نقطة عند نحو 160 مليار رمز، أي 80% من التدريب، وسجلت متوسطاً قدره 32.68، وهو أقرب إلى النتيجة النهائية عند 180 مليار رمز منه إلى قمة الأداء عند 40 ملياراً، التي بلغ متوسطها 33.44. وبناءً على ذلك، يرى المصدر أن معظم الضرر كان قد وقع قبل مرحلة خفض معدل التعلم، وأن تقصير جدول التناقص الجيبي لم يكن ليحل المشكلة.
مقارنة مع النسبة التقليدية
استخدمت التجربة نفسها نقطة تحكم عند تدريب النموذج على 18 مليون رمز، بما يعادل نسبة Chinchilla تقارب 20 رمزاً لكل معلمة. حقق النموذج عندها مؤشر INT قدره 1.53، مع أداء قريب من مستوى الصدفة في الاختبارات، إذ سجل 26.64 في ARC-Easy و49.78 في PIQA و26.54 في ARC-Challenge و24.88 في HellaSwag.
تقدم هذه المقارنة نطاقاً متدرجاً للنتائج في هذه التجربة:
- 20 رمزاً لكل معلمة: 18 مليون رمز ومؤشر INT قدره 1.53، بما يشير إلى نقص التدريب.
- 22 ألف رمز لكل معلمة: 20 مليار رمز ومؤشر INT قدره 4.55، وهي نقطة الذروة.
- 200 ألف رمز لكل معلمة: 180 مليار رمز ومؤشر INT قدره 3.31، أي أقل بنحو 27% من القمة.
النطاق العملي المقترح
لا تستنتج المادة أن كل نسب التدريب المرتفعة تضر بالنماذج الصغيرة. فهي تشير إلى أن نسباً تقارب 7 آلاف و15 ألفاً و22 ألف رمز لكل معلمة عملت بصورة جيدة في نماذج مجتمعية أخرى، ومنها TinyStories ونماذج صغيرة على لوحات المتصدرين التي يقل حجمها عن 3 ملايين معلمة. أما نقطة الفشل في هذه التجربة فظهرت بعد تجاوز ذلك النطاق بكثير.
وتعرض النتائج مساراً سريعاً للصعود من مستوى 20 رمزاً لكل معلمة إلى الذروة، إذ ارتفع المؤشر بنحو 0.05 لكل مليار رمز بين 10 مليارات و20 ملياراً. في المقابل، كان الهبوط أبطأ، بنحو 0.008 لكل مليار رمز، لكنه استمر بلا انقطاع بعد نقطة الذروة.
وبناءً على هذه الجولة التدريبية، يقدّر المصدر أن النطاق العملي الأمثل من ناحية الحوسبة لنموذج من فئة Pico، بحجم يقارب مليون معلمة، يقع بين 22 ألفاً و30 ألف رمز لكل معلمة. والتوصية العملية هي بدء التدريب بميزانية صغيرة ضمن هذا النطاق، ثم تقييم النموذج قبل اتخاذ قرار تمديد التدريب. أما رفع النسبة بصورة عمياء إلى 200 ألف رمز لكل معلمة، فقد يستهلك ساعات كبيرة من تشغيل وحدات معالجة الرسوميات لإنتاج نموذج أسوأ من ذلك الذي تحقق عند نحو 20 ألف رمز لكل معلمة.