الذكاء الاصطناعي

تجربة bartowski تكشف حدود بيانات imatrix وأهمية تنوعها في نماذج GGUF

يستعرض bartowski تجربة واسعة لتحسين بيانات المعايرة المستخدمة مع imatrix عند تكميم النماذج عبر llama.cpp، ويخلص إلى أن المكاسب الأكبر تظهر عند معدلات البت المنخفضة، خصوصاً في نماذج الخبراء المتعددين MoE. dataset الجديدة أصغر وأكثر تركيزاً، لكنها تجمع بين نصوص متنوعة ومحادثات منسقة لاستخدام الأدوات.

14 أغسطس 2026
6 دقائق قراءة
8 قراءة
فريق تحرير certi.news
تجربة bartowski تكشف حدود بيانات imatrix وأهمية تنوعها في نماذج GGUF

نشر bartowski تجربة جديدة حول بيانات المعايرة المستخدمة لحساب imatrix في نماذج GGUF، موضحاً أن dataset الجديدة لا تمثل «حلاً سحرياً» لتحسين الأداء، لكنها حققت مكاسب محدودة ومهمة في بعض الحالات، وقدمت فهماً أعمق لكيفية تأثير نوع النصوص المستخدمة في التكميم على النموذج النهائي. ويقول صاحب التجربة إن هذه ليست النتيجة النهائية، وإنه يتوقع مواصلة تحديث البيانات واختبارها.

أُجريت التجارب بالتعاون مع Fable وباستخدام قدرات GPU وفرتها LTT Labs. ونشر bartowski الملفات المستخدمة علناً، بما في ذلك ملفان منفصلان للنصوص النثرية والمحادثات، إلى جانب النصوص بعد تمريرها عبر قالب المحادثة الخاص بالنموذج. كما أتاح سكربتاً يشرح طريقة توليد النسخة المنسقة، وأشار إلى أن ملفات Qwen متاحة مع عمليات رفع مقصودة لسلاسل <|endoftext|> في النهاية حتى لا يُهمل النموذج الجزء الأخير من البيانات.

ما وظيفة imatrix في عملية التكميم؟

شرح bartowski أن خوارزمية التكميم في llama.cpp تحاول تقليل الخطأ الناتج عن تحويل مجموعات الأوزان إلى تمثيلات أقل دقة. ولتقدير الأهمية النسبية لهذه الأوزان، تُمرر كميات كبيرة من النصوص عبر النموذج، ثم تُجمع قياسات تفعيل قنوات الإدخال، وبصورة أدق مجموع مربعات التفعيلات التي تصل إلى كل موتر.

القناة التي تنشط بقوة وبانتظام عبر نصوص كثيرة تُعامل باعتبار أن الأوزان المرتبطة بها أكثر أهمية للنتيجة النهائية. أما القناة التي نادراً ما تنشط فقد تبدو أقل أهمية، مع بقاء احتمال أن البيانات لم تتضمن النوع الصحيح من النصوص الذي يستدعيها. لذلك لا تعتمد النتيجة على حجم corpus فقط، بل على مدى تنوعه وقدرته على تشغيل الأجزاء المختلفة من النموذج.

الاختبارات شملت نماذج كثيفة وذات خبراء متعددين

اختبر الفريق سبعة نماذج هي: gemma-4-E2B-it، وQwen3.5-4B، وQwen3.6-27B، وQwen3.6-35B-A3B، وMistral-Small-4-119B، وQwen3-Next-80B-A3B، وQwen3.5-397B-A17B. وتركز التقييم على مقارنة KLD مع bf16، واختبار BFCL، إضافة إلى مجموعة اختبارات قصيرة مخصصة وفحص تغطية الخبراء في نماذج MoE. كما استُخدمت عينات من MMLU-Pro وGSM8K للتحقق بصورة أعمق، بسبب كلفة تشغيل الاختبارات كاملة.

كانت النتيجة العامة أن البيانات لا تُحدث فرقاً متوقعاً بوضوح عند معدلات تتجاوز نحو 4 بتات لكل وزن. وشملت الاختبارات المبكرة بيانات عشوائية تماماً لاستبعاد بعض الفرضيات، لكن الفوارق في Q4_0 وIQ4_XS وما فوقهما بقيت محدودة في معظم الحالات، لأن أخطاء التكميم في هذه المستويات صغيرة نسبياً.

ظهر الفرق الأكبر عند المستويات المنخفضة، وخصوصاً Q2_K في نماذج MoE. فعند تكميم Qwen3.6-35B من دون imatrix، انخفض أداء BFCL بنحو 28 نقطة، من حوالي 82% إلى 54%. كما بلغ الفارق بين أفضل وأسوأ corpus نحو 10% في هذا الاختبار. في المقابل، كانت معظم البيانات النظيفة المستخدمة مع IQ2_M متقاربة، بفوارق لا تتجاوز بضع نقاط مئوية في الغالب.

لماذا يهم تنسيق المحادثة واستخدام الأدوات؟

تشير التجربة إلى أن التحدي في نماذج MoE لا يرتبط فقط بتنوع اللغات أو جودة النصوص، بل بقدرة البيانات على تفعيل الخبراء المختلفين. ففي نموذج Qwen3-Next-80B-A3B، ترك corpus إنجليزي خاص باستخدام الأدوات 18 خبيراً من أصل 512 من دون أي تفعيل، حتى بعد تمرير 3126 مقطعاً، أي ما يقارب أربعة أضعاف طول calibration_datav5.txt.

وعند الجمع بين calibration_datav5.txt وبيانات استدعاء الأدوات، تحققت تغطية كاملة للخبراء. ووجدت التجارب أن المحتوى متعدد اللغات والبرمجي كان من العوامل الرئيسية اللازمة لتشغيل بعض هؤلاء الخبراء. كما بدا أن إدراج محادثات مصاغة وفق chat template مهم تحديداً في نماذج MoE، لأن بعض الخبراء قد لا ينشطون إلا عند رؤية رموز وبنية المحادثة.

عملياً، يعني ذلك أن إعداد imatrix لنموذج يدعم المحادثة أو استدعاء الأدوات لا ينبغي أن يقتصر على نصوص نثرية عشوائية. فغياب قالب المحادثة أو أمثلة الأدوات قد يجعل بعض الخبراء أقل تمثيلاً أثناء المعايرة، وهو ما قد يظهر لاحقاً في الأداء عند معدلات التكميم المنخفضة.

كيف بُنيت النسخة الجديدة؟

استخدم bartowski تحليلاً على مستوى المقاطع لمعرفة أي أجزاء من البيانات تنشط الخبراء بصورة أفضل. وأظهرت النتائج أن بعض الخبراء لا يظهرون إلا مع أنواع محددة من المحتوى، مثل الشيفرة أو النصوص الفرنسية أو الأدب القصصي أو المواد العلمية. لذلك جُمعت نصوص نثرية متنوعة بهدف تعظيم تغطية الخبراء عبر نماذج MoE المستخدمة في الاختبار.

أُضيفت إلى ذلك محادثات منسقة لاستدعاء الأدوات مأخوذة من interstellarninja/hermes_reasoning_tool_use، واعتُبرت نسبة 2:3 بين النثر والمحادثات أفضل تركيبة ضمن الاختبارات. وبعد تجربة نسخ تراوح حجمها بين 400 و800 مقطع، حققت النسخة النهائية أداءً أفضل من نسخ أكبر بكثير حتى عندما كانت مبنية على الجودة نفسها. ويطرح الكاتب تفسيراً أولياً مفاده أن corpus الضخم قد يطغى فيه المحتوى الأكثر شيوعاً على الإشارات المهمة الأقل تكراراً.

كما قال إن البيانات الجديدة لم تضيق التغطية متعددة اللغات؛ بل انخفضت حصة النصوص المكتوبة بالأبجدية اللاتينية في الجزء النثري، ما يعني أن اللغات غير اللاتينية أصبحت تمثل جزءاً أكبر من corpus مقارنة بالإصدار v5، مع التأكيد على أن اختبارات إضافية ما زالت مطلوبة.

المقارنة بين v5 وv6 ليست تفوقاً مطلقاً

قارن bartowski نسختي v5 وv6 عند بناء Qwen3.8-27B، باستخدام perplexity وKLD على wikitext وHuggingFaceH4/no_robots وSalesforce/xlam-function-calling-60k. ويصف هذه الأرقام بأنها مؤشرات تقريبية وليست دليلاً حاسماً، خصوصاً أن قيمة perplexity المرجعية لـ bf16 على no_robots بلغت 19.05. وفي wikitext، تحسن متوسط KLD مع v6 في بعض المستويات، مثل Q2_K_L بنسبة 2.6% وIQ2_M بنسبة 1.8%، لكنه تراجع في أخرى، مثل Q4_K_S بنسبة 3.6% وIQ2_S بنسبة 3.1%.

توضح هذه المقارنة أن مكاسب dataset الجديدة انتقائية وليست ترقية عامة لكل صيغ التكميم أو كل مجموعات الاختبار. ويؤكد ذلك استنتاج الكاتب بأن تأثير imatrix يكون أوضح عند معدلات البت المنخفضة، وفي النماذج التي تعتمد على توزيع العمل بين عدد كبير من الخبراء.

اختبر الكاتب أيضاً استخدام سياق بطول 2048 بدلاً من 512 أثناء حساب imatrix، لكنه لم يلاحظ تحسناً في النتائج، بل تراجعت تغطية الخبراء في حالات عديدة. كما أظهرت مقارنة تشابه جيب التمام بين نتائج imatrix المحسوبة من bf16 وQ8_0 تشابهاً يتجاوز 99.99%، مع وجود بعض القيم الشاذة.

الخلاصة العملية ليست أن dataset واحدة ستضمن أداءً أفضل دائماً، بل أن اختيار corpus أصبح عاملاً يستحق الضبط، خاصة عند تكميم نماذج MoE إلى مستويات منخفضة. النسخة الجديدة متاحة مع ملفاتها وطريقة توليدها، بينما يواصل bartowski اختبارها على نماذج أخرى، من بينها Mistral وQwen3-Next-80B-A3B.

مصدر الخبر
كيف أعددنا هذا الخبر؟

اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة، لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة. اقرأ سياستنا التحريرية.

ف
كاتب المقال

فريق تحرير certi.news

فريق التحرير

فريق تحرير certi.news يتابع المصادر التقنية ويعيد بناء الأخبار بالعربية مع مراجعة الحقائق والسياق قبل النشر.

من نفس التصنيف

مقالات قد تهمك

عرض كل الأخبار