الذكاء الاصطناعي

تحليل نقدي لنماذج DavidAU: هل تكفي نتائج ARC-C لإثبات الذكاء؟

ينتقد مقال مجتمعي على Hugging Face اعتماد أكثر من 390 نموذجاً من نماذج DavidAU على سبعة اختبارات قديمة، ويطالب بنشر نتائج حديثة قابلة لإعادة الإنتاج. كما يعترض الكاتب على حذف نقاشه وحظره بعد طلبه نتائج لاختبارات مثل SWE-bench وGPQA Diamond.

11 أغسطس 2026
5 دقائق قراءة
1 قراءة
تحليل نقدي لنماذج DavidAU: هل تكفي نتائج ARC-C لإثبات الذكاء؟

نشر المستخدم DedeProGames مقالاً مجتمعياً على Hugging Face في 11 أغسطس 2026 ينتقد فيه طريقة عرض وتقييم نماذج DavidAU، ولا سيما نموذجي Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF وQwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF. ويقول الكاتب إن النموذجين يقدمان ادعاءات واسعة عن مستوى الذكاء اعتماداً على سبعة اختبارات قديمة، من دون نشر نتائج على اختبارات حديثة تقيس البرمجة والرياضيات واستخدام الأدوات والوكلاء.

المادة رأي وتحليل شخصي، وليست تقريراً مستقلاً يثبت الاتهامات الواردة فيها. ويعرض DedeProGames روايته لما حدث بعد نشره نقاشاً على صفحة نموذج Qwen3.6-27B، طالب فيه بنتائج SWE-bench Verified وTerminal-Bench 2.0 وGPQA Diamond وLiveCodeBench وAIME وHMMT. وبحسب روايته، حُذف النقاش ثم مُنع من التفاعل مع مستودعات DavidAU، بما في ذلك نشر النقاشات والتعليقات.

الاعتماد على سبعة اختبارات قديمة

يقول الكاتب إن مستودعات DavidAU، التي يقدر عددها بأكثر من 390 مستودعاً، تستخدم المجموعة نفسها من الاختبارات: ARC-C وARC-E وBOOLQ وHellaSwag وOpenBookQA وPIQA وWinogrande. ويربط المقال هذه الاختبارات أساساً بسنوات 2018 و2019، ويصفها بأنها لم تعد تميز بوضوح بين نموذج جيد ونموذج متفوق في المهام الحديثة.

ويشير المقال إلى أن نموذج 9B سجل، وفق الأرقام المعروضة فيه، 0.649 في ARC-C، بينما سجل Qwen 3.5 9B الأساسي 0.571، وسجل Qwen 3.6 27B الأساسي 0.647. أما نموذج Fusion-711 بحجم 27B فسجل 0.711 في الاختبار نفسه، في حين بلغ نموذج Qwen 3.6 27B الأساسي 0.647. ويرى الكاتب أن الرقم “711” في اسم النموذج يشير إلى نتيجة ARC-C البالغة 0.711، وأن تقديم هذه النتيجة كدليل على بلوغ مستوى نماذج OpenAI وClaude وGemini يبالغ في دلالتها.

كما يذكر أن نموذج Qwen3.6-40B-Grand-Intelligence-Six-711-717-raw سجل 0.695 في ARC-C، أي أقل من نتيجة نموذج 27B البالغة 0.711، رغم استمرار استخدام لغة تسويقية مشابهة في بطاقة النموذج، بحسب المقال.

لماذا يشكك الكاتب في ARC-C؟

يستند DedeProGames إلى ورقة بحثية منشورة في 2024 من Snowflake AI Research، تحمل عنوان In Case You Missed It: ARC “Challenge” Is Not That Challenging وتحمل المعرف arXiv:2412.17758 وتنسب في المقال إلى Borchmann. ووفق العرض الوارد في المقال، ارتفعت دقة Llama 3.1 70B على ARC-C من 64% إلى 93% عند إظهار جميع خيارات الإجابة، كما أن 31% من الأسئلة وُصفت بأنها يصعب الإجابة عنها منفردة، بينما ارتفعت نتيجة OpenBookQA من 48% إلى 89% عند استخدام تقييم يراعي الخيارات.

ويستخلص الكاتب من ذلك أن جزءاً من صعوبة هذه الاختبارات قد يرتبط بطريقة إعداد التقييم، لا بتعقيد الأسئلة وحده. لذلك يرى أن نتيجة ARC-C، مهما ارتفعت، لا تكفي لإثبات تفوق عام في الذكاء أو الأداء الوكيلي.

الفجوة بين الاختبارات القديمة والقدرات الحديثة

يقارن المقال بين ما يختبره DavidAU وما تدرجه بطاقات النماذج الأساسية من نتائج. فبطاقة Qwen 3.5 9B، بحسب النص، تتضمن نتائج مثل 82.5 في MMLU-Pro، و81.7 في GPQA Diamond، و65.6 في LiveCodeBench v6، و66.1 في BFCL-V4، و79.1 في TAU2-Bench، و91.5 في IFEval، إضافة إلى نتائج في SuperGPQA وHMMT وDeepPlanning وOSWorld-Verified وAndroidWorld.

أما Qwen 3.6 27B الأساسي، فيورد المقال له نتيجة 77.2 في SWE-bench Verified، و53.5 في SWE-bench Pro، و59.3 في Terminal-Bench 2.0، إلى جانب نتائج في اختبارات المعرفة والرياضيات، ومنها 94.1 في AIME26 و84.3 في HMMT Feb 26. ويقول الكاتب إن بطاقات DavidAU تعرض أجزاء من بطاقات Qwen الرسمية، لكنها لا تقدم، في المقابل، نتائج النماذج المعدلة على تلك الاختبارات الحديثة.

ملاحظات على النقاشات والتكميم

يسرد المقال عدة نقاشات على صفحات النماذج. ويذكر أن Discussion #10 على نموذج 9B أُغلقت بعد أن أبلغ المستخدم KottCh عن فشل النموذج في مهمة تتعلق بتحليل عوامل Fermat، وأن Discussion #1 على نموذج 27B تضمنت طلباً من FreeGoldRush للحصول على نتيجة SWE-bench Verified عند إعدادَي q8 وq4 من دون رد، وفق رواية الكاتب. كما يشير إلى نقاشات تضمنت تقارير عن حلقات متكررة في استدعاء الأدوات أو مخرجات غير مفهومة. هذه الأمثلة واردة في المقال بوصفها بلاغات مستخدمين، وليست نتائج اختبار مستقل منشور.

وينتقد DedeProGames كذلك أساليب التكميم المخصصة التي ينسبها إلى DavidAU، ومنها “NEO IMATRIX” و“DI-MATRIX” و“TRI-MATRIX”، إضافة إلى تعديلات على موترات الإخراج وملفات MTP. ويرى أن ادعاء تحسين الدقة بنسبة 2% إلى 4% يحتاج إلى بيانات معايرة منشورة وقياسات perplexity ومقارنة مباشرة مع أساليب التكميم القياسية. كما يتساءل عن استخدام صيغ قديمة مثل Q5_1 وQ4_1 بدلاً من Q5_K_M وQ4_K_M.

ما الذي يطلبه الكاتب؟

لا يخلص المقال إلى أن النماذج سيئة، بل يقول صاحبه إنه لا يستطيع الحكم عليها بسبب نقص البيانات القابلة للتحقق. ويطالب بما يلي:

  • تشغيل اختبارات SWE-bench Verified وTerminal-Bench 2.0 وGPQA Diamond وMMLU-Pro وLiveCodeBench v6 وAIME26 وHMMT Feb 26 وSuperGPQA وBFCL-V4 وTAU2-Bench.
  • نشر تفاصيل التقييم، بما في ذلك أداة التشغيل، والتعليمات، وإعداد few-shot، ودرجة الحرارة، ومعلمات أخذ العينات، وحجم نافذة السياق، وعدد مرات التشغيل.
  • نشر أرقام perplexity لملفات GGUF ومقارنة NEO IMATRIX بالتكميم القياسي وبخط أساس F16.
  • توضيح أسباب اختيار صيغ التكميم القديمة، وتحسين آلية التعامل مع الأسئلة النقدية داخل مجتمع النماذج المفتوحة.

وبذلك تتمحور أطروحة المقال حول أن النتائج القديمة واللغة التسويقية لا تعوضان عن تقييم حديث ومنهجية معلنة. أما الحكم النهائي على جودة نماذج DavidAU، فيبقى، وفق المادة نفسها، معلقاً إلى أن تُنشر اختبارات قابلة لإعادة الإنتاج على مهام أكثر صلة بالاستخدامات العملية.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات