الذكاء الاصطناعي

AX-Ray يكشف عيوباً في التسرب السببي بنموذجين عامين للذكاء الاصطناعي

يعرض مشروع AX-Ray التابع لـVIDRAFT طريقة لتقييم النماذج تتجاوز درجات الأداء، بعدما حدد وكرر عيوباً وصفها بأنها تسرب سببي في نموذجي Zyphra/Zamba2-1.2B وnvidia/Nemotron-H-8B-Base-8K. ويضع الإطار هذه الحالات ضمن عيوب تمنع النشر، مع التمييز بينها وبين مشكلات مسار الخدمة أو واجهة برمجة التطبيقات.

13 أغسطس 2026
5 دقائق قراءة
1 قراءة
AX-Ray يكشف عيوباً في التسرب السببي بنموذجين عامين للذكاء الاصطناعي

يقدم مشروع AX-Ray حالة تشخيصية عامة قال إنّها كشفت، ثم كررت إثبات، عيوباً في التسرب السببي بنموذجين عامين للذكاء الاصطناعي هما Zyphra/Zamba2-1.2B وnvidia/Nemotron-H-8B-Base-8K. ويظهر النموذجان في لوحة AX-Ray بوصفهما حالتي Causal-LEAK، بينما يعامل الإطار التسرب السببي المؤكد على أنه عيب يمنع النشر، بغض النظر عن درجة النموذج في اختبارات القدرات العامة.

تنطلق المادة المنشورة على مدونة Hugging Face من أطروحة أساسية: لا تكفي الإجابة الصحيحة عن أسئلة الاختبارات المعيارية للحكم على جاهزية نموذج للاستخدام العملي. فسلامة النشر، وفق العرض الذي تقدمه VIDRAFT، تشمل صحة العلاقات السببية، واتساق مسار الخدمة، والصلابة أمام الظروف العدائية أو السياقات الطويلة، وسلامة البيانات، وأمن البنية التحتية، والاستعداد التنظيمي، ومخاطر الأنظمة الوكيلة.

ما المقصود بالتسرب السببي؟

في النموذج اللغوي الانحداري الذاتي، يفترض أن تظل التمثيلات أو سلوك قيم الاحتمال عند موضع سابق في التسلسل غير متأثر بالرموز المستقبلية التي لا تكون متاحة في ذلك الموضع. ويحدث التسرب السببي عندما تغير معلومات لاحقة أو لاحقة للسياق حالات الإخفاء أو قيم الاحتمال أو سلوكاً مرتبطاً بالتقييم في الجزء السابق من التسلسل.

يميز AX-Ray هذه المشكلة عن الهلوسة، وفشل الرفض، وحقن الأوامر، وتلوث الاختبارات. فهذه مشكلات مهمة، لكنها لا تصف الخلل نفسه؛ إذ يتعلق التسرب السببي بصحة المسار الحسابي للنموذج. وقد ينعكس هذا الخلل، بحسب المادة، على ثبات البادئة، وصحة الحالات الخفية، واتساق قيم الاحتمال، ومعالجة التسلسلات على دفعات أو بطريقة هجينة، وموثوقية التخزين المؤقت والخدمة، والثقة في السياقات الطويلة، وصحة التقييم، وسلامة التنفيذ الوكيلي.

لماذا قد لا تكشفه اختبارات القدرات؟

تركز معظم لوحات المتصدرين العامة على مدى تكرار تقديم النموذج إجابة صحيحة، وهي إشارة ضرورية لكنها لا تغطي كل خصائص السلوك الداخلي. وقد يظل التسرب السببي غير مرئي في اختبارات الأسئلة والأجوبة والرياضيات والبرمجة واتباع التعليمات، لأن هذه الاختبارات تراقب عادة الإجابة النهائية فقط.

في المقابل، يفحص AX-Ray خصائص أعمق، منها بقاء البادئة ثابتة، واتساق مسارات الخدمة، وما إذا كان ينبغي أن تتغلب الإخفاقات الحرجة على النتيجة الإجمالية للقدرات. وتلخص المادة المبدأ بوضوح: ارتفاع القدرة لا يعني تلقائياً جاهزية النشر.

إطار تشخيص متعدد المحاور

ينظم AX-Ray عمله حول ثلاثة محاور تشخيصية و11 فئة تشغيلية، مع كتالوج عام يضم 117 سجلاً تشخيصياً. وتغطي هذه السجلات أسئلة تقنية مرتبطة بالأدلة، وشدة المشكلة، واتجاه الكشف، واتجاه المعالجة، وسياق الحوكمة.

  • MODEL-SCAN: يفحص صحة النموذج وموثوقيته وصلابته وسلامته وسلامة بياناته وكفاءته وبنيته الداخلية واتجاهات المعالجة.
  • AX-SCAN: يركز على الخدمة والبنية التحتية والأمن والامتثال ومخاطر التشغيل.
  • AGENT-SCAN: يعالج مخاطر النشر الوكيلي، مثل صلاحيات الأدوات، والاختطاف، والحلقات، وتلوث الذاكرة، وسلوك الحذف، وحوكمة الاستقلالية.

وتشمل الفئات الأخرى السلامة السببية ونزاهة الخدمة، والموثوقية، والصلابة والسياقات الطويلة، والأمن والسلامة والمواءمة، ونزاهة البيانات ومنهجية التقييم، والكفاءة والتكميم والبنية، والبنية الداخلية القابلة للفحص، والمعالجة. كما يضم المحور التشغيلي فئات خاصة بانحراف الخدمة بين المحركات، وأمن البنية التحتية، والامتثال التنظيمي.

التمييز بين عيب النموذج ومشكلة الخدمة

يسجل AX-Ray أيضاً نتيجة جرى تدقيقها عبر واجهة برمجة التطبيقات للنموذج upstage/Solar-Open2-250B عند تشغيله عبر FP8 vLLM. أظهر التشغيل شذوذاً قابلاً للتكرار في تسجيل احتمالات الرموز ضمن مسار الخدمة أو الواجهة، لكن الإطار لا يقدمه كتسرب سببي مؤكد على مستوى النموذج.

وبحسب المادة، ما تزال اختبارات D1 وD7 ذات الطابع القابل للفحص الداخلي معلقة، ولذلك وُسم الصف بأنه official_dhs=false، مع الإشارة إلى أنه خضع لتدقيق واجهة برمجة التطبيقات وأن الفحص الداخلي لم يكتمل. ويعد هذا الفصل جزءاً محورياً من المنهجية: شذوذ الخدمة، ومشكلة تسجيل الدرجات عبر الواجهة، وتسرب الحالات الخفية على مستوى النموذج ليست ادعاءً واحداً.

الشفافية وحدود الإفصاح

يقول AX-Ray إنه يفصح عن صفوف لوحة المتصدرين، وملخصات التشخيص على مستوى النموذج، والدرجات العالية المستوى للفئات، وتصنيف العناصر، وبنية الربط بالاختصاصات القضائية، وبعض التقارير العامة، إلى جانب الحالات المحددة للتسرب السببي. لكنه لا ينشر وصفات الاختبار الخاصة، أو تفاصيل العتبات التنفيذية، أو المحفزات الحساسة الخام، أو المخرجات الضارة الخام، أو تفاصيل تنفيذية محمية بحقوق براءة الاختراع، أو أوامر التقييم الداخلية، أو إجراءات قابلة للتحويل إلى أساليب استغلال.

ويعرض المشروع هذا التوازن باعتباره محاولة لجعل تشخيصات السلامة قابلة للمساءلة من دون تحويلها إلى دليل لتجاوز النماذج أو إعادة إنتاج السلوك الضار. كما يربط الكتالوج بسياقات حوكمة في كوريا والاتحاد الأوروبي والولايات المتحدة واليابان والصين والإمارات العربية المتحدة والسعودية، مع التأكيد على أن AX-Ray إرشاد تشخيصي وليس معياراً قانونياً رسمياً.

تتمثل أهمية الحالة المنشورة في أنها تطرح طبقة إضافية فوق اختبارات القدرات: فالتقييم لا يسأل فقط عما إذا كان النموذج يجيب جيداً، بل عما إذا كان نموذجه ومسار خدمته وبيئته الوكيلة قابلة للثقة عند النشر والتشغيل والحوكمة. ويتيح المشروع بياناته العامة ومساحته التشخيصية عبر FINAL-Bench/AX-RAY، بينما تظل تفاصيل الاختبارات الخاصة غير منشورة.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات