الذكاء الاصطناعي

لماذا لا يكفي النموذج الجاهز؟ درس عملي في ضبط نماذج كشف الأجسام على بيانات واقعية

توضح JetBrains، عبر تجربة شملت YOLO12 وYOLO26 وRF-DETR، أن النماذج المدربة مسبقاً على COCO قد تقترب من الصفر عند نقلها مباشرة إلى مجالات متخصصة، بينما يعيد الضبط الدقيق تحسين النتائج بدرجات متفاوتة. وتكشف التجربة أن تشابه المجال المستهدف مع بيانات التدريب، إلى جانب دقة التموضع وزمن الاستدلال، أهم من الاعتماد على تصنيف النموذج باعتباره الأحدث أو الأفضل.

31 أغسطس 2026
5 دقائق قراءة
0 قراءة
فريق تحرير certi.news
لماذا لا يكفي النموذج الجاهز؟ درس عملي في ضبط نماذج كشف الأجسام على بيانات واقعية

تقدم JetBrains تجربة عملية لاختبار ثلاثة نماذج حديثة لكشف الأجسام هي YOLO12 وYOLO26 وRF-DETR، ليس على بيانات معيارية فقط، بل على صور تمثل حالات أقرب إلى الاستخدام الفعلي: تلف الكابلات، وكسور العظام في صور الأشعة السينية، وزجاجات المشروبات المتراصة. والخلاصة الأساسية واضحة: النموذج المتدرب مسبقاً ليس بالضرورة نموذجاً جاهزاً للنشر.

اعتمدت النماذج في الأساس على بيانات COCO، التي تضم نحو 118 ألف صورة تدريبية و80 فئة شائعة مثل الأشخاص والسيارات والكلاب والكراسي. لكن بعض الأهداف العملية، مثل كسر العظم، لا تنتمي إلى مفردات هذه الفئات أصلاً، في حين تختلف صور الأشعة واللقطات الصناعية والمشاهد المكتظة بصرياً عن الصور الطبيعية التي اعتادت النماذج رؤيتها.

التحقق من خط الأساس قبل التدريب

قبل الانتقال إلى الضبط الدقيق، قيّمت JetBrains ست نقاط تحقق، بحجمين لكل عائلة من العائلات الثلاث، على مجموعة COCO للتحقق val2017 المكونة من 5,000 صورة. حقق RF-DETR Base أعلى نتيجة mAP50-95 بلغت 0.5325، بينما اقترب نموذجا YOLO المتوسطان من هذه النتيجة عند 0.5259 و0.5181، مع عدد معاملات أقل بنحو 10 ملايين.

وأظهرت المقارنة فروقاً عملية في السرعة أيضاً. سجل YOLO26-N زمناً قدره 12.3 ميلي ثانية، مع نتيجة mAP50-95 قريبة من YOLOv12-N، الذي سجل 23.9 ميلي ثانية رغم كونه الأصغر في التجربة. أما RF-DETR Nano، فبلغ زمنه 12.4 ميلي ثانية، رغم أن عدد معاملاته يقارب 30 مليوناً، وهو ما يتجاوز YOLO26-M.

هذه الأرقام ليست مطابقة بالضرورة لما تنشره أوراق النماذج، لأن التجربة استخدمت عتاداً مختلفاً عن وحدة NVIDIA T4 الشائعة في المقارنات، وشغلت النماذج داخل أطرها الأصلية من دون تحويلها إلى TensorRT. وتوضح JetBrains أن TensorRT قد يخفض زمن الاستدلال عبر دمج الطبقات واختيار نوى محسنة للعتاد، لكنه يتطلب خطوة بناء إضافية وينتج محركاً مرتبطاً بوحدة معالجة رسومية محددة. لذلك تعكس أرقام التجربة أداءً أقرب إلى التشغيل المباشر، لا أقصى أداء ممكن بعد التحسين.

الاختبار خارج نطاق التدريب

استخدمت التجربة ثلاث مجموعات من RF100-VL، وهي مجموعة تضم 100 مجموعة بيانات متعددة الوسائط صممت لتغطي أهدافاً نادرة في بيانات التدريب المعتادة. وشملت المجموعات المختارة bone-fracture-7fylg وcable-damage وsoda-bottles.

عند تشغيل نقاط التحقق المدربة على COCO مباشرة على هذه البيانات، كانت النتيجة شبه معدومة. وتفسر JetBrains ذلك بأن النماذج المستخدمة كاشفات ذات مفردات مغلقة؛ فهي تملك عدداً محدداً من الفئات ولا تستطيع إخراج فئة مثل fracture إذا لم تكن موجودة في رأس النموذج المكون من 80 فئة. لذلك فإن حصول نموذج على mAP50 قدره 0.72 في COCO لا يعني أنه سيتعرف تلقائياً على كسور العظام.

ما الذي يغيره الضبط الدقيق؟

ضبطت JetBrains النماذج الثلاثة على كل مجموعة بيانات لمدة 10 عصور تدريبية باستخدام وحدة A100 واحدة، مع الاعتماد على مسارات التدريب المعتادة في Ultralytics وRF-DETR. وبعد التدريب، تحسنت النتائج بوضوح في مهام تلف الكابلات وزجاجات المشروبات، بينما بقيت مهمة كسور العظام الأصعب.

كانت زجاجات المشروبات الحالة الأسهل؛ إذ تراوحت نتيجة mAP50 لجميع النماذج بين 0.91 و0.97، وحقق YOLOv12-M أفضل mAP50-95 عند 0.6422. وترجح JetBrains أن السبب هو قرب صور المنتجات من بعض الفئات الموجودة في COCO، ما يجعل المشكلة أقرب إلى إضافة مفردات جديدة منها إلى الانتقال الكامل بين مجالين بصريين.

في مهمة تلف الكابلات، وصلت mAP50 إلى 0.93، لكن أعلى mAP50-95 لم يتجاوز 0.446. وهذا يعني أن النماذج تستطيع العثور على التلف بدرجة جيدة، لكنها تواجه صعوبة في رسم مربعات إحاطة دقيقة حول العيوب الرفيعة والممتدة. أما في صور كسور العظام، فبلغت أفضل mAP50، التي سجلها RF-DETR Base، 0.447 فقط، مع تفاوت كبير بين النماذج. كما أظهرت المعاينة البصرية أن أقل من نصف الصور تضمنت كسراً مكتشفاً في بعض النتائج.

ما الذي ينبغي أن يراجعه فريق التطوير؟

  • ابدأ بخط أساس قابل لإعادة الإنتاج: تحقق من أداء نقاط التحقق على بيئتك وعتادك قبل مقارنة النتائج بالأرقام المنشورة.
  • افصل البيئات البرمجية: استخدمت JetBrains ثلاثة بيئات uv معزولة داخل مشروع PyCharm واحد، لأن إصدارات مكتبة ultralytics المطلوبة لجِيلي YOLO ليست متوافقة. ويتطلب استخدام المفسر البعيد في PyCharm إصدار Professional، بينما يدعم Community Edition البيئات المحلية فقط.
  • لا تكتفِ بمقياس واحد: الفارق بين mAP50 وmAP50-95 في تلف الكابلات يكشف مشكلة التموضع الدقيق التي قد لا تظهر عند النظر إلى mAP50 وحدها.
  • اربط اختيار النموذج بالمهمة: أظهر RF-DETR Base اتساقاً أكبر وفاز على مجموعتي بيانات من أصل ثلاث، لكن ذلك لا يجعله الأفضل لكل حالة.
  • خطط للبيانات عندما يكون التحول كبيراً: تشير نتائج الأشعة السينية إلى أن الضبط الدقيق وحده قد لا يكفي، وقد تكون هناك حاجة إلى بيانات أكثر أو تدريب أطول أو تدريب مسبق متخصص بالمجال، وهي خيارات تطرحها المادة من دون إثبات تفوق أحدها في هذه التجربة.

تؤكد التجربة أن عبارة «متطور» أو «مدرب مسبقاً» لا تختصر ملاءمة نموذج كشف الأجسام لبيئة النشر. القرار العملي يجب أن يوازن بين الدقة، وزمن الاستدلال، وحجم النموذج، ومتطلبات الترخيص، والأهم مدى تشابه بيانات التدريب مع المجال المستهدف. كما أن نتائج JetBrains تظل مرتبطة بالمجموعات الثلاث وإعدادات التدريب المستخدمة، ولذلك لا ينبغي تعميمها باعتبارها ترتيباً نهائياً لجميع مهام الكشف.

مصدر الخبر
كيف أعددنا هذا الخبر؟

اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة، لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة. اقرأ سياستنا التحريرية.

ف
كاتب المقال

فريق تحرير certi.news

فريق التحرير

فريق تحرير certi.news يتابع المصادر التقنية ويعيد بناء الأخبار بالعربية مع مراجعة الحقائق والسياق قبل النشر.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات