الذكاء الاصطناعي

CohereLabs تطلق نموذج North Micro Vision مفتوح الأوزان لمعالجة الصور بدقتها الأصلية

أطلقت CohereLabs نموذج North-Micro-Vision-Instruct، وهو نموذج رؤية ولغة مفتوح الأوزان يضم 2.4 مليار مُعامل ويدعم معالجة الصور بدقتها الأصلية، مع ترخيص Apache 2.0. يستهدف النموذج تطبيقات فهم المستندات والمخططات وOCR والضبط المخصص، كما يتضمن دعماً مجتمعياً لـMLX-VLM ووصفة AutoModel للنشر على وحدات معالجة الرسوميات من NVIDIA.

14 أغسطس 2026
4 دقائق قراءة
1 قراءة
CohereLabs تطلق نموذج North Micro Vision مفتوح الأوزان لمعالجة الصور بدقتها الأصلية

أعلنت CohereLabs إطلاق North-Micro-Vision-Instruct، وهو نموذج رؤية ولغة مفتوح الأوزان يضم 2.4 مليار مُعامل ويدعم إدخال الصور بدقتها الأصلية، بموجب ترخيص Apache 2.0. وتقول الشركة إن النموذج هو أصغر نموذج رؤية ولغة لديها حتى الآن، وقد صُمم ليكون أساساً مدمجاً لتطبيقات الوسائط المتعددة المتخصصة.

يتوفر النموذج وأوزانه على Hugging Face ضمن المستودع CohereLabs/North-Micro-Vision-Instruct. أما الدعم العام لـvLLM فما يزال قيد الإعداد، في حين استخدمت CohereLabs خلال تقييماتها نسخة داخلية من vLLM.

تركيز على المستندات والصور بدقتها الأصلية

يحافظ North Micro Vision على نسبة أبعاد الصورة وتفاصيلها الدقيقة، بدلاً من تصغير كل صورة أولاً إلى مربع صغير. ويتيح ذلك التعامل مع النصوص الصغيرة وتخطيطات المستندات والجداول والمخططات ولقطات الشاشة والنماذج. كما يغطي التدريب لغات ومجالات بصرية متعددة، بما في ذلك المستندات والمخططات والصور الطبيعية.

وتستهدف هذه القدرات المطورين الذين يحتاجون إلى نموذج يمكن ضبطه لمجالات بصرية محددة أو تشغيله ضمن قيود محلية وحافية. وتشير CohereLabs إلى أن نماذج بهذا الحجم قد تدعم، مع حزمة استدلال مناسبة وتقنيات التكميم، تجارب تتجاوز النشر على الخوادم لتشمل الحواسيب المحمولة والأجهزة المصنفة ضمن فئات الحافة أو الهواتف المحمولة.

بنية من ثلاثة مكونات

يتكون النموذج من مشفّر بصري بدقة أصلية، ووحدة إسقاط، ونموذج لغوي مدمج. ويجمع بين مشفّر بصري دربته الشركة ويضم 400 مليون مُعامل، ونموذج North Micro LLM اللغوي الداخلي الذي يضم ملياري مُعامل.

يتبع النموذج اللغوي بنية Command A+، مع التناوب بين ثلاث طبقات انتباه بنافذة منزلقة تستخدم التضمينات الموضعية الدورانية، وطبقة انتباه عامة واحدة من دون تضمينات موضعية. أما مشفّر الرؤية فيستخدم 2D RoPE وتضمينات موضعية متعلمة أحادية الأبعاد للحفاظ على البنية المكانية في الصور ذات الدقة الأصلية. وتحقن وحدة الإسقاط تمثيلات من طبقات متعددة للمشفّر البصري في طبقات مبكرة مقابلة من النموذج اللغوي.

تدريب متعدد المراحل

مر تدريب النموذج بأربع مراحل. بدأت العملية بتهيئة المشفّر البصري ووحدة الإسقاط، ثم رُفعت الدقة على مرحلتين مع تدريب المشفّر ووحدة الإسقاط والنموذج اللغوي معاً. بعد ذلك خضع النموذج للضبط التعليمي، واختُتم التدريب بنسخة مبسطة من تقنية Mixed Preference Optimization لتحسين السلامة والتنسيق وجودة الإجابات.

تدرج تدريب المشفّر البصري من دقة 384×384 بكسلاً باستخدام 10 ملايين مثال، إلى 1024×1024 بكسلاً عبر 13 مليون مثال، ثم إلى حد دقة أصلي يبلغ 1654×2339 بكسلاً عبر 10 ملايين مثال. ويماثل هذا الحد صفحة A4 بدقة 200 نقطة في البوصة، ما يسمح للنموذج بمعالجة صفحة مستند واحدة مع الحفاظ على نسبة أبعادها.

في مرحلة الضبط التعليمي، استُخدمت 50 مليون عينة متعددة الوسائط، توزعت أساساً بين OCR الأصلي، والمخططات والجداول، وتحديد المواضع والعد، وأسئلة وأجوبة OCR، وفهم الصور العام. كما شملت البيانات التعليق على الصور، والمعرفة، والنصوص فقط، والرياضيات والعلوم. واستندت العملية إلى مجموعات بيانات متاحة للعامة وإلى مجموعة مستندات متعددة اللغات داخلية لدى الشركة.

نتائج التقييم والتكاملات المتاحة

قيّمت CohereLabs النموذج في مهام تشمل فهم الصور العام ومتعدد اللغات ومتعدد الصور، وفهم المخططات والمستندات وOCR، والعلوم والتقنية، وتحديد المواضع والعد، ومقاومة الهلوسة، والقدرات النصية. ووفق النتائج المنشورة، سجل النموذج 0.921 في اختبار DocVQA، و0.808 في ChartQA، و0.792 في OCRBench، و0.725 في CountBench، بينما بلغ أداؤه في HallusionBench مقدار 0.615.

وتقدم الشركة أوزاناً متوافقة مع MLX-VLM بمساهمة مجتمعية من Prince Canuma وNeywa. كما تشحن، بالشراكة مع NVIDIA، وصفة AutoModel تتيح للمطورين ضبط النموذج ونشره على وحدات معالجة الرسوميات من NVIDIA، إلى جانب دعم ضبط مخصص عبر إطار Axolotl من المجتمع.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات