أطلقت Alibaba نموذج Qwen3.8-27B على منصة Hugging Face يوم الجمعة بترخيص Apache 2.0 مفتوح المصدر، ما يتيح للمطورين تنزيل أوزانه وفحصها وتعديلها وتشغيلها بعيداً عن واجهات النماذج السحابية. أهمية الإصدار لا ترتبط بعدد معلماته البالغ 27 ملياراً فقط، بل بقدرته على الجمع بين فهم الصور والفيديو، وسياق يصل إلى 262,144 توكناً، واستدلال قابل للضبط، ودعم مهام البرمجة وسير عمل الوكلاء البرمجيين.
ويصف المصدر النموذج بأنه نسخة مدمجة وسهلة النشر من قدرات جيل Qwen3.8. فالنسخة بدقة 16 بت تحتاج إلى نحو 56 غيغابايت من ذاكرة GPU، بينما تتطلب نسخة FP8 قرابة 28 غيغابايت. ومع ضغطها إلى 4 بت، ينخفض حجم النموذج نفسه إلى نحو 17 غيغابايت، ما يجعله قابلاً للتشغيل على أجهزة استهلاكية متقدمة، مثل حاسوب ألعاب قوي أو حاسوب محمول مجهز جيداً.
قدرات كبيرة في حجم أصغر
كان الجمع بين الأداء والحجم سبباً رئيسياً وراء ردود الفعل الواسعة من المطورين ومستخدمي الذكاء الاصطناعي المتقدمين. وقدمت Alibaba عند الإطلاق أرقاماً قوية في اختبارات متعددة، إذ سجل النموذج 61.7 في SWE-bench Pro، و90.3 في LiveCodeBench v6، و70.7 في CoWorkBench، و84.3 في OSWorld-Verified.
وفي جدول المقارنة المنشور من الشركة، تفوق Qwen3.8-27B على النتيجة المدرجة لـ Claude Opus 4.6 Max في اختباري SWE-bench Pro وLiveCodeBench، في حين ظل Claude متقدماً في Terminal-Bench وGPQA Diamond وHumanity’s Last Exam. لكن هذه النتائج لا تكفي لإعلان فائز شامل؛ فبعض تقييمات Alibaba داخلية، كما أن أدوات الاختبار وآليات القياس ليست متطابقة بالضرورة بين جميع النماذج.
وأعطت نتائج مستقلة لاحقة الإصدار زخماً إضافياً. فقد منحته Artificial Analysis درجة 52 في Intelligence Index، وهو مؤشر مركب يضم تسعة تقييمات للبرمجة والعلوم والاستدلال والمهام المهنية. وتساوت هذه الدرجة مع النتيجة التي ينسبها المؤشر حالياً إلى GPT-5.6 Luna من OpenAI عند أعلى إعداد للاستدلال، وهو نموذج مملوك لا يتاح إلا عبر السحابة. كما حصل Qwen3.8-27B على 51 في Agentic Index، متقدماً على Claude Opus 4.8 عند أقصى جهد للاستدلال.
لا تعني هذه المقارنات أن النماذج متكافئة تماماً، لكنها تفسر سبب اهتمام المطورين. فقد وصف Cline، وهو وكيل برمجي مفتوح المصدر، النتيجة بأنها المرة الأولى التي يسجل فيها نموذج محلي قدرة قريبة من نماذج القمة. كما اختبر Joshua “Xenova” Lochner تشغيل النموذج باستخدام أنوية WebGPU مخصصة، في إشارة إلى إمكان دمجه في بيئات تشغيل مختلفة.
ماذا يتيح التشغيل المحلي عملياً؟
اختبر Simon Willison نسخة مضغوطة بحجم يقارب 17 غيغابايت من نوع Q4_K_M على جهاز MacBook Pro مزود بمعالج M5 Max وعلى Nvidia DGX Spark. وتمكن النموذج في تجاربه من كتابة الشيفرة، وفهم الصور، وتشغيل حلقة وكيل برمجي عبر إطار Pi agent. كما تنقل داخل قاعدة شيفرة لشرح آلية المصادقة، وكتب واختبر أداة Python لتحويل سجل وكيل بصيغة JSONL إلى Markdown.
توضح هذه التجارب الفارق العملي بين نموذج لا يمكن الوصول إليه إلا عبر API وملف يمكن الاحتفاظ به على محطة عمل. فالمطور يستطيع تشغيل النموذج وتعديله وإبقاؤه داخل بنيته الخاصة، بدلاً من إرسال البيانات إلى مزود خارجي. وهذا يفتح خيارات تتعلق بالخصوصية وأمن المعلومات والحوكمة والتحكم في النشر، من دون أن يعني تلقائياً أن النموذج مناسب لكل مهمة أو أن تشغيله سيكون سريعاً.
ظهر الاهتمام أيضاً في معدل الاستخدام؛ إذ أفادت Cybernews بأن النموذج تجاوز 3 ملايين عملية تنزيل من Hugging Face خلال أيامه الثلاثة الأولى، بينما ظهرت سريعاً نسخ مضغوطة متوافقة مع أدوات الاستدلال المحلي. وأنشأ مجتمع LocalLLaMA على Reddit موضوعاً مخصصاً لجمع نتائج الاختبارات والنسخ المضغوطة وإرشادات الإعداد والمقارنات.
الجودة تأتي مع كلفة زمنية
القيد الأوضح في Qwen3.8-27B هو ميله إلى الإفراط في التفكير. تقول Artificial Analysis إن النموذج ولّد 160 مليون توكن إخراج أثناء اختبارات Intelligence Index، مقابل وسيط يبلغ 43 مليون توكن لدى نماذج مفتوحة الأوزان مماثلة. ويربط المصدر ذلك بإعداد الاستدلال الافتراضي xhigh؛ ففي تجربة Willison، استغرق إنشاء رسم SVG لبجع يركب دراجة 21 دقيقة واستهلك أكثر من 22 ألف توكن من الاستدلال. لذلك أوصى ببدء الاستخدام العادي مع استدلال منخفض أو من دونه.
وسجل Tomasz Tunguz مفاضلة مشابهة في اختبار صغير من تسع مهام مقارنةً بـ DeepSeek V4 Flash. فعند تفعيل الاستدلال، تفوق Qwen قليلاً في الجودة ضمن منظومة الوكيل التي استخدمها، لكنه كان أبطأ بنحو 30 مرة وأكثر تكلفة بمقدار 4.5 مرات، مع تنبيهه إلى أن تسع مهام لا تكفي لحسم النتيجة.
وقد تساعد برمجيات الاستدلال في تقليص الفجوة. يتضمن النموذج تقنية Multi-Token Prediction، وأفاد Willison بتحسن في الأداء بنحو 72% على DGX Spark بعد تفعيلها عبر llama.cpp مقارنة بإعداد LM Studio الافتراضي. مع ذلك، كانت تشغيلاته المعتادة عبر LM Studio تنتج بين 15 و30 توكناً في الثانية، وهي سرعة أقل بكثير من استجابة العديد من النماذج المستضافة.
ما الذي يعنيه ذلك للشركات؟
المقارنة الأهم للمؤسسات ليست ما إذا كان نموذج من 27 مليار معلمة يتفوق على Claude أو GPT في جدول واحد، بل ما إذا كان يستطيع تنفيذ ما يكفي من البرمجة وتحليل المستندات وفهم الرؤية والمهام الوكيلة محلياً لاستبدال استدعاءات API في فئات عملية من الأعمال. وبفضل ترخيص Apache 2.0، يمكن فحص الأوزان وتعديلها واستضافتها خلف ضوابط المؤسسة، فيما توثق Alibaba توافقه مع أطر vLLM وSGLang وTokenSpeed.
وتقول Alibaba إن نسخة مُدارة من Qwen Cloud ستأتي لاحقاً مع سياق افتراضي يبلغ مليون توكن وأدوات مدمجة. لكن قيمة Qwen3.8-27B الحالية تكمن في خيار النشر المحلي الأقل اعتماداً على البنية السحابية. وتظل هناك حاجة إلى مزيد من التحقق المستقل من نتائجه، كما أن بطء الاستدلال قد يحد من فائدته في التفاعلات الفورية. لذلك لا يثبت الإصدار أن النماذج المحلية حققت تكافؤاً عاماً مع النماذج الرائدة، لكنه يوضح أن قدرات كانت مرتبطة حديثاً بخدمات مكلفة أصبحت قابلة للتشغيل من ملف أصغر على عتاد يملكه المستخدم.