الذكاء الاصطناعي

ذاكرة الفلاش عالية النطاق قد تخفّض زمن خدمة نماذج اللغة الكبيرة حتى 87%

تبحث ورقة من UC Berkeley وFuriosaAI في استخدام High Bandwidth Flash لتوسيع ذاكرة مسرّعات الذكاء الاصطناعي عند تشغيل نماذج اللغة الكبيرة. وتشير المحاكاة إلى خفض زمن الإكمال بنسبة تصل إلى 87%، مع تحسينات محتملة في استهلاك الطاقة وإطالة عمر الكتابة عبر جدولة واعية بالتخزين المؤقت.

02 أكتوبر 2026
3 دقائق قراءة
12 قراءة
certi.news Editorial Team
ذاكرة الفلاش عالية النطاق قد تخفّض زمن خدمة نماذج اللغة الكبيرة حتى 87%

تقترح ورقة بحثية من جامعة كاليفورنيا في بيركلي وFuriosaAI استخدام ذاكرة فلاش عالية النطاق، أو High Bandwidth Flash (HBF)، كطبقة إضافية إلى جانب الذاكرة عالية النطاق HBM وذاكرة المضيف لتلبية احتياجات خدمة نماذج اللغة الكبيرة. وتتناول الورقة المشكلة التي تفرضها أحجام النماذج المتزايدة وسياقات المحادثة الأطول، حيث تصبح سعة الذاكرة وعرض نطاقها عنق زجاجة أمام أداء الاستدلال.

تحمل أنظمة خدمة نماذج اللغة الكبيرة أوزان النموذج وبيانات KV cache في الذاكرة. وتزداد أهمية الاحتفاظ بهذه البيانات في أعباء العمل الوكيلة، التي تنفذ تفاعلات متكررة ضمن سياقات تتوسع بمرور الوقت. لكن توسيع الذاكرة باستخدام HBF لا يخلو من مفاضلات: فالفلاش أبطأ من HBM في الوصول، كما أن قدرته على تحمل عمليات الكتابة محدودة مقارنة بالذاكرة المتطايرة.

ما الذي اختبرته الورقة؟

قدّم الباحثون بنية تخزين هرمية تجمع بين HBM وHBF وذاكرة المضيف، إلى جانب آلية جدولة مؤقتة تراعي محتوى الذاكرة المؤقتة ومواقع البيانات. واستخدموا محاكاة مدفوعة بآثار تشغيلية لتحليل أثر قرارات توزيع البيانات والجدولة في زمن الإنجاز واستهلاك الطاقة والعمر المتوقع لكتابة HBF.

وفق النتائج المعلنة، خفّضت أسرع الأنظمة المدعومة بـHBF زمن الإكمال بنسبة تراوحت بين 36.1% و87.0% مقارنة بأنظمة تعتمد على HBM فقط. كما وصلت وفورات الطاقة المحسوبة إلى 55.8% في السيناريوهات التي جرى تقييمها.

المكسب ليس مضموناً في كل أعباء العمل

لا تقدم النتائج HBF كبديل مباشر لـHBM. فقد أشارت الورقة إلى أن استخدام HBF زاد استهلاك الطاقة في بعض أعباء العمل الخفيفة، ما يعني أن الفائدة تعتمد على طبيعة الحمل، وحجم البيانات المحتفظ بها، وطريقة جدولة عمليات القراءة والكتابة.

وتظهر أهمية إدارة الكتابة بوضوح في تقدير العمر التشغيلي. فقد رفعت الجدولة المؤقتة الواعية بالذاكرة المؤقتة العمر المتوقع لكتابة HBF من 4.77 إلى 14.82 عاماً في الإعداد الذي جرى تقييمه.

لماذا يهم هذا البحث؟

توضح النتائج أن إضافة طبقة ذاكرة أكبر لا تكفي وحدها لمعالجة اختناقات خدمة النماذج. فالمكاسب مرتبطة بتنسيق موضع البيانات مع سياسة الجدولة، بحيث تستفيد أعباء الاستدلال ذات السياقات الطويلة من السعة الإضافية من دون استنزاف عمر الفلاش أو دفع كلفة طاقة غير ضرورية.

بالنسبة لمصممي مسرّعات الذكاء الاصطناعي ومشغلي البنية التحتية، تطرح الورقة مساراً بحثياً لتوسيع سعة الذاكرة خارج HBM، لكنها لا تثبت بعد جدوى نشر تجاري عام. فالنتائج مبنية على محاكاة وآثار تشغيلية، كما أن الأداء والعمر الفعليين سيعتمدان على تصميم العتاد، وخصائص أعباء العمل، وسياسات إدارة الذاكرة في الأنظمة الواقعية.

حملت الورقة عنوان “Characterizing High Bandwidth Flash for LLM Serving”، وشارك في إعدادها Yu وZack وChloe Wong وColeman Hooper وMinjae Lee وWonjun Kang وYoungjin Cho وMichael W. Mahoney وYakun Sophia Shao وKurt Keutzer وAmir Gholami. نُشرت كمسودة بحثية على arXiv في سبتمبر 2026 برقم arXiv:2609.39131.

مصدر الخبر
Semiconductor Engineering
فتح المصدر الأصلي ↗
كيف أعددنا هذا الخبر؟

اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة، لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة. اقرأ سياستنا التحريرية.

c
كاتب المقال

certi.news Editorial Team

certi.news Editorial Team

The certi.news editorial team monitors technical sources and reconstructs news, verifying facts and context prior to publication.

من نفس التصنيف

مقالات قد تهمك

عرض كل الأخبار