طبقة ذاكرة فلاش عالية النطاق تقترح الورقة استخدامها إلى جانب HBM وذاكرة المضيف لتوسيع ذاكرة خدمة نماذج اللغة الكبيرة.
تبحث ورقة من UC Berkeley وFuriosaAI في استخدام High Bandwidth Flash لتوسيع ذاكرة مسرّعات الذكاء الاصطناعي عند تشغيل نماذج اللغة الكبيرة. وتشير المحاكاة إلى خفض زمن الإكمال بنسبة تصل إلى 87%، مع تحسينات محتملة في استهلاك الطاقة وإطالة عمر الكتابة عبر جدولة واعية بالتخزين المؤقت.