بيانات تحتفظ بها أنظمة خدمة نماذج اللغة الكبيرة في الذاكرة، وتزداد أهميتها مع السياقات الطويلة والتفاعلات المتكررة.
تبحث ورقة من UC Berkeley وFuriosaAI في استخدام High Bandwidth Flash لتوسيع ذاكرة مسرّعات الذكاء الاصطناعي عند تشغيل نماذج اللغة الكبيرة. وتشير المحاكاة إلى خفض زمن الإكمال بنسبة تصل إلى 87%، مع تحسينات محتملة في استهلاك الطاقة وإطالة عمر الكتابة عبر جدولة واعية بالتخزين المؤقت.