University of California, Berkeley ve FuriosaAI tarafından hazırlanan bir araştırma makalesi, büyük dil modellerinin hizmet gereksinimlerini karşılamak üzere High Bandwidth Flash (HBF) belleğin, High Bandwidth Memory (HBM) ve ana bilgisayar belleğinin yanında ek bir katman olarak kullanılmasını öneriyor. Makale, model boyutlarının artması ve daha uzun konuşma bağlamlarının ortaya çıkardığı sorunu ele alıyor; bu durumda bellek kapasitesi ve bant genişliği, çıkarım performansının önünde darboğaz hâline geliyor.
Büyük dil modeli hizmet sistemleri model ağırlıklarını ve KV cache verilerini bellekte tutar. Zaman içinde genişleyen bağlamlar içinde tekrarlanan etkileşimler gerçekleştiren aracı iş yüklerinde bu verilerin tutulması daha da önem kazanır. Ancak belleği HBF kullanarak genişletmenin bazı ödünleşimleri vardır: Flaş belleğe erişim HBM’den daha yavaştır ve uçucu belleğe kıyasla sınırlı yazma dayanıklılığına sahiptir.
Makale neyi test etti?
Araştırmacılar, HBM, HBF ve ana bilgisayar belleğini birleştiren hiyerarşik bir depolama mimarisinin yanı sıra önbellek içeriğini ve veri konumlarını dikkate alan bir önbellek farkındalıklı zamanlama mekanizması sundu. Veri yerleştirme ve zamanlama kararlarının tamamlanma süresi, enerji tüketimi ve HBF’nin tahmini yazma ömrü üzerindeki etkisini analiz etmek için operasyonel izlerle yönlendirilen simülasyonlar kullandılar.
Açıklanan sonuçlara göre HBF destekli en hızlı sistemler, yalnızca HBM kullanan sistemlere kıyasla tamamlanma süresini %36,1 ile %87,0 arasında azalttı. Değerlendirilen senaryolarda hesaplanan enerji tasarrufu da %55,8’e ulaştı.
Kazanım her iş yükünde garanti değil
Sonuçlar HBF’yi HBM’nin doğrudan alternatifi olarak sunmuyor. Makale, bazı hafif iş yüklerinde HBF kullanımının enerji tüketimini artırdığını belirtiyor. Bu da faydanın iş yükünün niteliğine, tutulan veri miktarına ve okuma-yazma işlemlerinin nasıl zamanlandığına bağlı olduğu anlamına geliyor.
Yazma yönetiminin önemi, çalışma ömrü tahmininde açıkça görülüyor. Önbellek farkındalıklı zamanlama, değerlendirilen yapılandırmada HBF’nin tahmini yazma ömrünü 4,77 yıldan 14,82 yıla çıkardı.
Bu araştırma neden önemli?
Sonuçlar, yalnızca daha büyük bir bellek katmanı eklemenin model hizmetindeki darboğazları gidermek için yeterli olmadığını gösteriyor. Kazanımlar, veri konumunun zamanlama politikasıyla koordinasyonuna bağlı; böylece uzun bağlamlı çıkarım iş yükleri, flaş belleğin ömrünü tüketmeden veya gereksiz enerji maliyeti oluşturmadan ek kapasiteden yararlanabiliyor.
Yapay zekâ hızlandırıcılarının tasarımcıları ve altyapı işletmecileri açısından makale, bellek kapasitesini HBM’nin ötesine genişletmek için bir araştırma yolu sunuyor; ancak henüz genel ticari dağıtımın uygulanabilirliğini kanıtlamıyor. Sonuçlar simülasyonlara ve operasyonel izlere dayanıyor; gerçek performans ve ömür ise donanım tasarımına, iş yüklerinin özelliklerine ve gerçek sistemlerdeki bellek yönetimi politikalarına bağlı olacak.
Makalenin başlığı “Characterizing High Bandwidth Flash for LLM Serving” ve çalışmaya Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer ve Amir Gholami katkıda bulundu. Çalışma, Eylül 2026’da arXiv’de arXiv:2609.39131 numarasıyla bir araştırma taslağı olarak yayımlandı.