Rensselaer Polytechnic Institute ve IBM T.J. Watson Research Center’dan araştırmacılar, yapay zekâ çıkarım iş yüklerinde kullanılan yüksek bant genişlikli bellek HBM için yeni bir bellek hata düzeltme yönetimi mimarisi öneren teknik bir makale yayımladı. Mimari REACH adını taşıyor; bu ad, makalenin “REACH: Controller-Managed Long-Span ECC for HBM AI Inference” başlığının kısaltmasıdır.
Makale, HBM sistemlerindeki pratik bir sorunu ele alıyor: Belleğin maliyetinin yüksek olması, bellek donanımındaki daha geniş hata oranlarıyla başa çıkabilecek daha güçlü bir korumaya duyulan ihtiyacı artırıyor. Bununla birlikte hata düzeltme mekanizmasının bellek denetleyicisi veya çıkarım için mevcut bant genişliği üzerinde büyük bir yüke dönüşmemesi gerekiyor.
Fikir nasıl çalışıyor?
REACH, önce yaygın hataları işlemek için dahili hata düzeltme kodlarının kullanılmasını, ardından henüz çözülememiş bölümlerin belirlenmesini öneriyor. Daha sonra, tüm bellek erişimlerini geniş kapsamlı kod çözme gerektiriyormuş gibi ele almak yerine, silinmiş durumlar olduğu bilinen bu bölümleri düzeltmek için uzun kapsamlı bir harici kod ayrılıyor.
Makale, uzun kapsamlı kodların doğrudan uygulanmasının küçük erişim işlemlerini daha geniş bir veri aralığına yayılan bir duruma bağlayabileceğini ve HBM hızlarında yüksek kod çözme maliyeti yaratabileceğini belirtiyor. Bu nedenle önerilen mimari, korumanın bir bölümünü bellek denetleyicisi içinde gerçekleştirmeye, daha geniş kapsamlı düzeltmeyi ise doğrudan kurtarılamayan verilerin konumu hakkında yeterli bilgi bulunan durumlara ertelemeye odaklanıyor.
Bu haber neden önemli?
Makalenin açıklamasına göre REACH, büyük dil modeli çıkarım iş yüklerinin çoğunlukla okuma ağırlıklı olmasından yararlanıyor. Sıralı okumalar, daha geniş kapsamlı koruma mekanizması uygulanmadan önce veri aralıklarının bir araya getirilmesini sağlayabilirken, dağınık yazma işlemleri eşlik verilerinin güncellenmesi için gereken hareketi sınırlıyor. Böylece mimari, tüm iş yükü türleri için tek tip bir tasarım kullanmak yerine hata düzeltme mekanizmasını çıkarımdaki gerçek erişim düzeniyle uyumlu hâle getirmeye çalışıyor.
Buradaki pratik önem yalnızca bir koruma katmanı eklenmesiyle değil, güvenilirlik ile denetleyici maliyeti ve bant genişliği arasındaki dengeyle ilgili. Hata düzeltme gücünün artırılması, bellek donanımındaki hata oranları yükseldiğinde yararlı olabilir; ancak buna karşılık ek hesaplama ve veri aktarımı işlemlerine yol açabilir. REACH, harici kodu bilinen düzeltme durumlarında kullanırken olağan akıştan dahili kodların sorumlu kalmasını sağlayarak bu yükü azaltmaya yönelik bir yaklaşım sunuyor.
Materyal neyi kanıtlıyor, neyi kanıtlamıyor?
Yayımlanan materyalde mevcut olan, mimari fikrinin ve büyük dil modeli çıkarımına neden uygun olduğunun bir özeti. Çıkarılan metin, maliyet veya enerji tüketimindeki azalma miktarına ya da REACH’in gecikme süresi ve veri aktarım hızı üzerindeki etkisine ilişkin rakamlar içermiyor; ayrıca diğer HBM tasarımlarıyla nicel bir karşılaştırma da sunmuyor. Bu nedenle yaklaşım, ticari kullanıma hazır bir kanıt veya açıklanmış bir performans rakamı olarak değil, önerilen bir araştırma tasarımı olarak değerlendirilmelidir.
Makale, tam başlığıyla Eylül 2026’da arXiv’e eklendi. Makalenin numarası arXiv:2609.10861, DOI tanımlayıcısı ise 10.48550/arXiv.2609.10861. Çalışmaya Rui Xie, Yunhua Fang, Asad Ul Haq, Linsen Ma, Sanchari Sen, Swagath Venkataramani, Liu Liu ve Tong Zhang katkıda bulundu.