Çipler ve Yarı İletkenler

Sessiz Veri Hataları, İşlemci Testlerini ve Sunucu Filolarının Bakımını Yeniden Tanımlıyor

İşlemciler geleneksel üretim testlerini başarıyla geçtikten sonra hesaplama açısından yanlış sonuçlar üretebilir ve kayıtlarda belirgin bir iz bırakmayabilir. Bu sorun, veri merkezi sektörünü testleri sistem ve filo düzeyine genişletmeye ve donanımı dağıtımdan sonra sürekli izlemeye yöneltiyor.

2026-09-10
5 dk okuma
8 görüntülenme
فريق تحرير certi.news
Sessiz Veri Hataları, İşlemci Testlerini ve Sunucu Filolarının Bakımını Yeniden Tanımlıyor

Sessiz veri hataları veya sessiz veri bozulması (Silent Data Errors/Silent Data Corruption), bir çipin geleneksel üretim testlerini geçmesi ile çalışma süresi boyunca doğru sonuçlar üretme kapasitesi arasındaki büyüyen farkı ortaya koyuyor. İşlemci; ATPG testlerinden, geçiş ve stuck-at hata testlerinden ve hızda yapılan yapısal testlerden geçebilir, ardından belirgin bir arıza kaydetmeden bir hesaplama işlemini yanlış gerçekleştirebilir; bozuk sonuç da bir uygulamaya veya yapay zekâ eğitim görevine aktarılabilir.

Bu değerlendirme, Semiconductor Engineering tarafından 10 Eylül 2026'da yayımlanan ve Advantest, Siemens EDA, NXP, Synopsys, Intel, Meta, Google ve proteanTecs'in görüşleriyle bulgularını bir araya getiren bir analize dayanıyor. Konu belirli bir ürünün piyasaya sürülmesi değil; işlemci kalitesinin tanımlanma, test kapsamının değerlendirilme ve işlemcinin veri merkezine ulaşmasından sonra yönetilme biçimindeki bir dönüşüm.

Çip düzeyinde nadir, filo düzeyinde yaygın bir sorun

Sessiz veri hataları tek bir cihazda ölçüldüğünde nadir görünür, ancak milyonlarca işlemci yüksek kullanım oranlarıyla çalıştığında tekrarlayan ve maliyetli bir hâle gelir. Google ve Meta'nın ilk analizleri, bu hataların her 1.000 sunucudan birini etkileyebileceğini; bunun da milyonda 100 ile 1.000 arasında kusurlu parça düzeyine karşılık geldiğini gösteriyor. 10 FIT'lik bir oran, yani her bir milyar çalışma saatinde bir arıza, 10 milyon cihaz dağıtıldığında yaklaşık her dört günde bir hatanın meydana gelmesi anlamına gelebilir.

Tehlike, hatanın yanlış bir sayısal sonuç veya tanımsız bir değer biçiminde ortaya çıkabilmesi ve ardından veritabanlarının bozulmasına, bir yapay zekâ modelinin beklenmedik davranmasına ya da çelişkili analitik sonuçlara yol açabilmesinde yatıyor. İşlemcinin kendisi bir hata sinyali göndermeyebileceğinden, sorun ancak uzun bir görevin sonunda mantıksız bir sonuç ortaya çıktığında fark edilebilir.

Geleneksel testler neden başarısız oluyor?

Sessiz hatalar; yüksek dirençli metal bağlantılar, zayıf köprü kusurları, zamanlama ve gerilim değişimleri ile eskime, radyasyon, sıcaklık ve yük koşullarının etkileri gibi marjinal kusurlarla ilişkilidir. Marjların daraldığı ve bağlantıların küçülerek daha dirençli hâle geldiği gelişmiş üretim düğümlerinde bu hataların olasılığı artar. Chiplet tabanlı paketler de doğrulama yollarının karmaşıklığını artırır.

Sektör, bozuk yürütme hatalarının yaklaşık %80'inin sıfır zamanlı testlerden kaçan kusurlarla ilişkili olduğunu, kalan %20'lik bölümün ise aralıklı biçimde veya eskime sonucunda ortaya çıktığını tahmin ediyor. Ancak gerilim, frekans, sıcaklık, yaş, yük türü ve olası tüm kombinasyonları test etmek pratik değildir. Ayrıca sistem düzeyinde ortaya çıkan bir arızayı çip testindeki belirli bir kusur modeliyle ilişkilendirmek haftalar sürebilir ve tasarım, test, arıza analizi ve sistem entegrasyonu ekiplerinin iş birliğini gerektirebilir.

Siemens EDA, gecikme kusurlarını test ederken tek bir girişin değiştirilmesine güvenmenin gerçek işlevsel çalışmayı taklit etmeyebileceğine dikkat çekiyor; çünkü birden fazla girişin değiştirilmesi daha büyük gecikmeler oluşturabilir. Bu nedenle testlerin, tüm kullanım koşullarını kapsamayan yapısal kusur modelleriyle yetinmek yerine gerilim, sıcaklık ve frekansın birden fazla boyutunu hedeflemesi gerekiyor.

Fabrikadan veri merkezine daha derin test

Bu sorun, test kapsamı kavramını yeniden tanımlıyor. Kapsam, testin ortaya çıkarabildiği bilinen üretim kusurlarının oranıyla sınırlı kalmak yerine, gerçek bir çalışma sırasında ve fiilî yük altında yanlış bir hesaplama yanıtını tespit etme olasılığıyla da ilişkilendiriliyor. Bu nedenle şirketler, sistem düzeyinde işlevsel testlere, yük farkındalığına sahip testlere ve görev modu testlerine yöneliyor; bunlara gömülü test tasarımının iyileştirilmesi ve çip içindeki marjların izlenmesi eşlik ediyor.

Intel'in deneyimi, zorluğun boyutunu gösteriyor. Beş nesil Intel Xeon işlemcisi üzerinden 1,2 milyon işlemciyi test ettikten sonra şirket, sessiz hata kusurlarını tespit etmek için DCDiag grubunda 1.000'den fazla işlevsel teste ve 5.000 sentetik stres testine ihtiyaç duydu. Testler kusurlar arasında eşit dağılmıyordu; kusurlu parçaların yaklaşık %50'si testlerin yalnızca %5'i kullanılarak tespit edilebildi, hataların %90'ını ortaya çıkarmak ise bu bin testin yarısından fazlasını gerektirdi. Sonuçlar ayrıca kusurların %70'inden fazlasının yalnızca tek bir test tarafından tespit edildiğini ve bir ürün nesli için etkili olan test reçetesinin doğrudan sonraki nesle aktarılamadığını gösterdi.

Filolarda pratikte ne değişiyor?

Yanıt, fabrika kapısında sona ermiyor. Veri merkezi işletmecileri, anormal davranış gösteren sunucuları veya çekirdekleri izole etmek için yazılım denetimi ve saha testi katmanlarını kullanıyor. Meta'da Fleetscanner programı sunucuyu hizmet dışına çıkarıyor ve bilinen sonuçlara sahip hesaplama testlerinde çalıştırıyor; Ripple programı ise normal çalışma sırasında kısa kalıplar yürütüyor. Hardware Sentinel, test yükleri tahsis etmeden uygulama istisnalarını ve sistem davranışını analiz ediyor. Meta, bu yaklaşımın farklı mimariler, uygulamalar ve veri merkezleri genelinde test tabanlı yöntemlere kıyasla tespit oranını %40 artırdığını belirtti.

Google; uçtan uca test kümelerinin doğrulanması, yinelenen hesaplamaların yapılıp karşılaştırılması, değişmezler ve doğrulamalar için kontroller, aktarım sırasında verilerin doğrulanması ve depolanan verilerin periyodik olarak doğrulanması dâhil olmak üzere bir dizi koruma yöntemi kullanıyor. Spanner yöntemi gibi uygulama ölçümleri bozulmayı tespit ederek şüpheli cihazları filodan çıkarabilir. Cihazlar geri döndüğünde kullanılan denetim yöntemleri de sorundan etkilenmeye yatkın çekirdekleri, sorun büyümeden önce belirlemek üzere değiştiriliyor.

Sevkiyat testinden silikon yaşam döngüsü yönetimine

Bu eğilimler; zamanlama, gerilim, sıcaklık ve yıpranma marjlarının sürekli izlenmesini ve sapmaları sessiz bir hataya dönüşmeden önce tespit etmek için zaman serisi analizi ile makine öğreniminin kullanılmasını teşvik ediyor. Parametrik ölçümler ve makine öğrenimi modelleri, beklenen profillerinden sapan cihazların izole edilmesine yardımcı olabilir. Farklı komut testleri, yinelenen yürütme ve çekirdekler arası karşılaştırma da tespit olasılığını artırabilir.

Ancak bu yaklaşım kısıtları ortadan kaldırmıyor. Tüm hata mekanizmalarını yakalayabilen tek bir yöntem yok; test sonuçları da bir tasarımdan diğerine otomatik olarak aktarılamıyor. Ayrıca etki fiziksel kusurdan uzakta, uygulamada ortaya çıktığında kök neden teşhisi zor olmaya devam ediyor. Analiz, üreticiler, test aracı sağlayıcıları, veri merkezi işletmecileri ve üniversiteler arasında arıza verilerinin paylaşımının ticari ve hukuki gerekçeler nedeniyle hâlâ sınırlı olduğuna da işaret ediyor. Bu nedenle asıl değişim, tek bir test eklemek değil; kalitenin sevkiyat anında tamamen belirlenemeyeceğini kabul ederek üretimden işletime kadar uzanan bir görünürlük zinciri kurmak.

Haber kaynağı
Semiconductor Engineering
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör