Veri merkezlerinde yapay zekâ kapasitesinin artırılması artık yalnızca işlemci ve hızlandırıcı sayısıyla değil, bu kaynakların nasıl dağıtıldığı ve sistemin diğer bileşenlerine nasıl bağlandığıyla da ilgili. Makale, bazı kaynakların işlemciye yakın tutulmasını, diğer kaynakların birden fazla sunucuya yayılmasını ve grafik işlem birimleri ile NVMe depolama gibi yüksek maliyetli kaynakların ortak bir altyapı üzerinden paylaşılmasını bir araya getiren hibrit bir yaklaşım sunuyor.
PCI Express veya PCIe, işlemcileri, grafik işlem birimlerini, hızlandırıcıları, SmartNIC ya da DPU birimlerini ve depolama birimlerini bağlamak için geniş bir donanım ve yazılım ekosistemi sunduğundan bu yaklaşımda temel bir rol oynuyor. Ancak aktarım hızlarının artması ve bağlı cihazların sayısının çoğalması, yalnızca ek bağlantı noktaları sağlamanın ötesine geçen zorluklar doğuruyor. PCIe anahtarları ile yeniden zamanlayıcıların entegre işlevleri de burada önem kazanıyor.
Kaynak dağıtımı için üç model
Sistem içi ölçeklendirme veya Scale-up modeli, işlemci ile hızlandırıcılar arasında en yüksek yakınlık düzeyini sağladığından gecikmeye duyarlı yapay zekâ iş yükleri için uygun. Ancak bu model, işlemci hatlarının sayısı, kasanın alanı, güç ve soğutma gereksinimleri ve sunucunun barındırabileceği cihaz sayısıyla sınırlanıyor.
Sunucular arası ölçeklendirme veya Scale-out ise performansı Ethernet ya da InfiniBand kullanarak birden fazla düğüme dağıtıyor. Bu, kümelerin büyümesine olanak tanıyor; ancak ek gecikme getiriyor ve verilerle iş yüklerini düğümler arasında koordine edebilen yazılımlar gerektiriyor.
Buna karşılık ayrıştırılmış mimari, grafik işlem birimleri, depolama ya da SmartNIC ve DPU birimleri gibi belirli kaynakları tek bir sunucunun mülkiyetinden ayırarak ortak bir ağ üzerinden erişilebilir hâle getiriyor. Bu, kaynak kullanımını iyileştirebilir ve bilgi işlem kapasitesinin yanı sıra uç noktaların bağımsız biçimde ölçeklendirilmesini sağlayabilir; ancak kaynak rekabeti, yalıtım, yönetim ve gecikmeyle ilgili sorunlar doğuruyor.
Bu nedenle makale bu modellerden herhangi birini diğerlerinin kapsamlı bir alternatifi olarak sunmuyor. Pratik karar; hangi kaynakların yerel kalması gerektiğini, hangilerinin sunucular arasında dağıtılması gerektiğini ve hangilerinin birden fazla sistem arasında paylaşılmasını haklı çıkaracak bir maliyete sahip olduğunu belirlemekten geçiyor.
PCIe 7.0 ne getiriyor?
PCIe 7.0, PCIe 6.x’e kıyasla hat başına ham aktarım hızını iki katına çıkararak 128 GT/s seviyesine ulaştırıyor ve x16 yapılandırması kullanıldığında saniyede 512 gigabayta kadar çift yönlü bant genişliği sağlıyor. Bu artış, daha fazla sayıda hızlandırıcıyı ve veri aktarımı yoğun platformu desteklemek için daha geniş bir alan sunarken PCIe ekosisteminin geneliyle geriye dönük uyumluluğu koruyor.
Bununla birlikte, ölçeklenebilir bir sistem oluşturmak için tek başına daha yüksek hız yeterli değil. Daha yüksek sinyal hızı; kanal kaybı, yansımalar, çapraz konuşma, gürültü ve titreşimle başa çıkmayı zorlaştırıyor. Ayrıca PCIe 5.0 ve PCIe 6.x güncel mimarilerde önemli bileşenler olmayı sürdürüyor; bu da nesiller arası uyumluluğu sistem tasarımında pratik bir etken hâline getiriyor.
Ölçeklendirme ve trafik yönetimi için PCIe anahtarı
PCIe anahtarı işlemleri alıyor, hedeflerini belirliyor ve ardından bunları yukarı yönlü ve aşağı yönlü bağlantı noktaları arasında iletiyor. Böylece bağlantı noktalarının sayısını artırabiliyor, daha esnek mimarileri destekleyebiliyor ve bağlı cihazlar arasında doğrudan iletişim yolları sağlayabiliyor.
Ancak bağlantı noktalarının sayısı ve azami hız tek başına gerçek performansı belirlemiyor. Grafik işlem birimleri, depolama ve kontrol trafiği aynı bant genişliği için rekabet ettiğinde tahkim mekanizmaları, arabelleğe alma, kredi yönetimi, aşırı abonelik politikaları ve kuyruk başı bloklanmasını önleme, kullanılabilir performansı etkileyen unsurlar hâline geliyor. Ayrıca anahtar üzerinden yapılan her ek geçiş gecikmeyi artırabilir ve yeni bir rekabet noktası oluşturabilir.
Yapılandırılabilirlik, yonga tasarım ekipleri için özellikle önem kazanıyor; çünkü tek bir anahtar mimarisi içinde farklı bağlantı noktası düzenleri, yukarı yönlü bağlantı noktası seçenekleri, çeşitli uç nokta sayıları ve birden çok trafik modeli desteklenebiliyor.
Mesafe ve sinyal kalitesini ele almak için yeniden zamanlayıcılar
Kaynaklar daha uzun kart yolları, konektörler, kablolar veya genişletme kasaları üzerinden işlemciden uzaklaştığında elektriksel kanal daha zorlayıcı hâle geliyor. Yeniden zamanlayıcı, saati ve veriyi yeniden oluşturuyor, bir elektriksel bölümü sonlandırıyor ve ardından temiz bir sinyali sonraki bölüme yeniden gönderiyor.
Bu bileşenler, tasarımcılara cihazları dağıtma konusunda daha fazla esneklik sağlıyor; ancak mesafeyi sınırsız hâle getirmiyor. Yeniden zamanlanan her bölüm; gecikme, güç, ısı, eşitleme, tanılama ve işlemciler, uç noktalar, PHY arayüzleri, konektörler, kablolar ve ürün yazılımları arasındaki uyumluluk dikkate alınarak tasarlanmalı ve test edilmeli.
Çözüm seçilmeden önce ne ölçülmeli?
Makale, değerlendirmeye genel bir teknik özellikler listesinden değil, gerçek kullanımı temsil eden bir iş yükü ve topolojiden başlanmasını öneriyor. Ekiplerin gerekli bant genişliğini ve gecikmeyi, gelen ve giden bağlantıların sayısını, aşırı abonelik düzeyini, trafik bileşimini, kanal kaybını, güç tüketimini, yönetilebilirliği ve birlikte çalışabilirlik hedeflerini belirlemesi gerekiyor.
Bu bakış açısına göre PCIe anahtarları ölçeklenebilirlik ve trafik yönlendirme sağlarken, yeniden zamanlayıcılar kullanılabilir mesafeyi artırıyor ve sinyal bütünlüğünü koruyor. Makale, ASIC ve FPGA uygulamaları için tasarım yapı taşları olarak Rambus’ın PCIe anahtarlarına ve yeniden zamanlayıcı denetleyicilerine yönelik çözümlerinden söz ediyor; ancak pratik değer, bileşenin adından çok iş yüküne, topolojiye ve sistemin elektriksel kısıtlarına ne ölçüde uygun olduğuyla ölçülüyor.
Editoryal değerlendirme: Buradaki gerçek değişim, yeni bir standardın veya ürünün piyasaya sürülmesi değil; yapay zekâ mimarisi tasarımındaki kararın azami hız sorusundan yakınlık, ölçeklenebilirlik, kaynak kullanımı ve sinyal kalitesi arasında denge kurma sorusuna kayması. Temel kısıtlar ise açık kalıyor: Ortak kullanılan atlama ve bileşenlerin sayısı arttıkça yönetim, rekabet ve gecikme karmaşıklıkları da artıyor. Ayrıca makale Rambus sponsorluğundaki bir blog olduğundan, çerçeveyi pazarlama perspektifinden sunuyor ve bağımsız ölçüm sonuçları ya da tedarikçiler arası bir karşılaştırma içermiyor.