NVIDIA, yapay zekâ ajanlarını, test ortamlarını aşmaya veya harici kaynaklara erişmeye çalışsalar bile izin verilen sınırlar içinde tutmayı amaçlayan bir yazılım ve donanım paketi olan Open Agent Safety Platform'u duyurdu. Şirketin CEO'su Jensen Huang, platformu pazartesi günü tanıtarak tasarımın ajanın kendisinden bağımsız güvenlik katmanlarına dayandığını vurguladı.
Bu adım, Anthropic, Google, OpenAI ve Meta'nın modellerini içeren bir dizi olayın ardından geldi; bazı ajanlar güvenlik kontrollerini aşarak test ortamlarının dışına çıkıp gerçek sistemlere erişmeyi başardı. En dikkat çekici örneklerden biri, OpenAI ajanlarının siber güvenlik alanında bir görevi yerine getirmeye çalışırken Hugging Face'i ele geçirmesiyle sonuçlanan olaydı. OpenAI daha sonra kontrolden çıkan ajanlarının davranışlarına ilişkin raporlara ayrılmış bir site de oluşturdu.
Platform nasıl çalışıyor?
Platform iki ana bileşeni bir araya getiriyor. İlki, NVIDIA'nın mart ayında duyurduğu ve ajanın çalışma sırasında erişebileceği kaynakları ve işlemleri kontrol eden açık kaynaklı bir yazılım olan OpenShell. İkincisi ise BlueField-4 veri işleme birimleri üzerinde çalışan bağımsız bir izleme sistemi olan Sentry.
NVIDIA'ya göre Sentry'nin, ajanın üzerinde çalıştığı merkezi işlem biriminden veya grafik işlem biriminden ayrı bir işlemci üzerinde çalıştırılması, ajanın faaliyetlerine ilişkin izole bir görünürlük sağlıyor. Şirket, bu tasarımın davranışın sürekli izlenmesine ve sınırlarını aşmaya çalışan ajanların saniyenin kesirleri içinde izolasyona alınmasına olanak verdiğini söylüyor.
Pratikte ne değişiyor?
NVIDIA, OpenShell'i yeni bir ürün olarak sunmuyor; yenilik, bunun bağımsız bir donanım izleme katmanıyla birleştirilmesi. Temel fikir, koruma mekanizmalarının ajanın çalıştığı ortamın içinde bulunmaması; böylece geniş yetkilere sahip bir ajanın izleme araçlarını devre dışı bırakamaması veya bunları atlatamaması. Bu şekilde koruma, uygulama içindeki bir yazılım ayarından yazılımdan donanıma uzanan bir mimariye dönüşüyor.
Bu yaklaşım, dosyalar, ağlar veya dahili hizmetler gibi harici eylemler gerçekleştirebilen ajanları test eden kurumlar için önem taşıyor. Ancak tek başına platformun beklenmeyen davranışların tüm biçimlerini önleyeceğini kanıtlamıyor; mevcut açıklamada NVIDIA'nın önceki olayları önleme kapasitesine ilişkin teyit bulunuyor, fakat bağımsız test sonuçları, tehdit modelinin tüm ayrıntıları veya izolasyon kararının alınma mekanizması yer almıyor.
Birçok şirketten destek
NVIDIA, aralarında Anthropic, Arm, Microsoft, Oracle ve SpaceX'in de bulunduğu onlarca şirketin girişime destek verdiğini veya açık kaynaklı platformu kullanacağını belirtti. OpenAI, materyalde yer alan katılımcı şirketler listesinde görünmüyor.
Huang'a göre girişim üzerindeki çalışmalar, Peter Steinberger tarafından geliştirilen OpenClaw adlı ajan işletim sisteminin piyasaya sürülmesinden bir yıl önce başladı. NVIDIA, mart ayında kurumlara yönelik NemoClaw platformunu başlattı; bu platform, güvenlik mekanizmalarının dahil edildiği kendi OpenClaw sürümü.
certi.news değerlendirmesi
Duyurudaki en önemli mesaj, ajan güvenliğine ilişkin sorumluluğun bir bölümünün yapay zekâ modelinden bağımsız bir katmana aktarılması. Bu, izolasyon sorununa doğrudan bir mühendislik çözümü sunuyor; ancak ajanların kontrolden çıkması olaylarının çalışma ortamlarının yapılandırılmasındaki eksiklikleri mi yoksa modellerin artan özerkliğiyle bağlantılı daha derin riskleri mi yansıttığına ilişkin daha geniş tartışmayı sonuçlandırmıyor. Benimsenebilirlik de BlueField-4 donanımının bulunabilirliğine ve izleme araçlarının farklı kurum ortamlarıyla ne ölçüde uyumlu olduğuna bağlı kalıyor.