Yapay zekâ

AX-Ray, iki genel yapay zekâ modelinde nedensel sızıntı kusurlarını ortaya çıkarıyor

VIDRAFT’ın AX-Ray projesi, Zyphra/Zamba2-1.2B ve nvidia/Nemotron-H-8B-Base-8K modellerinde nedensel sızıntı olarak nitelendirdiği kusurları belirleyip tekrarladıktan sonra, performans puanlarının ötesine geçen bir model değerlendirme yöntemi sunuyor. Çerçeve bu vakaları dağıtımı engelleyen kusurlar kapsamında ele alırken, bunları hizmet yolu veya API sorunlarından ayırıyor.

2026-08-13
5 dk okuma
7 görüntülenme
فريق تحرير certi.news
AX-Ray, iki genel yapay zekâ modelinde nedensel sızıntı kusurlarını ortaya çıkarıyor

AX-Ray projesi, iki genel yapay zekâ modeli olan Zyphra/Zamba2-1.2B ve nvidia/Nemotron-H-8B-Base-8K modellerinde nedensel sızıntı kusurlarını ortaya çıkardığını ve ardından bunları yeniden doğruladığını belirttiği genel bir tanı vakası sunuyor. Her iki model de AX-Ray panosunda Causal-LEAK vakaları olarak gösteriliyor; çerçeve, doğrulanmış nedensel sızıntıyı, modelin genel yetenek testlerindeki puanından bağımsız olarak dağıtımı engelleyen bir kusur kabul ediyor.

Hugging Face blogunda yayımlanan içerik temel bir tezden hareket ediyor: Standart test sorularına doğru yanıt vermek, bir modelin pratik kullanıma hazır olup olmadığını değerlendirmek için yeterli değil. VIDRAFT’ın sunumuna göre dağıtım güvenliği; nedensel ilişkilerin doğruluğunu, hizmet yolunun tutarlılığını, düşmanca koşullara veya uzun bağlamlara karşı dayanıklılığı, veri bütünlüğünü, altyapı güvenliğini, mevzuata hazırlığı ve aracı sistemlerin risklerini kapsıyor.

Nedensel sızıntı ne anlama geliyor?

Otoregresif dil modelinde, dizideki önceki bir konumdaki temsillerin veya olasılık değerlerinin davranışının, o konumda henüz mevcut olmayan gelecekteki sembollerden etkilenmemesi beklenir. Nedensel sızıntı, daha sonraki bilgilerin veya bağlamın sonraki bölümlerinin, dizinin önceki kısmındaki maskeleme durumlarını, olasılık değerlerini ya da değerlendirmeyle bağlantılı davranışları değiştirmesiyle ortaya çıkar.

AX-Ray bu sorunu halüsinasyondan, reddetme başarısızlığından, komut enjeksiyonundan ve test kirliliğinden ayırıyor. Bunlar önemli sorunlar olsa da aynı kusuru tanımlamıyor; nedensel sızıntı, modelin hesaplama yolunun doğruluğuyla ilgili. İçeriğe göre bu kusur; önek kararlılığını, gizli durumların doğruluğunu, olasılık değerlerinin tutarlılığını, dizilerin toplu veya hibrit biçimde işlenmesini, önbellekleme ve hizmet güvenilirliğini, uzun bağlamlara duyulan güveni, değerlendirme doğruluğunu ve aracı çalıştırmanın güvenliğini etkileyebilir.

Yetenek testleri bunu neden ortaya çıkarmayabilir?

Genel liderlik tablolarının çoğu, modelin doğru yanıt verme sıklığına odaklanıyor; bu gerekli bir gösterge olsa da iç davranışın tüm özelliklerini kapsamıyor. Nedensel sızıntı, soru-cevap, matematik, programlama ve talimat izleme testlerinde görünmeden kalabilir; çünkü bu testler genellikle yalnızca nihai yanıtı gözlemler.

Buna karşılık AX-Ray, önekin sabit kalması, hizmet yollarının tutarlılığı ve kritik başarısızlıkların genel yetenek sonucuna üstün gelmesi gerekip gerekmediği gibi daha derin özellikleri inceliyor. İçerik bu ilkeyi açıkça özetliyor: Yüksek yetenek, otomatik olarak dağıtıma hazır olmak anlamına gelmez.

Çok eksenli tanı çerçevesi

AX-Ray çalışmalarını üç tanısal eksen ve 11 operasyonel kategori etrafında düzenliyor; genel katalogda 117 tanısal kayıt bulunuyor. Bu kayıtlar, kanıtlarla bağlantılı teknik soruları, sorunun şiddetini, tespit yönünü, düzeltme yönünü ve yönetişim bağlamını kapsıyor.

  • MODEL-SCAN: Modelin doğruluğunu, güvenilirliğini, dayanıklılığını, güvenliğini, veri bütünlüğünü, verimliliğini, iç yapısını ve düzeltme eğilimlerini inceler.
  • AX-SCAN: Hizmet, altyapı, güvenlik, uyumluluk ve operasyon risklerine odaklanır.
  • AGENT-SCAN: Araç izinleri, ele geçirme, döngüler, bellek kirlenmesi, silme davranışı ve özerklik yönetişimi gibi aracı dağıtım risklerini ele alır.

Diğer kategoriler arasında nedensel güvenlik ve hizmet bütünlüğü, güvenilirlik, dayanıklılık ve uzun bağlamlar, güvenlik ve emniyet ile uyum, veri bütünlüğü ve değerlendirme metodolojisi, verimlilik, nicemleme ve mimari, incelenebilir iç mimari ve düzeltme yer alıyor. Operasyonel eksen ayrıca motorlar arasındaki hizmet sapması, altyapı güvenliği ve düzenleyici uyumluluk için özel kategoriler içeriyor.

Model kusuru ile hizmet sorununu ayırt etmek

AX-Ray ayrıca upstage/Solar-Open2-250B modeli için FP8 vLLM üzerinden çalıştırıldığında model API’si aracılığıyla denetlenmiş bir sonucu kaydediyor. Çalıştırma, hizmet veya arayüz yolunda belirteç olasılıklarının kaydında tekrarlanabilir bir anormallik gösterdi; ancak çerçeve bunu model düzeyinde doğrulanmış nedensel sızıntı olarak sunmuyor.

İçeriğe göre, iç incelemeye elverişli D1 ve D7 testleri hâlâ beklemede olduğundan satır official_dhs=false olarak işaretlendi; ayrıca API denetiminden geçtiği, ancak iç incelemenin tamamlanmadığı belirtildi. Bu ayrım metodolojinin temel bir parçası: hizmet anormalliği, arayüz üzerinden puan kaydı sorunu ve model düzeyinde gizli durum sızıntısı tek bir iddia değildir.

Şeffaflık ve açıklamanın sınırları

AX-Ray, liderlik tablosu satırlarını, model düzeyindeki tanı özetlerini, kategorilere ilişkin üst düzey puanları, öğe sınıflandırmasını, uzmanlık alanlarıyla bağlantı kurma yapısını ve bazı genel raporları, ayrıca belirli nedensel sızıntı vakalarını açıkladığını belirtiyor. Ancak özel test tariflerini, operasyonel eşik ayrıntılarını, hassas ham istemleri, ham zararlı çıktıları, patent haklarıyla korunan uygulama ayrıntılarını, iç değerlendirme komutlarını veya istismar yöntemlerine dönüştürülebilecek prosedürleri yayımlamıyor.

Proje bu dengeyi, güvenlik tanılarını hesap verebilir hâle getirme ve aynı zamanda bunları modelleri aşmak ya da zararlı davranışı yeniden üretmek için bir kılavuza dönüştürmeme girişimi olarak sunuyor. Katalog ayrıca Kore, Avrupa Birliği, Amerika Birleşik Devletleri, Japonya, Çin, Birleşik Arap Emirlikleri ve Suudi Arabistan’daki yönetişim bağlamlarıyla ilişkilendiriliyor; AX-Ray’in resmi bir hukuki standart değil, tanısal rehber olduğu vurgulanıyor.

Yayımlanan vakanın önemi, yetenek testlerinin üzerine ek bir katman önermesinde yatıyor: Değerlendirme yalnızca modelin iyi yanıt verip vermediğini değil, modelinin, hizmet yolunun ve aracı ortamının dağıtım, işletim ve yönetişim sırasında güvenilir olup olmadığını da soruyor. Proje, genel verilerini ve tanısal alanını FINAL-Bench/AX-RAY üzerinden kullanıma sunuyor; özel testlerin ayrıntıları ise yayımlanmamış durumda.

Haber kaynağı
Hugging Face Blog
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör