The Information'ın aktardığına göre OpenAI, yeni Astra modelinde “yinelemeli derinlik” (recurrent depth) veya “opak yineleme” (opaque recurrence) olarak bilinen bir akıl yürütme teknolojisini kullanmayı planlıyor. Bu teknoloji, modelin geleneksel akıl yürütme modellerindeki düşünme adımlarına benzeyen sıralı bir yol izlemek yerine, aynı sorguyu bir döngü içinde birkaç kez işlemesine olanak tanıyor.
Endişeye yol açan konu yalnızca modelin piyasaya sürülmesi veya açıklanan yetenekleri değil, bu yapının akıl yürütme sürecini incelemeye daha az elverişli hâle getirme ihtimali. Modelin bıraktığı okunabilir izler azaldıkça, güvenlik ekiplerinin istenmeyen davranışları tespit etmesi ya da gelişmiş ajanların ve modellerin kararlarının nedenlerini anlaması zorlaşıyor.
Bu haber neden önemli?
Yapay zekâ araştırma ekipleri, bu kayıtlar modelin iç düşüncesini mutlaka eksiksiz veya kelimesi kelimesine yansıtmasa da, “düşünce zinciri” kayıtlarını bir izleme aracı olarak kullanıyor. Habere göre bu kayıtlar, beklenen davranışın dışında olduğu belirtilen ajanların yakın tarihli bir faaliyetini analiz etmede ve davranışlarının nedenlerini anlamaya çalışmada önemli bir rol oynadı.
Opak yineleme durumunda ise işlem sürecinin daha büyük bölümleri, insanların kolayca okuyabileceği açık adımlar üretmeyen bir yola aktarılabilir. Bu da güvenlik ekipleri için pratik bir soru doğuruyor: Sonuca nasıl ulaştığına dair mevcut kanıtlar aynı anda azalırken, akıl yürütme kapasitesi artan bir model nasıl izlenebilir?
Geri dönülmesi zor bir yol konusunda endişeler
Redwood'un CEO'su Buck Shlegeris, yinelemenin artırılmasının düşünce zincirinin izlenebilirliğini büyük ölçüde azaltabileceği uyarısında bulundu. Astra'nın önceki modellere kıyasla daha az izlenebilir olup olmadığını henüz bilmediğini, ancak teknolojinin daha yüksek seviyelere taşınmasının bu izlenebilirliği tamamen zayıflatmasından korktuğunu söyledi.
Uzun süredir yapay zekâ güvenliğini savunan Zvi Mowshowitz de bu yöntemlerin yoğun kullanımının, OpenAI ve Anthropic'in düşünce zincirlerini okunabilir ve gerçek davranışla uyumlu tutma çabalarına zarar verebileceğini söyledi. Yapay zekâ laboratuvarları arasında “dibe doğru bir yarış” olarak adlandırdığı durumu önlemek için yasalara ihtiyaç duyulabileceği ihtimalini gündeme getirdi.
OpenAI'ın tutumu ve şu anda bilinen sınırlar
Mevcut bilgiler, Astra'nın teknolojiyi sınırlı biçimde kullanacağını ve düşünce zincirinin okunabilir kalmasının beklendiğini gösteriyor. OpenAI ayrıca modelin tamamen anlaşılmaz bir düzene veya bazen “sinirsel dil” (neuralese) olarak adlandırılan bir biçime geçeceği imasını reddetti.
OpenAI'ın baş bilim insanı Jakub Pachocki, X platformundaki bir paylaşımında şirketin ilk akıl yürütme modellerinden bu yana düşünce zincirinin izlenebilirliğini korumak ve onu kullanmak için çalıştığını, bu hedefin mevcut araştırma programının temel eksenlerinden biri olduğunu doğruladı. OpenAI ayrıca gelecekteki güvenlik planları kapsamında düşünce zincirlerinin daha kapsamlı biçimde izlenmesine yönelik planlarını da duyurmuştu.
Hangi noktalar hâlâ belirsiz?
Redwood Research'in baş bilim insanı Ryan Greenblatt, opak akıl yürütmenin geleneksel düşünce zincirine dayalı akıl yürütmeden daha hızlı yaygınlaşabileceğini ve sonunda düşünme sürecinin çoğunun görünmez “gizli alana” aktarılabileceğini düşünüyor. The Information daha sonra Anthropic ile Google DeepMind'ın da teknolojiyi görüştüğünü bildirdi; bu da konunun Astra modelini aşarak daha geniş bir araştırma eğilimine dönüşebileceğine işaret ediyor.
Ancak kaynak, Astra'nın düşünce zincirini tamamen gizleyeceğini kanıtlamıyor ve izlenebilirliğin ne ölçüde azalacağını gösteren belirli ölçümler sunmuyor. Bu nedenle şu anda kesinleşen değişiklik, güvenlik araçları hakkında sorular doğuran yeni bir teknolojinin ortaya çıkmasıdır; bu araçların başarısız olduğunun kanıtlanması değil. Gelişmenin pratik önemini, opak yinelemenin ne ölçüde kullanılacağı ve OpenAI ile diğer laboratuvarların geleneksel kayıtlar için alternatif veya tamamlayıcı izleme yöntemleri sunup sunamayacağı belirleyecek.