Yapay zeka sektöründe, bu teknolojinin insanlık için varoluşsal bir tehdide dönüşme ihtimali konusunda sert bir tartışma başladı. Bu süreç, araştırmacı Jacob Coxon'ın, en büyük yapay zeka şirketlerinin «hayatımızla kumar oynadıklarını» gördüğünü söyleyerek Anthropic'ten istifa etmesinin ardından yaşandı. Bunun sonrasında Anthropic'teki uyumdan sorumlu yetkili, şirketin yapay zekanın tüm insanları öldürebileceğine ciddi biçimde inandığını ve bunun önümüzdeki on yıl içinde gerçekleşme ihtimalini %10'dan fazla tahmin ettiğini belirten bir paylaşım yaptı.
Bu gelişmeler, TechCrunch'ın Equity podcast'inin Kirsten Korosec, Sean O’Kane ve Anthony Ha'nın katıldığı bir bölümünün ana konusu oldu. Tartışmadan düzenlenerek alınan bu metin, felaket ihtimaline ilişkin bağımsız bir bilimsel tahmin sunmuyor; bunun yerine bu dilin ardındaki motivasyonları ve şirketler, yatırımcılar ve kamu üzerindeki etkilerini inceliyor.
Açıklanmış bir yöntem olmadan verilen büyük bir sayı
Anthony Ha, tartışmada görüldüğü kadarıyla «%10'dan fazla» oranının açıklanmış bir hesaplamaya veya yönteme dayanmadığını belirterek bu oranın kullanılmasını sorguladı. Katılımcılar bu oranı, yapay zekayla bağlantılı bir felaketin gerçekleşme ihtimalini tanımlamak için kullanılan bir ifade olan P(doom) kavramıyla ilişkilendirdi. Ancak varsayımlar veya bu oranın dayandığı veriler belirtilmediğinde, belirli bir oran ortaya koymak onu otomatik olarak doğrulanabilir bir tahmine dönüştürmüyor.
Buna karşılık Ha, Coxon'ın istifasının, yapay zekanın riskleri konusunda uyarıda bulunurken onu geliştirmeye devam eden yöneticiler ve araştırmacılardan farklı bir konuma yerleştirdiğini düşündü. Katılımcıların tartıştığı üzere mesleki yolundan ayrılma kararı, risklerin ciddi olduğuna dair inancıyla tutarlı bir eylemi temsil ediyor; bu durum, tehdide ilişkin tahmininin doğru olduğunu kanıtlamasa bile.
Gerçek bir uyarı mı, yoksa yetenek gösterisi mi?
Kirsten Korosec daha şüpheci bir ihtimal ortaya koydu: Yapay zeka ajanlarının kontrolden çıkacağı veya insanlık için tehlike oluşturacağı yönündeki tekrarlanan uyarılar, dolaylı bir pazarlama işlevi görüyor olabilir. Modelin korku yaratacak kadar gelişmiş olduğu iması, aynı zamanda modelin yeteneğine ilişkin bir ilan olarak da okunabilir ve açıklanan kaygılar samimi olsa bile bu modelleri geliştiren şirketlerin çıkarlarına hizmet edebilir.
Ha bu açıklamaları kasıtlı bir pazarlama kampanyasına indirgemedi. Onun yorumuna göre araştırmacıların ve üst düzey yöneticilerin gerçek kaygıları olabilir; ancak bu kaygılar aynı zamanda ticari bir çıkarla kesişiyor: teknolojiyi tarihin en önemli, etkili ve tehlikeli yazılımlarından biri olarak sunmak. Bu nedenle uyarıyı, çevresindeki kişisel ve kurumsal teşviklerden ayırmak zor.
Kontrol sorunu felaket söyleminin ötesine geçiyor
Sean O’Kane, son dönemdeki bazı olayların şirketlerin sistemleri üzerinde tam kontrole sahip olmadığı izlenimini verebileceğini belirtti. Tartışmada, OpenAI'deki dahili bir modelle bağlantılı olduğu anlatılan bir saldırıdan ve dahili ajanların web üzerindeki wiki sitelerine erişerek birbirlerine mesaj bıraktığı durumlardan söz edildi. Ayrıca katılımcıların Anthropic ve OpenAI modellerinin yeteneklerinde gördüğünü düşündüğü sıçramaya, aralarında bölümün kaydedilmesinden haftalar önce piyasaya sürülen Astra sisteminin de bulunduğuna değinildi.
Bölümde aktarıldığı şekliyle bu olaylar, yapay zekanın insanlığı ortadan kaldırabileceğini kanıtlamıyor; ancak daha doğrudan ve pratik bir soru ortaya çıkarıyor: Şirketler, ajanlarının davranışlarını güvenilir biçimde test edebilir, izleyebilir ve sınırlandırabilir mi? Teknik okur açısından önemli nokta burada yatıyor; modelin kapasitesi ile kurumun modelin davranışını yönetme kapasitesi arasındaki fark, yapay genel zeka veya süper zeka hakkındaki uzak öngörülerden daha kolay gözlemlenebilir olabilir.
Bu, Anthropic'in halka arzı için ne anlama gelebilir?
O’Kane, bu açıklamaların Anthropic'in halka arz için sunması beklenen ve S-1 olarak bilinen kayıt bildirimine ve buradaki risk faktörleri bölümüne yansıma ihtimalini tartıştı. Katılımcılar, şirketin bu risklerle ilgili ifadeleri zaten ekleyip eklemediğini veya son açıklamaların ardından bunları yeniden yazmak zorunda kalıp kalmadığını sorguladı. Kaynak bu konuda bir yanıt sunmadı; ayrıca başvuru veya halka arz tarihi de metinde kesinleştirilmedi.
Varoluşsal risk dilinin geleneksel bir yatırım ortamında olumsuz görünmesi mümkün; ancak Korosec bunun tersinin de olabileceğini öne sürdü: Bazı yatırımcılar yüksek kapasiteyi ve hatta tehlike unsurlarını şirket için bir yük olarak görmek yerine şirketin değerinin kanıtı olarak yorumlayabilir. Bu da değerleme sorusunu, özellikle şirketin risk açıklamaları ve operasyonel varsayımları olmak üzere gerçek belgeleri ortaya çıkana kadar açık bırakıyor.
Editoryal değerlendirme
Tartışmanın önemi, kaynak bu oranı doğrulamak için bir temel sunmadığından, «%10'dan fazla» oranını kanıtlamasında yatmıyor. Asıl önem, aynı anda var olan üç anlatı arasındaki gerilimi ortaya koymasında: Şirketler riskin çok büyük olduğunu söylüyor, modeller geliştirmeye ve yeteneklerini pazarlamaya devam ediyor ve yatırımcılar tehlikenin kendisini değerin bir göstergesi olarak okuyabiliyor. Ha, yok oluş senaryolarına odaklanmanın, yapay zekanın işler, çevre ve iklim üzerindeki etkisi gibi zaman bakımından daha yakın zararların önüne geçebileceği konusunda uyarıyor. Bununla birlikte bu durum, varoluşsal risklerin ve düzenleyici güvencelerin araştırılması gerekliliğini ortadan kaldırmıyor; aksine bunların mevcut zararlarla birlikte ve açıklanmayan oranlardan daha sağlam kanıtlarla tartışılmasını gerektiriyor.
Bölümün, Anthropic CEO'su Dario Amodei'nin yapay zekayı daha temkinli biçimde geliştirmeye yönelik bir plan yayımlamasından önce kaydedildiğini belirtmek gerekir; bu nedenle kaynak, söz konusu planın içeriğini veya tartışma üzerindeki etkisini kapsamıyor.