OpenAI, şirketin henüz kamu kullanımına sunmadığı dahili bir yapay zekâ modeli tarafından üretilen 722 matematik çalışmasından oluşan bir koleksiyonu GitHub'da yayımladı. Koleksiyon, aralarında çözümü uzun süredir beklenen açık problemlerin ele alınmasına yönelik girişimlerin de bulunduğu 372 sonuç ailesini kapsıyor. Bu değerlendirme, bağımsız Advisory Group on Mathematics and Artificial Intelligence (AGMAI) grubuna göre yapıldı.
Ancak bu çalışmaların yayımlanması, bunların nihai matematiksel başarılar olarak kabul edildiği anlamına gelmiyor. OpenAI, sonuçların farklı doğrulama aşamalarında bulunduğunu ve bazı gayriresmî çalışmaların hatalar içerebileceğini belirtiyor. Tüm çalışmaların matematik topluluğu tarafından incelenmesi ve olağan akademik kanallar aracılığıyla doğrulanması gerekiyor.
Yaklaşık 4 bin problemden 722 çalışmaya
Model, değerlendirme sürecinde yaklaşık 4 bin matematik problemi üzerinde test edildi. OpenAI, sonuçları önem düzeyine göre filtreledikten sonra 372 aile ve 722 çalışmadan oluşan yayımlanmış koleksiyonu seçti. Şirket, tek bir sonucun üretilmesinin ortalama olarak ChatGPT Pro kullanıcılarına sunulan düşünme kapasitesinin yaklaşık üç saatine eşdeğer hesaplama gücü gerektirdiğini söylüyor.
İncelenebilirliği artırmak için OpenAI, 10 problem hakkında akıl yürütme sürecinin kısa özetlerini, kullanılan hesaplama gücüne ilişkin tahminleri ve denenen problem sayısını içeren ek veriler yayımladı. Örnekler, π sayısının irrasyonelliğinin ölçüsü, Mahler varsayımları, Kaplansky'nin doğrudan sonluluk varsayımı ve üç boyutlu göreli Vlasov-Maxwell sistemi de dahil olmak üzere farklı alanlara dağılıyor.
Lean kullanılarak doğrulama kapsamlı değil
Yayımlanan ispatların önemli bir bölümü, bilgisayarın ispatın mantıksal tutarlılığını test etmesini sağlayan matematiksel bir doğrulama sistemi olan Lean kullanılarak incelendi. Bununla birlikte, koleksiyondaki tüm çalışmalar şu ana kadar Lean aracılığıyla resmî doğrulamaya sahip değil.
OpenAI, resmî doğrulama süreçleri tamamlandıkça GitHub deposunu güncellemeyi planlıyor. Şirket, sonuçların çoğunun standartlaştırılmış bir prosedürle üretildiğini, ancak istisnaların bulunduğunu belirtiyor. Riemann zeta fonksiyonunun sıfırlarının bulunmadığı bölgeyle ilgili çalışmalardan biri farklı bir yöntemle elde edildi; ayrıca okunabilirliği artırmak amacıyla metni bir insan tarafından düzenlendi.
Bu haber neden önemli?
Koleksiyonun temel değeri yalnızca çalışma sayısında değil, incelenebilir matematiksel sonuçlar üretmeye yönelik yeni bir yöntemin test edilmesinde yatıyor. Dosyaların, hesaplama maliyeti verilerinin, akıl yürütme özetlerinin ve kısmi otomatik doğrulamanın erişime açılması, araştırmacılara modelin yeniden incelenebilir keşifler mi yoksa yalnızca ikna edici görünen metinler mi ürettiğini değerlendirmek için ihtiyaç duydukları unsurları sağlıyor.
Buna karşılık, açık sınırlamalar var: doğrulama tamamlanmış değil, insan ve akademik incelemeler sona ermedi ve modelin sonuçları henüz araştırmacıların kullanımına açık bir sistemi ya da kamuya sunulmuş bir ürünü temsil etmiyor. AGMAI, yapay zekâ şirketlerini matematiksel sonuçları akademik kanallar aracılığıyla yayımlamaya, kullanılan modelleri, maliyeti ve yöntemleri açıklamaya ve keşifleri yalnızca pazarlama aracına dönüştürmemeye çağırıyor.
OpenAI ayrıca yapay zekâ tarafından üretilen önemli sonuçları anlamak amacıyla atölyeleri, konferansları ve özel programları finanse edeceğini, bununla eş zamanlı olarak dahili modeli sorumlu bir şekilde erişime açma çalışmalarını sürdüreceğini duyurdu. Bu nedenle mevcut koleksiyon, otomatik olarak üretilen bilimsel sonuçların nasıl belgeleneceğine ilişkin deneysel bir adımı temsil ediyor; modelin matematiksel kapasitesi hakkında nihai bir hüküm oluşturmuyor.