Reflection AI, şirketin ilk açık ağırlıklı yapay zekâ modeli olan Beam'i duyurdu. Model, programlama, akıl yürütme ve yapay zekâ ajanlarının yürüttüğü görevlere açıkça odaklanıyor. Model, seyrek Uzmanlar Karışımı (Sparse Mixture-of-Experts) mimarisine dayanıyor ve toplam 501 milyar parametre içeriyor; ancak her belirteç işlenirken bunların yalnızca 23 milyarı aktif oluyor.
Şirket, Beam'in web içeriğinden ve lisanslı özel veri kümelerinden alınan 23,8 trilyon belirteçle önceden eğitildiğini söylüyor. Model ayrıca, uzun belgeler ve görevlerle çalışmayı hedefleyen bir milyon belirteçlik bağlam penceresi sunuyor. Reflection AI, ön eğitimin yanı sıra modelin performansını iyileştirmek için geniş ölçekte pekiştirmeli öğrenmeden yararlandı.
Yoğun eğitim ve çıkarım maliyetine odaklanma
Pekiştirmeli öğrenme aşamasında şirket, dört hafta boyunca 10.500 Nvidia GB300 grafik işlem birimi çalıştırdı ve 100 milyondan fazla rollout üretti. Eğitim ve değerlendirmede kullanılan sandbox işlemlerinin sayısı yaklaşık 1,3 milyara ulaştı.
Reflection AI, Beam hakkındaki mesajının merkezine çıkarım verimliliğini yerleştiriyor. Şirketin testlerine göre model, ileri düzey akıl yürütme testlerinde Z.ai'ın GLM-5.2 modeline yakın performans sunarken çıkarım sırasında üç ila dört kat daha az hesaplama kapasitesi kullanıyor. Ancak bu sonuçlar henüz bağımsız doğrulamadan geçmedi. Şirket ayrıca Kimi K3 gibi daha büyük açık modellerin bazı durumlarda ham performansta Beam'i geride bıraktığını kabul ediyor.
Programlama sonuçları ve çıkarım çabasının kontrolü
Reflection AI, Beam'in SWE Bench Pro v2-Hard'da 77,2 puan, Terminal Bench v2.1'de 80,1 puan ve SWE Bench Verified'da 80,9 puan aldığını bildirdi. Şirket, modelin GLM-5.2 ile rekabet ettiğini ve bazı görevlerde daha büyük Qwen modellerine yaklaştığını söylüyor; ancak tüm testlerde rakiplerini geride bıraktığını iddia etmiyor.
Beam, kullanıcının akıl yürütmeye ayrılan hesaplama süresini belirlemesini sağlayan bir reasoning effort parametresi içeriyor. Düşük seviyeler daha düşük maliyetle daha kısa yanıtlar üretirken, yüksek seviyeler modelin karmaşık görevleri işlemek için daha fazla sayıda belirteç kullanmasına olanak tanıyor.
Pratikte ne değişiyor?
Bu tasarım, Beam'in değerinin yalnızca modelin büyüklüğüne veya en yüksek kıyaslama sonucuna değil, yanıt kalitesi ile yanıtı üretmek için kullanılan kaynaklar arasındaki dengeye de bağlı olduğu anlamına geliyor. Bu, programlama görevleri veya modele tekrar tekrar çağrı yapan ajanlar çalıştıran geliştiriciler ve kurumlar için yararlı olabilir. Ancak pratik fayda, bağımsız sonuçlarla, altyapı maliyetiyle ve ağırlıkların ve araçların erişime açılma koşullarıyla bağlantılı olmaya devam edecek.
Beam yalnızca metin tabanlı bir modeldir ve çok modlu değildir. Araçları kullanma ve web'e erişme imkânı verildiğinde model, farklı kaynaklarda arama yapabilir ve harici araçların sağladığı bilgilerden yararlanabilir. Reflection AI, modelin eğitim sırasında diğer dil modellerini kullanmayı ve web'e erişim sunulduğunda belgeleri okumak için OCR arayüzlerine başvurmayı öğrendiğini söylüyor.
Erişim ve daha geniş strateji
Şirket kurumları, geliştiricileri ve devlet kuruluşlarını hedefliyor ve Beam'i günlük iş yüklerinde kullanılabilecek pratik bir model olarak tanımlıyor. Bu plan, Reflection AI'ın kurumların kendi verileri üzerinde çalışan sistemleri özelleştirmesine ve bunları yerel olarak çalıştırmasına olanak tanıyan, «yapay zekâ fabrikaları» olarak adlandırdığı yapıları kurma yönündeki yaklaşımının bir parçasını oluşturuyor.
Reflection AI, 2024 yılında Google DeepMind'ın eski araştırmacıları tarafından kuruldu ve Nvidia, Sequoia Capital ve Lightspeed Venture Partners'ın katılımıyla yaklaşık 4,7 milyar dolar yatırım topladı. Şirketin son finansman turundaki para öncesi değerlemesi yaklaşık 25 milyar dolara ulaştı. Şirket, güvenlik testlerini ve nihai değerlendirmeleri tamamladıktan sonra Beam'in ağırlıklarını, teknik raporunu, model kartını ve geliştirici araçlarını ekim ayında yayımlamayı planlıyor.