Japon şirketi Preferred Networks (PFN), kendi dil modeli PLaMo’yu sıfırdan geliştirmeyi, yalnızca performans göstergelerinde Amerikan ve Çin modelleriyle rekabet etme girişimi olarak değil, modelin oluşturulmasındaki temel kararlar üzerinde kontrol sahibi olmanın bir yolu olarak ele alıyor. Şirketin büyük dil modeli geliştirme bölümünün başkanı 田中大輔’ye göre bu yaklaşımın önemi, PFN’nin başlangıçtan itibaren tasarımın, verilerin ve işleme mekanizmalarının belirlenmesine doğrudan katılmasıdır.
Bu açıklamalar, modellerin “yerel” olarak nitelendirilmesinin sınırları üzerine gerçekleştirilen bir tartışma kapsamında, 田中大輔 ve büyük dil modeli planlama bölümünün başkanı ve PreferredAI’den sorumlu ムジビヤ・アディヤン ile yapılan röportajda dile getirildi. Bu terimin ortak bir tanımı bulunmuyor; bazı şirketler dış kuruluşlar tarafından geliştirilen açık modelleri temel alıp bunlara Japonca ya da belirli alanlara odaklanan ek eğitimler uygularken, PFN PLaMo’yu “tamamen sıfırdan geliştirme” (Full Scratch) yöntemiyle oluşturmayı tercih etti.
Veriler üzerindeki kontrol yorumlanabilirliği artırıyor
PFN, kendi geliştirme yaklaşımı ile müşterilere karşı daha açık bir sorumluluk üstlenebilme yeteneği arasında bağlantı kuruyor. Pek çok açık modelde çıktıları etkileyen parametreler gibi bilgilerin yalnızca bir bölümü erişilebilirken, eğitim verileri ve geliştirme yöntemleri tamamen açıklanmıyor. Açık bir model ek verilerle yeniden eğitildiğinde, belirli bir davranışın ya da çıktılardaki bir sorunun kaynağını belirlemek daha da zorlaşıyor.
PLaMo örneğinde ise şirket, eğitimde kullanılan veri kümelerini seçebildiğini ve bunların özelliklerini daha kapsamlı biçimde bildiğini belirtiyor. Bu nokta, fikri mülkiyetle ilgilenen ve eğitim materyalleri arasında telif haklarını ihlal eden verilerin bulunma ihtimaliyle ilgili soruları yanıtlaması gereken şirketler açısından özellikle önem taşıyor. PFN ayrıca eğitim aşamalarına ilişkin bilgi sahibi olmanın, üretken modellerin bazı yönleri tamamen açıklanamazlığını korusa da hataların nedenlerini araştırmasına yardımcı olduğunu düşünüyor.
田中, halüsinasyonları örnek gösteriyor: PLaMo yanlış bir yanıt verirse şirket, sorunu veri kümesinin belirli bir bölümüyle ilişkilendirip düzeltmeye çalışabilir. Açık bir modelin üzerine kurulan bir modelde ise nedeni belirlemek her zaman mümkün olmayabilir.
Japoncaya odaklanan tasarım
PFN’ye göre sıfırdan geliştirmenin faydası şeffaflıkla sınırlı değil. Şirket PLaMo’yu Japon kültürüyle ve Japoncaya özgü özelliklerle ilişkili bilgileri dikkate alarak tasarladı ve metni modelin işleyebileceği birimlere dönüştüren Tokenizer adlı kendi dilsel çözümleyicisini geliştirdi.
PFN, bu çözümleyicinin Japonca işlenirken dış modellere ait çözümleyicilere kıyasla yaklaşık %20 ila %30 daha az token kullandığını söylüyor. Token sayısı işlemenin verimliliğini ve maliyetini etkiliyor. Bu nedenle şirket, bu noktadaki iyileştirmenin, genel yetenekleri yüksek modellerle rekabet ederken bile yerel modellere pratik bir avantaj sağlayabileceğini düşünüyor.
Eğitim döngüsünün tamamına sahip olmak, belirli hedeflerle bağlantılı veri kümeleri hazırlamayı da mümkün kılıyor. Bu, finans sektörü gibi alanlarda uzmanlaşmış modeller oluşturulurken yardımcı olabilir; zira belirli bir performansı artırmak için hangi tür verilere ihtiyaç duyulduğunu belirlemek kolaylaşır.
Egemenlik avantajına karşı geliştirme maliyeti
PFN, PLaMo’nun geliştirilmesini jeopolitik riskler ve yapay zekânın giderek altyapı olarak kullanılmaya başlanmasıyla ilgili daha geniş bir bağlam içinde değerlendiriyor. Şirket, ABD hükümetinin aldığı bir kararın Anthropic adlı Amerikan şirketinin Fable 5 ve Mythos 5 modellerine erişimi haziran ayında geçici olarak askıya almasına yol açtığına dikkat çekti ve bu tür gelişmelerin hizmetlerin uluslararası kararlardan ne ölçüde etkilendiğini gösterdiğini belirtti.
Ancak tamamen sıfırdan geliştirme, en ucuz ya da en hızlı seçenek değil. Açık bir modele ek eğitim uygulama yöntemine göre daha fazla zaman ve eğitim kaynağı gerektiriyor; ayrıca performans açısından en güncel açık modellere yetişmeyi zorlaştırabiliyor. Bu nedenle PFN iki yaklaşımı birlikte kullanma olasılığını dışlamıyor; bazı kullanım alanlarında yeniden eğitilmiş açık bir model yeterli olabilir ve şirket tıp alanında böyle bir kullanım örneğinin bulunduğunu belirtti.
PLaMo’dan yerel altyapıya
PFN, modellerini hem API üzerinden hem de müşterinin tesislerindeki yerel ortamlarda (On-Premises) sunuyor. Bu, verilerini yönetmeye öncelik veren kurumlar için uygun bir seçenek oluşturuyor. Şirket, PLaMo’yu harici araçlara ve bilgisayarlarda bulunan uygulamalara bağlayarak kullanımını güçlendirmek, ayrıca uzun görevleri bağımsız biçimde yerine getirme ve karmaşık Japonca talimatlarla çalışma yeteneklerini geliştirmek istiyor.
Seride, şirketin yüksek Japonca performansı ile düşük maliyeti bir araya getirmeye odaklandığı PLaMo 3.0 Prime modelinin yanı sıra çeviriye özel PLaMo翻訳 modeli de bulunuyor. 田中, hedefin yalnızca akıl yürütme kapasitesini artırmak değil, Japon kullanıcılar için maliyet açısından en verimli performansı sunan bir model ya da hizmete ulaşmak olduğunu söylüyor.
Hesaplama altyapısının kendisi de hâlâ bir zorluk. PFN, yalnızca yerel kaynaklar güncel eğitim gereksinimleriyle rekabet etmeye yetmediği için Japonya içinde ve dışında hesaplama kaynakları kullanıyor. Buna paralel olarak şirket, yapay zekâ için özel çipler geliştirmeye çalışıyor ve gelecekte hesaplama kaynaklarının yerelleştirilmesini destekleyebilecek dikey entegrasyon sunuyor.
PFN temmuz ayında, büyük Japon şirketlerinin yatırımlarıyla desteklenen Japon yapay zekâ şirketi Noetra ile iş birliğini duyurdu. Modelin geliştirilmesine PFN’nin CEO’su 大輔岡野原 liderlik edecek; 田中 ve bazı mühendisler Noetra’ya gönderilecek. Projenin ilk hedefi, yerel işletmecilere ait bir hesaplama altyapısını kullanarak robotları bağımsız biçimde çalıştırabilecek fiziksel bir yapay zekâ modeli oluşturmak. 田中’nın tahminine göre “gerçekten yerel” olarak nitelendirilebilecek bir model 2027’nin başlarında ortaya çıkabilir.
PFN’nin deneyiminin ortaya koyduğu üzere, bir modelin “yerelliği” yalnızca performansa göre verilen bir hüküm değil. Bu, bir yanda veriler ve tasarım üzerindeki kontrol, hataları yorumlayabilme ve dil verimliliği ile diğer yanda eğitim maliyeti ve en yeni yeteneklere ulaşma hızı arasındaki bir tercihtir. Bu nedenle şirketin pratik stratejisi, sıfırdan geliştirmeyi tek çözüm olarak görmek yerine her kullanım durumu için uygun bağımsızlık düzeyini seçmeye daha yakın görünüyor.