Yapay zekâ girişimi PrismML, Alibaba’nın açık kaynaklı Qwen3.8 27B modelini yalnızca 5,9 gigabayt boyutunda bir dosyaya sıkıştıran Bonsai 2 27B modelini piyasaya sürdü. Şirket, sıkıştırılmış modelin karşılaştırmalı testlerde orijinal modelin toplam puanlarının %98’ine ulaştığını ve bellek gereksinimlerini yaklaşık dokuz ila on kat azalttığını söylüyor.
Yeni boyut, modelin tamamen bulut sunucularına güvenmek yerine kişisel bir bilgisayarda ve belki de üst düzey bir akıllı telefonda çalıştırılmasını mümkün kılıyor. Ancak bu, her telefonun modeli pratikte çalıştırabileceği anlamına gelmiyor; kaynak, telefonlarla uyumluluğu olasılık çerçevesinde ele alıyor. Ayrıca gerçek performans, donanıma ve modelin çalıştırıldığı yazılım ortamına bağlı.
Sıkıştırma teknolojisi nasıl çalışıyor?
PrismML, üç değerli ağırlıklar olarak adlandırdığı yönteme dayanıyor. Modelin ağırlıkları, eğitim sırasında öğrendiği bilgilerin bir bölümünü depolayan değerlerdir ve şirketin açıklamasına göre genellikle her ağırlık için 16 bit gerektirir. Yeni yaklaşım ise her ağırlığı yalnızca üç değerden biriyle temsil ediyor: artı bir, eksi bir veya sıfır. Olası değerlerin sayısının azaltılması, modeli depolamak için gereken alanı büyük ölçüde düşürüyor.
Şirketin başında, sıkıştırma teknikleri konusunda uzman ve Caltech’te profesör olan Babak Hassibi bulunuyor; Ion Stoica ise şirkete danışmanlık yapıyor. Destekçileri arasında Khosla Ventures, Cerberus Capital ve Caltech yer alıyor. PrismML, 22,25 milyon dolar değerinde bir tohum yatırım turu topladı. Ayrıca büyük dil modellerini sıkıştırma alanında çalışan tek şirket değil; kaynak, bu alandaki rakiplerden biri olarak Multiverse Computing’e de işaret ediyor.
Önceki sürümden daha iyi sonuçlar
Bonsai 2, şirketin mart ayında piyasaya sürdüğü ve TechCrunch’ın şirketten aktardığına göre orijinal modelin puanlarının %95’ine ulaşan ilk Bonsai sürümüne kıyasla bir gelişme niteliğinde. PrismML, ilk sürümün 11 milyondan fazla kez indirildiğini, daha küçük modellerinin ise 2,6 milyon ek indirme kaydettiğini söylüyor.
Ancak %98 oranı, orijinal modelle tam bir eşleşme anlamına gelmiyor ve kalan farkın pratik kullanımlarda ortaya çıkmayacağını tek başına kanıtlamıyor. Hassibi, sıkıştırmanın muhtemelen performans üzerinde bir miktar etki bırakacağını kabul ediyor. Ayrıca karşılaştırmalı testler gerçek dünyadaki tüm görevleri yansıtmıyor ve modelin içinde çalıştığı yazılım ortamı da doğruluğunu etkiliyor.
Bu gelişme neden önemli?
PrismML, modelleri yeteneklerinin çoğunu koruyarak küçültmeye devam ederse çıkarım modellerini yerel olarak çalıştırmak daha uygulanabilir hâle gelebilir. Stoica’nın savına göre bu, verilerin buluta gönderilmesi yerine kullanıcının cihazında işlenmesini sağlayarak gizliliği destekleyebilir ve harici bağlantıya bağımlılığı azaltabilir. Ancak bu durum enerji tüketimi, tepki hızı ve cihaz uyumluluğuyla ilgili soruları henüz çözmüyor; modelin her senaryoda aynı performans düzeyini sunacağını da kanıtlamıyor.
Şirket, sıkıştırma teknolojisini çok daha büyük modellere uygulamayı planlıyor. Hassibi, gelecek sürümlerin önümüzdeki birkaç ay içinde birkaç yüz milyar parametre aralığında olabileceğini söyledi. Ona göre daha büyük modeller, sıkıştırma sürecine yetenekleri korumak için daha geniş bir alan sağlayabilir. Ancak bu hedef hâlâ geleceğe yönelik bir plan ve şu anda mevcut bir sonuç değil. Raporda ayrıca Apple ile görüşmelere dair söylentilere de yer verildi; ancak Hassibi bu konuda yorum yapmayı reddetti. Bu nedenle söz konusu durum açıklanmış bir ortaklık veya anlaşma olarak değerlendirilemez.