Yapay zekâ

bartowski deneyi, imatrix verilerinin sınırlarını ve GGUF modellerinde çeşitliliğin önemini ortaya koyuyor

bartowski, llama.cpp üzerinden modelleri nicemlerken imatrix için kullanılan kalibrasyon verilerini kapsamlı biçimde test ediyor ve en büyük kazanımların düşük bit oranlarında, özellikle de çok uzmanlı MoE modellerinde görüldüğü sonucuna varıyor. Yeni dataset daha küçük ve daha odaklı; ancak araç kullanımına yönelik çeşitli metinleri ve biçimlendirilmiş konuşmaları bir araya getiriyor.

2026-08-14
6 dk okuma
8 görüntülenme
فريق تحرير certi.news
bartowski deneyi, imatrix verilerinin sınırlarını ve GGUF modellerinde çeşitliliğin önemini ortaya koyuyor

bartowski, GGUF modellerinde imatrix hesaplamak için kullanılan kalibrasyon verileri üzerine yeni bir deney yayımladı. Yeni dataset'in performansı iyileştirmek için “sihirli bir çözüm” olmadığını, ancak bazı durumlarda sınırlı ve önemli kazanımlar sağladığını ve nicemleme sırasında kullanılan metin türünün nihai modeli nasıl etkilediğine dair daha derin bir anlayış sunduğunu açıkladı. Deneyin sahibi bunun nihai sonuç olmadığını ve verileri güncellemeyi ve test etmeyi sürdürmeyi beklediğini söylüyor.

Deneyler, Fable iş birliğiyle ve LTT Labs tarafından sağlanan GPU kaynakları kullanılarak gerçekleştirildi. bartowski, kullanılan dosyaları; düzyazı metinleri ve konuşmalar için iki ayrı dosya ile metinlerin modelin özel konuşma şablonundan geçirildikten sonraki hâlleri de dâhil olmak üzere kamuya açık biçimde yayımladı. Ayrıca biçimlendirilmiş sürümün nasıl oluşturulduğunu açıklayan bir betik sundu ve Qwen dosyalarının, verilerin son kısmının model tarafından göz ardı edilmemesi için sonda <|endoftext|> dizeleri kasıtlı olarak yükseltilmiş şekilde sunulduğunu belirtti.

Nicemleme sürecinde imatrix ne işe yarar?

bartowski, llama.cpp'deki nicemleme algoritmasının ağırlık gruplarını daha düşük hassasiyetli temsillere dönüştürmekten kaynaklanan hatayı azaltmaya çalıştığını açıkladı. Bu ağırlıkların göreli önemini tahmin etmek için büyük miktarda metin modelden geçirilir, ardından giriş kanallarının aktivasyon ölçümleri ve daha kesin ifadeyle her tensöre ulaşan aktivasyonların kareleri toplamı toplanır.

Çok sayıda metin boyunca güçlü ve düzenli biçimde etkinleşen bir kanal, kendisiyle ilişkili ağırlıkların nihai sonuç açısından daha önemli olduğu kabul edilerek değerlendirilir. Nadiren etkinleşen bir kanal ise daha az önemli görünebilir; ancak verilerin onu harekete geçiren doğru metin türünü içermemiş olma ihtimali de vardır. Bu nedenle sonuç yalnızca corpus'un büyüklüğüne değil, çeşitliliğine ve modelin farklı bölümlerini çalıştırma kapasitesine de bağlıdır.

Testler yoğun ve çok uzmanlı modelleri kapsadı

Ekip şu yedi modeli test etti: gemma-4-E2B-it, Qwen3.5-4B, Qwen3.6-27B, Qwen3.6-35B-A3B, Mistral-Small-4-119B, Qwen3-Next-80B-A3B ve Qwen3.5-397B-A17B. Değerlendirme, bf16 ile KLD karşılaştırmasına, BFCL testine, özel hazırlanmış kısa testler grubuna ve MoE modellerinde uzman kapsamının incelenmesine odaklandı. Testlerin tamamını çalıştırmanın maliyeti nedeniyle daha derin doğrulama için MMLU-Pro ve GSM8K'den örnekler de kullanıldı.

Genel sonuç, verilerin ağırlık başına yaklaşık 4 bitin üzerindeki oranlarda beklenildiği kadar belirgin bir fark yaratmadığı yönündeydi. Bazı hipotezleri elemek için erken testlerde tamamen rastgele veriler kullanıldı; ancak Q4_0, IQ4_XS ve bunların üzerindeki seviyelerde farklar çoğu durumda sınırlı kaldı, çünkü bu seviyelerdeki nicemleme hataları görece küçüktür.

En büyük fark düşük seviyelerde, özellikle de MoE modellerindeki Q2_K'de görüldü. Qwen3.6-35B imatrix olmadan nicemlendiğinde BFCL performansı yaklaşık 28 puan düşerek yaklaşık %82'den %54'e indi. Bu testte en iyi ve en kötü corpus arasındaki fark da yaklaşık %10'a ulaştı. Buna karşılık IQ2_M ile kullanılan temiz verilerin çoğu birbirine yakındı ve farklar genellikle birkaç yüzde puanı aşmadı.

Konuşma biçimlendirmesi ve araç kullanımı neden önemlidir?

Deney, MoE modellerindeki zorluğun yalnızca dil çeşitliliği veya metin kalitesiyle değil, verilerin farklı uzmanları etkinleştirme kapasitesiyle de ilişkili olduğunu gösteriyor. Qwen3-Next-80B-A3B modelinde araç kullanımına özel İngilizce corpus'u, 3126 parça geçirildikten sonra bile 512 uzmandan 18'ini hiç etkinleştirmedi; bu miktar calibration_datav5.txt dosyasının uzunluğunun yaklaşık dört katına denk geliyor.

calibration_datav5.txt ile araç çağırma verileri birleştirildiğinde uzmanların tamamı kapsandı. Deneyler, çok dilli ve programlama içeriklerinin bu uzmanlardan bazılarını çalıştırmak için gereken başlıca unsurlar olduğunu ortaya koydu. Ayrıca chat template'e göre biçimlendirilmiş konuşmaların dâhil edilmesi, özellikle MoE modellerinde önemli görünüyordu; çünkü bazı uzmanlar yalnızca konuşmanın belirteçlerini ve yapısını gördüklerinde etkinleşebiliyor olabilir.

Pratikte bu, konuşmayı veya araç çağırmayı destekleyen bir model için imatrix hazırlanırken yalnızca rastgele düzyazı metinleriyle yetinilmemesi gerektiği anlamına gelir. Konuşma şablonunun veya araç örneklerinin bulunmaması, kalibrasyon sırasında bazı uzmanların daha az temsil edilmesine neden olabilir; bu durum daha sonra düşük nicemleme oranlarında performansa yansıyabilir.

Yeni sürüm nasıl oluşturuldu?

bartowski, hangi veri parçalarının uzmanları daha iyi etkinleştirdiğini belirlemek için parça düzeyinde bir analiz kullandı. Sonuçlar, bazı uzmanların yalnızca kod, Fransızca metinler, kurmaca edebiyat veya bilimsel materyaller gibi belirli içerik türleriyle ortaya çıktığını gösterdi. Bu nedenle testte kullanılan MoE modelleri genelinde uzman kapsamını en üst düzeye çıkarmak amacıyla çeşitli düzyazı metinleri bir araya getirildi.

Buna, interstellarninja/hermes_reasoning_tool_use kaynağından alınan araç çağırma amaçlı biçimlendirilmiş konuşmalar eklendi ve testlerde düzyazı ile konuşmalar arasında 2:3 oranı en iyi kombinasyon olarak kabul edildi. 400 ile 800 parça arasında değişen sürümler denendikten sonra nihai sürüm, aynı kalite temel alınarak oluşturulmuş olsa bile çok daha büyük sürümlerden daha iyi performans gösterdi. Yazar, büyük corpus içinde daha yaygın içeriğin daha az tekrarlanan önemli sinyalleri bastırabileceğini ilk açıklama olarak öne sürüyor.

Ayrıca yeni verilerin çok dilli kapsamı daraltmadığını söyledi; aksine düzyazı bölümünde Latin alfabesiyle yazılmış metinlerin payı azaldı. Bu da Latin dışı dillerin corpus içindeki payının v5 sürümüne kıyasla arttığı anlamına geliyor; ancak ek testlere hâlâ ihtiyaç olduğunu vurguladı.

v5 ve v6 karşılaştırması mutlak bir üstünlük göstermiyor

bartowski, Qwen3.8-27B oluşturulurken v5 ve v6 sürümlerini; wikitext, HuggingFaceH4/no_robots ve Salesforce/xlam-function-calling-60k üzerinde perplexity ve KLD kullanarak karşılaştırdı. Bu sayıları kesin kanıt olmaktan çok yaklaşık göstergeler olarak tanımlıyor; özellikle no_robots üzerinde bf16 için referans perplexity değeri 19.05 olduğundan. wikitext'te v6 ile ortalama KLD bazı seviyelerde iyileşti; örneğin Q2_K_L'de %2.6 ve IQ2_M'de %1.8 oranında. Ancak bazı seviyelerde geriledi; örneğin Q4_K_S'de %3.6 ve IQ2_S'de %3.1.

Bu karşılaştırma, yeni dataset'in kazanımlarının seçici olduğunu ve tüm nicemleme biçimleri veya tüm test grupları için genel bir yükseltme sunmadığını gösteriyor. Yazarın imatrix etkisinin düşük bit oranlarında ve işi çok sayıda uzman arasında dağıtmaya dayanan modellerde daha belirgin olduğu yönündeki sonucu da bunu doğruluyor.

Yazar ayrıca imatrix hesaplanırken 512 yerine 2048 uzunluğunda bağlam kullanmayı test etti; ancak sonuçlarda iyileşme gözlemlemedi, hatta birçok durumda uzman kapsamı geriledi. bf16 ve Q8_0'dan hesaplanan imatrix sonuçları arasındaki kosinüs benzerliği karşılaştırması da bazı aykırı değerler bulunmasına rağmen %99.99'un üzerinde benzerlik gösterdi.

Pratik sonuç, tek bir dataset'in her zaman daha iyi performans sağlayacağı değil; özellikle MoE modelleri düşük seviyelere nicemlenirken corpus seçiminin ayarlanması gereken bir faktör hâline geldiğidir. Yeni sürüm, dosyaları ve oluşturma yöntemiyle birlikte erişime açık durumda; bartowski ise Mistral ve Qwen3-Next-80B-A3B de dâhil olmak üzere başka modeller üzerinde test etmeyi sürdürüyor.

Haber kaynağı
Hugging Face Blog
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör