Yapay zekâ

Küçük Dil Modellerinin Aşırı Eğitilmesi, 20 Milyar Belirteçten Sonra Performansı Düşürüyor

Hugging Face'te yayımlanan bir deney, 0,9 milyon parametreli bir modelin performansının 20 milyar belirteç üzerinde eğitimle zirveye ulaştığını, ardından eğitim 180 milyar belirtece kadar sürdürüldükçe kademeli olarak gerilediğini gösteriyor. Bulgular, çok küçük sınıftaki modeller için parametre başına 22 bin ila 30 bin belirteç arasında pratik bir aralık önerirken, bütçeyi artırmadan önce değerlendirme yapılması gerektiğine işaret ediyor.

2026-08-12
5 dk okuma
6 görüntülenme
فريق تحرير certi.news
Küçük Dil Modellerinin Aşırı Eğitilmesi, 20 Milyar Belirteçten Sonra Performansı Düşürüyor

Hugging Face blogunda yayımlanan bir deney, çok küçük dil modellerini devasa veri miktarları üzerinde eğitmenin performansı artırmak yerine düşürebileceğini gösteriyor. 0,9 milyon parametreli bir model üzerinde yapılan deneyde INT skoru, model 20 milyar belirteç üzerinde eğitildiğinde, yani parametre başına yaklaşık 22 bin belirteç oranında zirveye ulaştı; ardından 180 milyar belirteçte 3,31'e ulaşana kadar kademeli olarak geriledi. Bu, zirveye kıyasla %27,3'lük bir düşüş anlamına geliyor.

Deneyi Banaxi-Tech'ten Banaxi gerçekleştirdi ve çalışma 12 Ağustos 2026'da Hugging Face'te topluluk makalesi olarak yayımlandı. Metin, küçük model geliştiricilerinin karşılaştığı pratik bir soruya odaklanıyor: Ek eğitim zararlı bir aşırı eğitime dönüşmeden önce belirteç-parametre oranı ne kadar artırılabilir?

Eşi görülmemiş bir eğitim oranıyla deney

Deney, altı katmandan oluşan son derece küçük bir modelle gerçekleştirildi. Modelin gizli boyutu 96, orta büyüklükteki SwiGLU birimi 380 ve yapılandırması 6Q/2KV olan GQA kullanıldı; ayrıca 384 belirteçlik bir söz dağarcığı ve 8 bin uzunluğunda bağlam kullanıldı. İki boyutlu parametreler için azami öğrenme oranı 7e-2 olan Muon optimizatörü, geri kalan parametreler içinse azami öğrenme oranı 4e-3 olan AdamW kullanıldı.

Eğitimde FineWeb-HQ ve Cosmopedia v2 veri kümelerinden 200 milyar belirteç işlendi. Bu, parametre başına yaklaşık 222 bin belirtece veya parametre başına yaklaşık 20 belirteç olan Chinchilla kuralıyla ilişkili oranın yaklaşık 220 katına karşılık geliyor. Deneyin mantığı, 384 belirteçlik küçük söz dağarcığının 32 bin belirteçlik geleneksel bir söz dağarcığına kıyasla her belirteçte daha az bilgi taşıması ve dönüştürücü katmanlarına nispeten daha fazla parametre bırakmasıydı.

Kontrol noktaları, ARC-Easy, ARC-Challenge, HellaSwag ve PIQA'nın yanı sıra ArithMark-2/3'ü içeren standart Open SLM paketi kullanılarak değerlendirildi; ardından sonuçlar INT Index'te birleştirildi.

Zirve 20 milyar belirteçte, ardından sürekli düşüş

INT Index, 20 milyar belirteç noktasında 4,55 ile en yüksek değerine ulaştı. Sonrasında eğitim sürdükçe geriledi ve 180 milyar belirteçte 3,31'e düştü. Metne göre bu düşüş, bir miktar gürültüyle birlikte sürekliydi ve sonraki hiçbir nokta zirve seviyesini yeniden yakalayamadı.

Bireysel testlerin sonuçları da aynı tabloyu ortaya koyuyor. 20 milyar belirteç noktası 180 milyar belirteç noktasıyla karşılaştırıldığında ARC-Easy skoru 26,98'den 28,32'ye yükseldi; ancak diğer üç testte sonuçlar düştü: PIQA 53,54'ten 52,07'ye, ARC-Challenge 22,27'den 21,25'e ve HellaSwag 29,01'den 28,06'ya geriledi. Ortalama ise 32,95'ten 32,43'e düştü.

Deneyin yazarı, düşüşü eğitimin son %10'unda öğrenme oranının azaltılmasının doğrudan sonucu olarak açıklamadı. Eğitimin yaklaşık %80'ine, yani 160 milyar belirtece denk gelen bir nokta değerlendirildi ve 32,68 ortalama skor elde edildi. Bu değer, ortalamanın 33,44 olduğu 40 milyar belirteçteki performans zirvesinden ziyade 180 milyar belirteçteki nihai sonuca daha yakındı. Buna dayanarak kaynak, zararın çoğunun öğrenme oranı azaltılmadan önce meydana geldiğini ve sinüs azalım takviminin kısaltılmasının sorunu çözmeyeceğini düşünüyor.

Geleneksel oranla karşılaştırma

Aynı deneyde, modelin parametre başına yaklaşık 20 belirteçlik Chinchilla oranına karşılık gelen 18 milyon belirteç üzerinde eğitildiği bir kontrol noktası da kullanıldı. Model bu noktada 1,53'lük INT skoru elde etti ve testlerde şansa yakın bir performans sergiledi: ARC-Easy'de 26,64, PIQA'da 49,78, ARC-Challenge'da 26,54 ve HellaSwag'de 24,88.

Bu karşılaştırma, deneydeki sonuçlar için kademeli bir aralık sunuyor:

  • Parametre başına 20 belirteç: 18 milyon belirteç ve 1,53 INT skoru; bu, yetersiz eğitime işaret ediyor.
  • Parametre başına 22 bin belirteç: 20 milyar belirteç ve 4,55 INT skoru; bu, zirve noktası.
  • Parametre başına 200 bin belirteç: 180 milyar belirteç ve 3,31 INT skoru; bu, zirveden yaklaşık %27 daha düşük.

Önerilen pratik aralık

Metin, yüksek eğitim oranlarının tamamının küçük modellere zarar verdiği sonucuna varmıyor. Yaklaşık 7 bin, 15 bin ve 22 bin belirteç/parametre oranlarının TinyStories ve 3 milyondan az parametreye sahip liderlik tablolarındaki küçük modeller de dahil olmak üzere diğer topluluk modellerinde iyi çalıştığına işaret ediyor. Bu deneydeki başarısızlık noktası ise bu aralığın çok ötesine geçildikten sonra ortaya çıktı.

Sonuçlar, parametre başına 20 belirteç seviyesinden zirveye kadar hızlı bir yükseliş gösteriyor: 10 milyar ile 20 milyar belirteç arasında skor her milyar belirteçte yaklaşık 0,05 arttı. Buna karşılık düşüş daha yavaştı; her milyar belirteçte yaklaşık 0,008 seviyesindeydi, ancak zirve noktasından sonra kesintisiz biçimde sürdü.

Bu eğitim turuna dayanarak kaynak, yaklaşık 1 milyon parametre büyüklüğündeki Pico sınıfı bir model için hesaplama açısından en uygun pratik aralığın parametre başına 22 bin ila 30 bin belirteç arasında olduğunu tahmin ediyor. Pratik öneri, bu aralık içinde küçük bir bütçeyle eğitime başlamak ve eğitimi uzatma kararı vermeden önce modeli değerlendirmek. Oranı körü körüne parametre başına 200 bin belirtece çıkarmak, parametre başına yaklaşık 20 bin belirteçte elde edilenden daha kötü bir model üretmek için GPU'ların çalıştırılmasında çok sayıda saat harcanmasına yol açabilir.

Haber kaynağı
Hugging Face Blog
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör