Yapay zekâ
Küçük Dil Modellerinin Aşırı Eğitilmesi, 20 Milyar Belirteçten Sonra Performansı Düşürüyor
Hugging Face'te yayımlanan bir deney, 0,9 milyon parametreli bir modelin performansının 20 milyar belirteç üzerinde eğitimle zirveye ulaştığını, ardından eğitim 180 milyar belirtece kadar sürdürüldükçe kademeli olarak gerilediğini gösteriyor. Bulgular, çok küçük sınıftaki modeller için parametre başına 22 bin ila 30 bin belirteç arasında pratik bir aralık önerirken, bütçeyi artırmadan önce değerlendirme yapılması gerektiğine işaret ediyor.
2026-08-12