Эксперимент, опубликованный в блоге Hugging Face, показывает, что обучение очень малых языковых моделей на огромных объёмах данных может привести к снижению производительности вместо её улучшения. В эксперименте с моделью, содержащей 0,9 миллиона параметров, показатель INT достиг пика при обучении на 20 миллиардах токенов — примерно 22 тысячи токенов на параметр, — а затем постепенно снизился до 3,31 при 180 миллиардах токенов, что на 27,3% ниже пикового значения.
Эксперимент провёл Banaxi из Banaxi-Tech; он был опубликован в виде статьи сообщества на Hugging Face 12 августа 2026 года. Материал посвящён практическому вопросу, с которым сталкиваются разработчики малых моделей: насколько можно повышать соотношение токенов к параметрам, прежде чем дополнительное обучение превратится во вредное переобучение?
Эксперимент с беспрецедентным соотношением обучения
В эксперименте использовалась чрезвычайно малая модель, состоящая из шести слоёв, со скрытой размерностью 96 и промежуточным размером блока SwiGLU 380, а также с GQA в конфигурации 6Q/2KV, словарём из 384 токенов и контекстом длиной 8 тысяч. Для двумерных параметров применялся оптимизатор Muon с максимальной скоростью обучения 7e-2, а для остальных параметров — AdamW с максимальной скоростью обучения 4e-3.
В процессе обучения было обработано 200 миллиардов токенов из наборов данных FineWeb-HQ и Cosmopedia v2. Это соответствует примерно 222 тысячам токенов на параметр, или почти 220-кратному превышению соотношения, связанного с правилом Chinchilla, — около 20 токенов на параметр. Логика эксперимента заключалась в том, что небольшой словарь из 384 токенов несёт меньше информации в каждом токене по сравнению с традиционным словарём из 32 тысяч токенов, а также оставляет относительно больше параметров для слоёв трансформера.
Контрольные точки оценивались с помощью стандартного набора Open SLM, включающего ARC-Easy, ARC-Challenge, HellaSwag и PIQA, а также ArithMark-2/3; затем результаты объединялись в показатель INT Index.
Пик при 20 миллиардах токенов, затем постоянное снижение
Показатель INT Index достиг максимального значения — 4,55 — на отметке 20 миллиардов токенов. После этого он снижался по мере продолжения обучения и достиг 3,31 при 180 миллиардах токенов. Согласно материалу, снижение продолжалось, несмотря на некоторый шум, и ни одна последующая точка не восстановила пиковый уровень.
Результаты отдельных тестов показывают ту же картину. При сравнении точки на 20 миллиардах токенов с точкой на 180 миллиардах результат ARC-Easy вырос с 26,98 до 28,32, однако показатели в трёх остальных тестах снизились: PIQA — с 53,54 до 52,07, ARC-Challenge — с 22,27 до 21,25, а HellaSwag — с 29,01 до 28,06. Среднее значение снизилось с 32,95 до 32,43.
Автор эксперимента не объяснил ухудшение прямым результатом снижения скорости обучения в последние 10% процесса. Была оценена точка примерно на 160 миллиардах токенов, то есть после 80% обучения, и она показала среднее значение 32,68 — ближе к итоговому результату на 180 миллиардах токенов, чем к пику производительности на 40 миллиардах, где среднее составляло 33,44. На этом основании источник считает, что большая часть ущерба была нанесена до этапа снижения скорости обучения, и сокращение графика косинусного затухания не решило бы проблему.
Сравнение с традиционным соотношением
В том же эксперименте использовалась контрольная точка, при которой модель обучалась на 18 миллионах токенов, что соответствует соотношению Chinchilla около 20 токенов на параметр. Тогда модель получила показатель INT 1,53, а её результаты в тестах были близки к уровню случайного угадывания: 26,64 в ARC-Easy, 49,78 в PIQA, 26,54 в ARC-Challenge и 24,88 в HellaSwag.
Это сравнение даёт следующую шкалу результатов в данном эксперименте:
- 20 токенов на параметр: 18 миллионов токенов и показатель INT 1,53, что указывает на недообучение.
- 22 тысячи токенов на параметр: 20 миллиардов токенов и показатель INT 4,55 — пиковая точка.
- 200 тысяч токенов на параметр: 180 миллиардов токенов и показатель INT 3,31, то есть примерно на 27% ниже пикового значения.
Предлагаемый практический диапазон
Материал не утверждает, что все высокие соотношения обучения вредны для малых моделей. В нём отмечается, что соотношения около 7 тысяч, 15 тысяч и 22 тысяч токенов на параметр хорошо работали в других моделях сообщества, включая TinyStories и малые модели на таблицах лидеров, размер которых составляет менее 3 миллионов параметров. В данном эксперименте точка отказа появилась после значительного превышения этого диапазона.
Результаты показывают быстрое восхождение от уровня 20 токенов на параметр к пику: показатель увеличивался примерно на 0,05 на каждый миллиард токенов между 10 и 20 миллиардами. Напротив, снижение было более медленным — около 0,008 на каждый миллиард токенов, — но продолжалось непрерывно после пикового значения.
На основании этого цикла обучения источник оценивает практически оптимальный с точки зрения вычислений диапазон для модели класса Pico размером примерно в миллион параметров в 22–30 тысяч токенов на параметр. Практическая рекомендация заключается в том, чтобы начинать обучение с небольшим бюджетом в пределах этого диапазона, а затем оценить модель, прежде чем принимать решение о продлении обучения. Слепое повышение соотношения до 200 тысяч токенов на параметр может потребовать многих часов работы графических процессоров и привести к созданию модели, которая будет хуже той, что была получена примерно при 20 тысячах токенов на параметр.