Искусственный интеллект

Чрезмерное обучение малых языковых моделей ослабляет производительность после 20 миллиардов токенов

Опубликованный на Hugging Face эксперимент показывает, что модель с 0,9 миллиона параметров достигла пика производительности при обучении на 20 миллиардах токенов, после чего её показатели постепенно ухудшались по мере продолжения обучения до 180 миллиардов токенов. Результаты предполагают практический диапазон от 22 тысяч до 30 тысяч токенов на параметр для моделей очень малого класса, при этом перед увеличением бюджета необходимо проводить оценку.

2026-08-12
5 мин. чтения
6 просмотров
فريق تحرير certi.news
Чрезмерное обучение малых языковых моделей ослабляет производительность после 20 миллиардов токенов

Эксперимент, опубликованный в блоге Hugging Face, показывает, что обучение очень малых языковых моделей на огромных объёмах данных может привести к снижению производительности вместо её улучшения. В эксперименте с моделью, содержащей 0,9 миллиона параметров, показатель INT достиг пика при обучении на 20 миллиардах токенов — примерно 22 тысячи токенов на параметр, — а затем постепенно снизился до 3,31 при 180 миллиардах токенов, что на 27,3% ниже пикового значения.

Эксперимент провёл Banaxi из Banaxi-Tech; он был опубликован в виде статьи сообщества на Hugging Face 12 августа 2026 года. Материал посвящён практическому вопросу, с которым сталкиваются разработчики малых моделей: насколько можно повышать соотношение токенов к параметрам, прежде чем дополнительное обучение превратится во вредное переобучение?

Эксперимент с беспрецедентным соотношением обучения

В эксперименте использовалась чрезвычайно малая модель, состоящая из шести слоёв, со скрытой размерностью 96 и промежуточным размером блока SwiGLU 380, а также с GQA в конфигурации 6Q/2KV, словарём из 384 токенов и контекстом длиной 8 тысяч. Для двумерных параметров применялся оптимизатор Muon с максимальной скоростью обучения 7e-2, а для остальных параметров — AdamW с максимальной скоростью обучения 4e-3.

В процессе обучения было обработано 200 миллиардов токенов из наборов данных FineWeb-HQ и Cosmopedia v2. Это соответствует примерно 222 тысячам токенов на параметр, или почти 220-кратному превышению соотношения, связанного с правилом Chinchilla, — около 20 токенов на параметр. Логика эксперимента заключалась в том, что небольшой словарь из 384 токенов несёт меньше информации в каждом токене по сравнению с традиционным словарём из 32 тысяч токенов, а также оставляет относительно больше параметров для слоёв трансформера.

Контрольные точки оценивались с помощью стандартного набора Open SLM, включающего ARC-Easy, ARC-Challenge, HellaSwag и PIQA, а также ArithMark-2/3; затем результаты объединялись в показатель INT Index.

Пик при 20 миллиардах токенов, затем постоянное снижение

Показатель INT Index достиг максимального значения — 4,55 — на отметке 20 миллиардов токенов. После этого он снижался по мере продолжения обучения и достиг 3,31 при 180 миллиардах токенов. Согласно материалу, снижение продолжалось, несмотря на некоторый шум, и ни одна последующая точка не восстановила пиковый уровень.

Результаты отдельных тестов показывают ту же картину. При сравнении точки на 20 миллиардах токенов с точкой на 180 миллиардах результат ARC-Easy вырос с 26,98 до 28,32, однако показатели в трёх остальных тестах снизились: PIQA — с 53,54 до 52,07, ARC-Challenge — с 22,27 до 21,25, а HellaSwag — с 29,01 до 28,06. Среднее значение снизилось с 32,95 до 32,43.

Автор эксперимента не объяснил ухудшение прямым результатом снижения скорости обучения в последние 10% процесса. Была оценена точка примерно на 160 миллиардах токенов, то есть после 80% обучения, и она показала среднее значение 32,68 — ближе к итоговому результату на 180 миллиардах токенов, чем к пику производительности на 40 миллиардах, где среднее составляло 33,44. На этом основании источник считает, что большая часть ущерба была нанесена до этапа снижения скорости обучения, и сокращение графика косинусного затухания не решило бы проблему.

Сравнение с традиционным соотношением

В том же эксперименте использовалась контрольная точка, при которой модель обучалась на 18 миллионах токенов, что соответствует соотношению Chinchilla около 20 токенов на параметр. Тогда модель получила показатель INT 1,53, а её результаты в тестах были близки к уровню случайного угадывания: 26,64 в ARC-Easy, 49,78 в PIQA, 26,54 в ARC-Challenge и 24,88 в HellaSwag.

Это сравнение даёт следующую шкалу результатов в данном эксперименте:

  • 20 токенов на параметр: 18 миллионов токенов и показатель INT 1,53, что указывает на недообучение.
  • 22 тысячи токенов на параметр: 20 миллиардов токенов и показатель INT 4,55 — пиковая точка.
  • 200 тысяч токенов на параметр: 180 миллиардов токенов и показатель INT 3,31, то есть примерно на 27% ниже пикового значения.

Предлагаемый практический диапазон

Материал не утверждает, что все высокие соотношения обучения вредны для малых моделей. В нём отмечается, что соотношения около 7 тысяч, 15 тысяч и 22 тысяч токенов на параметр хорошо работали в других моделях сообщества, включая TinyStories и малые модели на таблицах лидеров, размер которых составляет менее 3 миллионов параметров. В данном эксперименте точка отказа появилась после значительного превышения этого диапазона.

Результаты показывают быстрое восхождение от уровня 20 токенов на параметр к пику: показатель увеличивался примерно на 0,05 на каждый миллиард токенов между 10 и 20 миллиардами. Напротив, снижение было более медленным — около 0,008 на каждый миллиард токенов, — но продолжалось непрерывно после пикового значения.

На основании этого цикла обучения источник оценивает практически оптимальный с точки зрения вычислений диапазон для модели класса Pico размером примерно в миллион параметров в 22–30 тысяч токенов на параметр. Практическая рекомендация заключается в том, чтобы начинать обучение с небольшим бюджетом в пределах этого диапазона, а затем оценить модель, прежде чем принимать решение о продлении обучения. Слепое повышение соотношения до 200 тысяч токенов на параметр может потребовать многих часов работы графических процессоров и привести к созданию модели, которая будет хуже той, что была получена примерно при 20 тысячах токенов на параметр.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости