人工智能

对小型语言模型的极度过度训练会在200亿个令牌后削弱性能

Hugging Face上发表的一项实验显示,一个包含90万参数的模型在接受200亿个令牌训练时性能达到峰值,随后随着训练持续至1800亿个令牌而逐渐下降。研究结果为超小型模型提出了一个每个参数约2.2万至3万个令牌的实际范围,同时强调在增加预算前必须进行评估。

2026-08-12
1 分钟阅读
6 浏览量
فريق تحرير certi.news
对小型语言模型的极度过度训练会在200亿个令牌后削弱性能

Hugging Face博客发表的一项实验表明,对超小型语言模型使用海量数据进行训练,可能会导致性能下降,而不是带来提升。在一个包含90万参数的模型上进行的实验中,模型在接受200亿个令牌训练时INT指标达到峰值,相当于每个参数约2.2万个令牌;随后该指标逐渐下降,在1800亿个令牌时降至3.31,较峰值下降27.3%。

该实验由Banaxi-Tech的Banaxi开展,并于2026年8月12日以Hugging Face社区文章的形式发布。文章聚焦于小型模型开发者面临的一个实际问题:在额外训练转变为有害的过度训练之前,每个参数对应的令牌数量究竟可以提高到多大?

前所未有的训练比例实验

该实验采用了一个极小型模型,由6层组成,隐藏维度为96,中间规模为380的SwiGLU模块,此外还使用了采用6Q/2KV配置的GQA、包含384个令牌的词汇表以及长度为8000的上下文。二维参数使用Muon优化器,最大学习率为7e-2;其余参数使用AdamW,最大学习率为4e-3。

训练过程处理了FineWeb-HQ和Cosmopedia v2两个数据集中的2000亿个令牌,相当于每个参数约22.2万个令牌,或约为Chinchilla规则所对应比例的220倍;Chinchilla规则约为每个参数20个令牌。实验的逻辑是,规模仅为384个令牌的小型词汇表相较于由3.2万个令牌组成的传统词汇表,每个令牌承载的信息更少,同时也会相对留下更多参数供Transformer层使用。

检查点使用标准Open SLM套件进行评估,该套件包括ARC-Easy、ARC-Challenge、HellaSwag和PIQA,以及ArithMark-2/3,随后将结果汇总为INT Index指标。

在200亿个令牌处达到峰值,随后持续下降

INT Index在200亿个令牌这一节点达到最高值4.55。此后,随着训练继续进行,该指标下降,在1800亿个令牌时降至3.31。根据文章,这一下降趋势虽伴有一定噪声,但持续存在,之后的任何节点都未恢复到峰值水平。

单项测试结果也呈现出相同的情况。比较200亿个令牌节点与1800亿个令牌节点时,ARC-Easy得分从26.98升至28.32,但其他三项测试的结果均下降:PIQA从53.54降至52.07,ARC-Challenge从22.27降至21.25,HellaSwag从29.01降至28.06。平均分从32.95降至32.43。

实验作者并未将下降解释为训练最后10%阶段降低学习率的直接结果。研究人员评估了约1600亿个令牌这一节点,即训练进度的80%,其平均分为32.68;这一结果更接近1800亿个令牌时的最终结果,而不是40亿个令牌时的性能峰值,后者的平均分为33.44。因此,消息来源认为,大部分损害在降低学习率阶段之前就已经发生,缩短正弦衰减计划也无法解决这一问题。

与传统比例的比较

该实验还设置了一个控制节点,即在模型接受1800万个令牌训练时进行评估,这相当于接近Chinchilla比例的每个参数20个令牌。此时模型的INT指标为1.53,各项测试表现接近随机水平:ARC-Easy为26.64,PIQA为49.78,ARC-Challenge为26.54,HellaSwag为24.88。

这项比较为本次实验中的结果提供了一个渐进范围:

  • 每个参数20个令牌:1800万个令牌,INT指标为1.53,表明训练不足。
  • 每个参数2.2万个令牌:200亿个令牌,INT指标为4.55,即峰值节点。
  • 每个参数20万个令牌:1800亿个令牌,INT指标为3.31,比峰值低约27%。

建议的实际范围

文章并未得出所有较高训练比例都会损害小型模型的结论。文章指出,在其他社区模型中,每个参数约7000、1.5万和2.2万个令牌的比例运行良好,其中包括TinyStories,以及参数量少于300万的排行榜小型模型。而本次实验中的失败节点是在远远超过这一范围后出现的。

结果显示,从每个参数20个令牌的水平上升至峰值的过程很快:在100亿至200亿个令牌之间,每增加10亿个令牌,指标约提升0.05。相比之下,下降速度较慢,每增加10亿个令牌约下降0.008,但在峰值节点之后持续不断。

根据这一轮训练,消息来源估计,对于参数量约为100万、属于Pico类别的模型,从计算角度看,最佳实际范围位于每个参数2.2万至3万个令牌之间。实际建议是,先在这一范围内使用较小预算开始训练,然后评估模型,再决定是否延长训练。若盲目将比例提高到每个参数20万个令牌,可能会消耗大量GPU运行时间,却生成一个比在每个参数约2万个令牌时得到的模型更差的模型。

新闻来源
Hugging Face Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻