Inteligencia artificial

La formación excesiva extrema de modelos lingüísticos pequeños debilita el rendimiento después de 20.000 millones de tokens

Un experimento publicado en Hugging Face muestra que un modelo con 0,9 millones de parámetros alcanzó su máximo rendimiento al entrenarse con 20.000 millones de tokens, antes de deteriorarse gradualmente mientras el entrenamiento continuaba hasta los 180.000 millones de tokens. Los resultados sugieren un rango práctico de entre 22.000 y 30.000 tokens por parámetro para modelos de la categoría ultrapequeña, junto con la necesidad de realizar una evaluación antes de aumentar el presupuesto.

2026-08-12
6 min de lectura
6 visitas
فريق تحرير certi.news
La formación excesiva extrema de modelos lingüísticos pequeños debilita el rendimiento después de 20.000 millones de tokens

Un experimento publicado en el blog de Hugging Face indica que entrenar modelos lingüísticos ultrapequeños con cantidades masivas de datos puede provocar un deterioro del rendimiento en lugar de mejorarlo. En un experimento con un modelo de 0,9 millones de parámetros, el índice INT alcanzó su máximo al entrenar el modelo con 20.000 millones de tokens, es decir, aproximadamente 22.000 tokens por parámetro, y después descendió gradualmente hasta llegar a 3,31 con 180.000 millones de tokens, una disminución del 27,3 % respecto al máximo.

El experimento fue realizado por Banaxi, de Banaxi-Tech, y se publicó como un artículo de la comunidad en Hugging Face el 12 de agosto de 2026. El material se centra en una pregunta práctica a la que se enfrentan los desarrolladores de modelos pequeños: ¿hasta qué punto puede aumentarse la proporción de tokens por parámetro antes de que el entrenamiento adicional se convierta en un exceso perjudicial?

Un experimento con una proporción de entrenamiento sin precedentes

El experimento se basó en un modelo extremadamente pequeño compuesto por seis capas, una dimensión oculta de 96 y una unidad SwiGLU intermedia de tamaño 380, además de GQA con una configuración 6Q/2KV, un vocabulario de 384 tokens y un contexto de 8.000 tokens. Se utilizó el optimizador Muon para los parámetros bidimensionales, con una tasa de aprendizaje máxima de 7e-2, mientras que AdamW se utilizó para el resto de los parámetros, con una tasa de aprendizaje máxima de 4e-3.

El entrenamiento procesó 200.000 millones de tokens de los conjuntos FineWeb-HQ y Cosmopedia v2, lo que equivale a unos 222.000 tokens por parámetro, o aproximadamente 220 veces la proporción asociada a la regla de Chinchilla, que es de unos 20 tokens por parámetro. La lógica del experimento era que el pequeño vocabulario, de 384 tokens, contiene menos información en cada token que un vocabulario tradicional de 32.000 tokens, y también deja relativamente más parámetros para las capas del transformador.

Los puntos de control se evaluaron mediante el paquete estándar Open SLM, que incluye ARC-Easy, ARC-Challenge, HellaSwag y PIQA, además de ArithMark-2/3; posteriormente, los resultados se combinaron en el índice INT Index.

Máximo en 20.000 millones de tokens y descenso continuo después

El índice INT Index registró su valor más alto, 4,55, en el punto de 20.000 millones de tokens. Después descendió a medida que continuaba el entrenamiento, hasta llegar a 3,31 con 180.000 millones de tokens. Según el material, esta disminución fue continua, aunque con cierto ruido, y ningún punto posterior recuperó el nivel máximo.

Los resultados de las pruebas individuales muestran el mismo panorama. Al comparar el punto de 20.000 millones de tokens con el de 180.000 millones, la puntuación de ARC-Easy aumentó de 26,98 a 28,32, pero los resultados disminuyeron en las otras tres pruebas: PIQA cayó de 53,54 a 52,07, ARC-Challenge de 22,27 a 21,25 y HellaSwag de 29,01 a 28,06. La media bajó de 32,95 a 32,43.

El autor del experimento no atribuyó el deterioro directamente a la reducción de la tasa de aprendizaje durante el último 10 % del entrenamiento. Se evaluó un punto situado en torno a los 160.000 millones de tokens, es decir, el 80 % del entrenamiento, que registró una media de 32,68, más cercana al resultado final con 180.000 millones de tokens que al máximo de rendimiento con 40.000 millones, cuya media fue de 33,44. Por ello, la fuente considera que la mayor parte del daño ya se había producido antes de la fase de reducción de la tasa de aprendizaje y que acortar el programa de decrecimiento cosenoidal no habría resuelto el problema.

Comparación con la proporción tradicional

El mismo experimento utilizó un punto de control en el que el modelo se entrenó con 18 millones de tokens, lo que equivale aproximadamente a la proporción de Chinchilla de 20 tokens por parámetro. En ese momento, el modelo obtuvo un índice INT de 1,53, con un rendimiento cercano al azar en las pruebas: 26,64 en ARC-Easy, 49,78 en PIQA, 26,54 en ARC-Challenge y 24,88 en HellaSwag.

Esta comparación presenta una progresión de resultados en este experimento:

  • 20 tokens por parámetro: 18 millones de tokens y un índice INT de 1,53, lo que indica un entrenamiento insuficiente.
  • 22.000 tokens por parámetro: 20.000 millones de tokens y un índice INT de 4,55, el punto máximo.
  • 200.000 tokens por parámetro: 180.000 millones de tokens y un índice INT de 3,31, aproximadamente un 27 % por debajo del máximo.

Rango práctico propuesto

El material no concluye que todas las proporciones elevadas de entrenamiento perjudiquen a los modelos pequeños. Señala que proporciones cercanas a 7.000, 15.000 y 22.000 tokens por parámetro funcionaron bien en otros modelos comunitarios, entre ellos TinyStories y modelos pequeños de las tablas de clasificación cuyo tamaño es inferior a 3 millones de parámetros. En este experimento, el punto de fallo apareció después de superar ampliamente ese rango.

Los resultados muestran una rápida trayectoria ascendente desde 20 tokens por parámetro hasta el máximo: el índice aumentó aproximadamente 0,05 por cada mil millones de tokens entre los 10.000 y los 20.000 millones. En cambio, el descenso fue más lento, de unos 0,008 por cada mil millones de tokens, pero continuó sin interrupción después del punto máximo.

Basándose en esta ronda de entrenamiento, la fuente estima que el rango práctico óptimo desde el punto de vista computacional para un modelo de la categoría Pico, de aproximadamente un millón de parámetros, se sitúa entre 22.000 y 30.000 tokens por parámetro. La recomendación práctica es comenzar el entrenamiento con un presupuesto pequeño dentro de este rango y después evaluar el modelo antes de decidir si se prolonga el entrenamiento. En cambio, aumentar ciegamente la proporción hasta 200.000 tokens por parámetro puede consumir muchas horas de funcionamiento de unidades de procesamiento gráfico para producir un modelo peor que el obtenido con unos 20.000 tokens por parámetro.

Fuente de la noticia
Hugging Face Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias