Inteligência artificial

O treinamento excessivo de modelos de linguagem pequenos prejudica o desempenho após 20 bilhões de tokens

Um experimento publicado no Hugging Face mostra que um modelo com 0,9 milhão de parâmetros atingiu o pico de desempenho quando treinado com 20 bilhões de tokens, antes de retroceder gradualmente com a continuidade do treinamento até 180 bilhões de tokens. Os resultados sugerem uma faixa prática entre 22 mil e 30 mil tokens por parâmetro para modelos da categoria muito pequena, com a necessidade de avaliação antes de aumentar o orçamento.

2026-08-12
6 min de leitura
6 visualizações
فريق تحرير certi.news
O treinamento excessivo de modelos de linguagem pequenos prejudica o desempenho após 20 bilhões de tokens

Um experimento publicado no blog do Hugging Face indica que treinar modelos de linguagem muito pequenos com quantidades enormes de dados pode levar à queda de desempenho, em vez de melhorá-lo. Em um experimento com um modelo de 0,9 milhão de parâmetros, o índice INT atingiu seu pico quando o modelo foi treinado com 20 bilhões de tokens, ou aproximadamente 22 mil tokens por parâmetro, e depois caiu gradualmente até chegar a 3,31 em 180 bilhões de tokens, uma queda de 27,3% em relação ao pico.

O experimento foi conduzido por Banaxi, da Banaxi-Tech, e publicado como um artigo da comunidade no Hugging Face em 12 de agosto de 2026. O material se concentra em uma questão prática enfrentada pelos desenvolvedores de modelos pequenos: até que ponto é possível aumentar a proporção de tokens por parâmetro antes que o treinamento adicional se transforme em excesso prejudicial?

Um experimento com uma proporção de treinamento sem precedentes

O experimento utilizou um modelo extremamente pequeno composto por seis camadas, uma dimensão oculta de 96 e uma unidade SwiGLU intermediária com tamanho 380, além de GQA na configuração 6Q/2KV, um vocabulário com 384 tokens e um contexto de 8 mil. Foi utilizado o otimizador Muon para os parâmetros bidimensionais, com uma taxa de aprendizado máxima de 7e-2, enquanto o AdamW foi utilizado para os demais parâmetros, com uma taxa de aprendizado máxima de 4e-3.

O treinamento processou 200 bilhões de tokens dos conjuntos FineWeb-HQ e Cosmopedia v2, o equivalente a aproximadamente 222 mil tokens por parâmetro, ou cerca de 220 vezes a proporção associada à regra de Chinchilla, que é de aproximadamente 20 tokens por parâmetro. A lógica do experimento era que o pequeno vocabulário, de 384 tokens, carrega menos informação em cada token em comparação com um vocabulário tradicional de 32 mil tokens, além de deixar relativamente mais parâmetros para as camadas do transformador.

Os pontos de verificação foram avaliados usando o pacote Open SLM padrão, que inclui ARC-Easy, ARC-Challenge, HellaSwag e PIQA, além de ArithMark-2/3. Em seguida, os resultados foram agregados no índice INT Index.

Pico em 20 bilhões de tokens seguido de queda contínua

O índice INT Index registrou seu maior valor, 4,55, no ponto de 20 bilhões de tokens. Depois disso, caiu com a continuidade do treinamento, chegando a 3,31 em 180 bilhões de tokens. Segundo o material, essa queda foi contínua, com algum ruído, e nenhum ponto posterior recuperou o nível do pico.

Os resultados dos testes individuais revelam o mesmo quadro. Ao comparar o ponto de 20 bilhões de tokens com o ponto de 180 bilhões, a pontuação do ARC-Easy subiu de 26,98 para 28,32, mas os resultados caíram nos outros três testes: o PIQA recuou de 53,54 para 52,07, o ARC-Challenge de 22,27 para 21,25 e o HellaSwag de 29,01 para 28,06. A média caiu de 32,95 para 32,43.

O autor do experimento não atribuiu a queda diretamente à redução da taxa de aprendizado nos 10% finais do treinamento. Foi avaliado um ponto em aproximadamente 160 bilhões de tokens, ou 80% do treinamento, que registrou média de 32,68 — mais próxima do resultado final em 180 bilhões de tokens do que do pico de desempenho em 40 bilhões, cuja média foi de 33,44. Com base nisso, a fonte considera que a maior parte do dano já havia ocorrido antes da etapa de redução da taxa de aprendizado e que encurtar o cronograma de decaimento senoidal não teria resolvido o problema.

Comparação com a proporção tradicional

O mesmo experimento utilizou um ponto de controle no qual o modelo foi treinado com 18 milhões de tokens, equivalente a uma proporção de Chinchilla de aproximadamente 20 tokens por parâmetro. Nesse ponto, o modelo alcançou um índice INT de 1,53, com desempenho próximo ao nível de aleatoriedade nos testes: 26,64 no ARC-Easy, 49,78 no PIQA, 26,54 no ARC-Challenge e 24,88 no HellaSwag.

Essa comparação apresenta uma faixa gradual de resultados neste experimento:

  • 20 tokens por parâmetro: 18 milhões de tokens e índice INT de 1,53, indicando subtreinamento.
  • 22 mil tokens por parâmetro: 20 bilhões de tokens e índice INT de 4,55, o ponto de pico.
  • 200 mil tokens por parâmetro: 180 bilhões de tokens e índice INT de 3,31, cerca de 27% abaixo do pico.

A faixa prática proposta

O material não conclui que todas as proporções elevadas de treinamento prejudicam os modelos pequenos. Ele indica que proporções próximas de 7 mil, 15 mil e 22 mil tokens por parâmetro funcionaram bem em outros modelos comunitários, incluindo o TinyStories e modelos pequenos em tabelas de classificação com menos de 3 milhões de parâmetros. O ponto de falha neste experimento surgiu somente depois que essa faixa foi amplamente ultrapassada.

Os resultados mostram uma trajetória rápida de ascensão do nível de 20 tokens por parâmetro até o pico: o índice subiu aproximadamente 0,05 para cada bilhão de tokens entre 10 bilhões e 20 bilhões. Em contrapartida, a queda foi mais lenta, cerca de 0,008 para cada bilhão de tokens, mas continuou sem interrupção após o ponto de pico.

Com base nesta rodada de treinamento, a fonte estima que a faixa prática ideal do ponto de vista computacional para um modelo da categoria Pico, com aproximadamente 1 milhão de parâmetros, fica entre 22 mil e 30 mil tokens por parâmetro. A recomendação prática é começar o treinamento com um orçamento pequeno dentro dessa faixa e, depois, avaliar o modelo antes de decidir pela extensão do treinamento. Aumentar cegamente a proporção para 200 mil tokens por parâmetro pode consumir muitas horas de operação das unidades de processamento gráfico para produzir um modelo pior do que aquele obtido com aproximadamente 20 mil tokens por parâmetro.

Fonte da notícia
Hugging Face Blog
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias