Inteligencia artificial

El experimento de bartowski revela los límites de los datos de imatrix y la importancia de su diversidad en los modelos GGUF

bartowski presenta un amplio experimento para mejorar los datos de calibración utilizados con imatrix al cuantizar modelos mediante llama.cpp, y concluye que las mayores ganancias aparecen con tasas de bits bajas, especialmente en modelos de expertos múltiples MoE. El nuevo dataset es más pequeño y específico, pero combina textos diversos y conversaciones formateadas para el uso de herramientas.

2026-08-14
8 min de lectura
8 visitas
فريق تحرير certi.news
El experimento de bartowski revela los límites de los datos de imatrix y la importancia de su diversidad en los modelos GGUF

bartowski publicó un nuevo experimento sobre los datos de calibración utilizados para calcular imatrix en modelos GGUF, y explicó que el nuevo dataset no representa una «solución mágica» para mejorar el rendimiento, aunque logró ganancias limitadas e importantes en algunos casos y proporcionó una comprensión más profunda de cómo el tipo de textos utilizados en la cuantización afecta al modelo final. El autor del experimento afirma que estos no son los resultados definitivos y que espera continuar actualizando y probando los datos.

Los experimentos se realizaron en colaboración con Fable y utilizando capacidades de GPU proporcionadas por LTT Labs. bartowski publicó abiertamente los archivos utilizados, incluidos dos archivos separados para textos en prosa y conversaciones, además de los textos después de pasarlos por la plantilla de conversación del modelo. También puso a disposición un script que explica cómo generar la versión formateada, y señaló que los archivos de Qwen están disponibles con inserciones deliberadas de cadenas <|endoftext|> al final para que el modelo no ignore la parte final de los datos.

¿Qué función cumple imatrix en el proceso de cuantización?

bartowski explicó que el algoritmo de cuantización de llama.cpp intenta reducir el error producido al convertir conjuntos de pesos en representaciones de menor precisión. Para estimar la importancia relativa de estos pesos, se pasan grandes cantidades de texto por el modelo y después se recopilan mediciones de activación de los canales de entrada; más precisamente, la suma de los cuadrados de las activaciones que llegan a cada tensor.

Un canal que se activa con fuerza y de manera constante a través de muchos textos se considera asociado con pesos más importantes para el resultado final. En cambio, un canal que rara vez se activa puede parecer menos importante, aunque sigue existiendo la posibilidad de que los datos no incluyeran el tipo correcto de texto que lo activa. Por ello, el resultado no depende únicamente del tamaño del corpus, sino también de su diversidad y de su capacidad para activar las distintas partes del modelo.

Las pruebas incluyeron modelos densos y de múltiples expertos

El equipo probó siete modelos: gemma-4-E2B-it, Qwen3.5-4B, Qwen3.6-27B, Qwen3.6-35B-A3B, Mistral-Small-4-119B, Qwen3-Next-80B-A3B y Qwen3.5-397B-A17B. La evaluación se centró en comparar KLD con bf16, probar BFCL, realizar un conjunto de pruebas cortas específicas y examinar la cobertura de expertos en modelos MoE. También se utilizaron muestras de MMLU-Pro y GSM8K para una verificación más profunda, debido al coste de ejecutar las pruebas completas.

El resultado general fue que los datos no producen una diferencia claramente esperable con tasas superiores a aproximadamente 4 bits por peso. Las primeras pruebas incluyeron datos completamente aleatorios para descartar algunas hipótesis, pero las diferencias en Q4_0, IQ4_XS y superiores siguieron siendo limitadas en la mayoría de los casos, porque los errores de cuantización en estos niveles son relativamente pequeños.

La mayor diferencia apareció en los niveles bajos, especialmente en Q2_K en modelos MoE. Al cuantizar Qwen3.6-35B sin imatrix, el rendimiento en BFCL cayó aproximadamente 28 puntos, de alrededor del 82 % al 54 %. La diferencia entre el mejor y el peor corpus también alcanzó aproximadamente el 10 % en esta prueba. En cambio, la mayoría de los datos limpios utilizados con IQ2_M fueron similares, con diferencias que por lo general no superaron unos pocos puntos porcentuales.

¿Por qué son importantes el formato de conversación y el uso de herramientas?

El experimento indica que el desafío en los modelos MoE no está relacionado únicamente con la diversidad lingüística o la calidad de los textos, sino también con la capacidad de los datos para activar a los distintos expertos. En el modelo Qwen3-Next-80B-A3B, un corpus en inglés específico para el uso de herramientas dejó 18 expertos de un total de 512 sin ninguna activación, incluso después de pasar 3126 fragmentos, es decir, aproximadamente cuatro veces la longitud de calibration_datav5.txt.

Al combinar calibration_datav5.txt con datos de llamadas a herramientas, se logró una cobertura completa de los expertos. Los experimentos mostraron que el contenido multilingüe y el código fueron factores principales necesarios para activar a algunos de estos expertos. También pareció importante incluir conversaciones formuladas según una plantilla de conversación, específicamente en los modelos MoE, porque algunos expertos podrían activarse únicamente al ver los tokens y la estructura de una conversación.

En la práctica, esto significa que la preparación de imatrix para un modelo compatible con conversaciones o llamadas a herramientas no debería limitarse a textos en prosa aleatorios. La ausencia de una plantilla de conversación o de ejemplos de herramientas puede hacer que algunos expertos estén menos representados durante la calibración, algo que podría reflejarse posteriormente en el rendimiento con tasas de cuantización bajas.

¿Cómo se construyó la nueva versión?

bartowski utilizó un análisis a nivel de fragmentos para determinar qué partes de los datos activaban mejor a los expertos. Los resultados mostraron que algunos expertos solo aparecen con tipos específicos de contenido, como código, textos en francés, literatura narrativa o materiales científicos. Por ello, se recopilaron textos en prosa diversos con el objetivo de maximizar la cobertura de expertos en los modelos MoE utilizados en la prueba.

A esto se añadieron conversaciones formateadas para llamadas a herramientas tomadas de interstellarninja/hermes_reasoning_tool_use, y la proporción 2:3 entre prosa y conversaciones se consideró la mejor combinación en las pruebas. Después de probar versiones de entre 400 y 800 fragmentos, la versión final logró un rendimiento superior al de versiones mucho más grandes, incluso cuando estas se basaban en la misma calidad. El autor propone como explicación inicial que, en un corpus enorme, el contenido más frecuente puede eclipsar señales importantes que aparecen con menor frecuencia.

También afirmó que los nuevos datos no redujeron la cobertura multilingüe; la proporción de textos escritos con el alfabeto latino disminuyó en la parte de prosa, lo que significa que las lenguas no latinas representan ahora una parte mayor del corpus en comparación con la versión v5, aunque subrayó que todavía se necesitan pruebas adicionales.

La comparación entre v5 y v6 no supone una superioridad absoluta

bartowski comparó las versiones v5 y v6 al construir Qwen3.8-27B, utilizando perplexity y KLD en wikitext, HuggingFaceH4/no_robots y Salesforce/xlam-function-calling-60k. Describe estas cifras como indicadores aproximados y no como una prueba concluyente, especialmente porque el valor de perplexity de referencia de bf16 en no_robots fue de 19.05. En wikitext, el KLD medio mejoró con v6 en algunos niveles, como Q2_K_L en un 2.6 % e IQ2_M en un 1.8 %, pero empeoró en otros, como Q4_K_S en un 3.6 % e IQ2_S en un 3.1 %.

Esta comparación muestra que las ganancias del nuevo dataset son selectivas y no constituyen una mejora general para todos los formatos de cuantización o todos los conjuntos de pruebas. Esto respalda la conclusión del autor de que el efecto de imatrix es más evidente con tasas de bits bajas y en modelos que dependen de distribuir el trabajo entre un gran número de expertos.

El autor también probó utilizar un contexto de longitud 2048 en lugar de 512 al calcular imatrix, pero no observó una mejora en los resultados; de hecho, la cobertura de expertos disminuyó en numerosos casos. Una comparación de similitud del coseno entre los resultados de imatrix calculados a partir de bf16 y Q8_0 también mostró una similitud superior al 99.99 %, aunque hubo algunos valores atípicos.

La conclusión práctica no es que un único dataset vaya a garantizar siempre un mejor rendimiento, sino que la elección del corpus se ha convertido en un factor que merece ser ajustado, especialmente al cuantizar modelos MoE a niveles bajos. La nueva versión está disponible junto con sus archivos y el método para generarla, mientras bartowski continúa probándola en otros modelos, entre ellos Mistral y Qwen3-Next-80B-A3B.

Fuente de la noticia
Hugging Face Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias