인공지능

bartowski의 실험, GGUF 모델에서 imatrix 데이터의 한계와 다양성의 중요성을 밝히다

bartowski는 llama.cpp를 사용해 모델을 양자화할 때 imatrix에 사용되는 보정 데이터에 관한 광범위한 실험을 검토하고, 가장 큰 이득은 낮은 비트율, 특히 다중 전문가 MoE 모델에서 나타난다는 결론을 내렸다. 새로운 dataset은 더 작고 집중적이지만, 다양한 텍스트와 도구 사용을 위해 구성된 대화를 함께 포함한다.

2026-08-14
5 분 읽기
8 조회수
فريق تحرير certi.news
bartowski의 실험, GGUF 모델에서 imatrix 데이터의 한계와 다양성의 중요성을 밝히다

bartowski는 GGUF 모델에서 imatrix를 계산하는 데 사용되는 보정 데이터에 관한 새로운 실험을 발표했다. 그는 새로운 dataset이 성능을 개선하는 ‘마법의 해결책’은 아니지만, 일부 경우에 제한적이면서도 중요한 이득을 냈으며, 양자화에 사용되는 텍스트의 유형이 최종 모델에 어떤 영향을 미치는지 더 깊이 이해하는 데 도움이 되었다고 설명했다. 실험 작성자는 이것이 최종 결과가 아니며 데이터를 계속 업데이트하고 테스트할 예정이라고 밝혔다.

실험은 Fable과 협력하고 LTT Labs가 제공한 GPU 자원을 사용해 진행되었다. bartowski는 사용된 파일을 공개했으며, 산문 텍스트와 대화를 위한 두 개의 별도 파일과 모델 전용 대화 템플릿을 거친 텍스트를 함께 제공했다. 또한 정형화된 버전을 생성하는 방법을 설명하는 스크립트도 공개했다. Qwen 파일에는 모델이 데이터의 마지막 부분을 무시하지 않도록 끝에 <|endoftext|> 문자열을 의도적으로 추가한 버전이 제공된다고 덧붙였다.

양자화 과정에서 imatrix는 어떤 기능을 하는가?

bartowski는 llama.cpp의 양자화 알고리즘이 가중치 그룹을 더 낮은 정밀도의 표현으로 변환할 때 발생하는 오류를 줄이려 한다고 설명했다. 이러한 가중치의 상대적 중요도를 추정하기 위해 많은 양의 텍스트를 모델에 통과시킨 다음 입력 채널의 활성화 측정값, 더 정확히는 각 텐서에 도달하는 활성화값 제곱의 합을 수집한다.

많은 텍스트에서 강하고 일관되게 활성화되는 채널은 최종 결과에 연결된 가중치가 더 중요한 것으로 간주된다. 반면 거의 활성화되지 않는 채널은 덜 중요한 것처럼 보일 수 있지만, 데이터에 해당 채널을 활성화하는 올바른 유형의 텍스트가 포함되지 않았을 가능성도 있다. 따라서 결과는 corpus의 크기뿐 아니라 다양성과 모델의 서로 다른 부분을 활성화하는 능력에도 좌우된다.

테스트에는 밀집 모델과 다중 전문가 모델이 포함되었다

팀은 gemma-4-E2B-it, Qwen3.5-4B, Qwen3.6-27B, Qwen3.6-35B-A3B, Mistral-Small-4-119B, Qwen3-Next-80B-A3B, Qwen3.5-397B-A17B 등 7개 모델을 테스트했다. 평가는 bf16과의 KLD 비교, BFCL 테스트, 맞춤형 단기 테스트 모음, MoE 모델의 전문가 커버리지 점검에 초점을 맞췄다. 전체 테스트를 실행하는 데 드는 비용 때문에 MMLU-Pro와 GSM8K 샘플도 더 깊은 검증을 위해 사용되었다.

전반적인 결과는 가중치당 약 4비트를 초과하는 비트율에서는 데이터가 뚜렷하게 예상되는 차이를 만들지 못한다는 것이었다. 일부 가설을 배제하기 위해 초기 테스트에는 완전히 무작위인 데이터도 포함되었지만, 대부분의 경우 Q4_0과 IQ4_XS 및 그보다 높은 수준에서의 차이는 제한적이었다. 이 수준에서는 양자화 오류가 상대적으로 작기 때문이다.

가장 큰 차이는 낮은 수준, 특히 MoE 모델의 Q2_K에서 나타났다. Qwen3.6-35B를 imatrix 없이 양자화했을 때 BFCL 성능은 약 82%에서 54%로 약 28포인트 하락했다. 또한 이 테스트에서 최상의 corpus와 최악의 corpus 사이의 차이는 약 10%에 달했다. 반면 IQ2_M에 사용된 대부분의 정제된 데이터는 서로 비슷했으며, 대체로 차이는 몇 퍼센트포인트를 넘지 않았다.

대화 형식과 도구 사용이 중요한 이유는 무엇인가?

실험은 MoE 모델의 과제가 단순히 언어의 다양성이나 텍스트 품질과만 관련된 것이 아니라, 데이터가 서로 다른 전문가를 활성화하는 능력과도 관련된다는 점을 보여준다. Qwen3-Next-80B-A3B 모델에서는 도구 사용에 특화된 영어 corpus가 3126개 구간을 통과한 뒤에도 512명의 전문가 중 18명을 전혀 활성화하지 못했다. 이는 calibration_datav5.txt의 길이의 약 4배에 해당한다.

calibration_datav5.txt와 도구 호출 데이터를 결합하자 전문가를 완전히 커버할 수 있었다. 실험 결과 다국어 콘텐츠와 프로그래밍 콘텐츠가 일부 전문가를 활성화하는 데 필요한 주요 요인인 것으로 나타났다. 또한 chat template에 맞게 작성된 대화를 포함하는 것이 특히 MoE 모델에서 중요한 것으로 보였다. 일부 전문가는 대화의 토큰과 구조를 볼 때에만 활성화될 수 있기 때문이다.

실제로 이는 대화 또는 도구 호출을 지원하는 모델의 imatrix를 준비할 때 무작위 산문 텍스트만 사용해서는 안 된다는 뜻이다. 대화 템플릿이나 도구 예시가 없으면 보정 과정에서 일부 전문가가 충분히 표현되지 않을 수 있으며, 이는 이후 낮은 양자화율에서의 성능에 나타날 수 있다.

새 버전은 어떻게 구축되었는가?

bartowski는 어떤 데이터 구간이 전문가를 더 잘 활성화하는지 파악하기 위해 구간 단위 분석을 사용했다. 그 결과 일부 전문가는 코드, 프랑스어 텍스트, 서사 문학 또는 과학 자료와 같은 특정 유형의 콘텐츠에서만 나타났다. 이에 따라 테스트에 사용된 MoE 모델 전반에서 전문가 커버리지를 극대화하기 위해 다양한 산문 텍스트를 수집했다.

여기에 interstellarninja/hermes_reasoning_tool_use에서 가져온 도구 호출용으로 구성된 대화를 추가했으며, 테스트에서는 산문과 대화의 2:3 비율이 가장 좋은 조합으로 간주되었다. 400~800개 구간 규모의 버전을 시험한 뒤, 최종 버전은 동일한 품질을 바탕으로 구축된 경우에도 훨씬 더 큰 버전보다 뛰어난 성능을 보였다. 작성자는 이에 대한 초기 설명으로, 대규모 corpus에서는 더 흔한 콘텐츠가 덜 반복되지만 중요한 신호를 압도할 수 있다고 제시했다.

또한 새로운 데이터가 다국어 커버리지를 축소한 것은 아니라고 밝혔다. 오히려 산문 부분에서 라틴 문자를 사용하는 텍스트의 비중이 감소했으며, 이는 v5 버전과 비교해 비라틴계 언어가 corpus에서 더 큰 비중을 차지하게 되었음을 의미한다. 다만 추가 테스트가 여전히 필요하다는 점도 강조했다.

v5와 v6의 비교는 절대적인 우위를 의미하지 않는다

bartowski는 Qwen3.8-27B를 구축하면서 v5와 v6을 비교했으며, wikitext, HuggingFaceH4/no_robots, Salesforce/xlam-function-calling-60k에서 perplexity와 KLD를 사용했다. 그는 이 수치들이 결정적인 증거가 아니라 대략적인 지표라고 설명했으며, 특히 no_robots에서 bf16의 기준 perplexity 값이 19.05였다는 점을 언급했다. wikitext에서는 일부 수준에서 v6의 평균 KLD가 개선되었다. 예를 들어 Q2_K_L에서는 2.6%, IQ2_M에서는 1.8% 개선되었지만, Q4_K_S에서는 3.6%, IQ2_S에서는 3.1% 악화되었다.

이 비교는 새로운 dataset의 이득이 선택적이며 모든 양자화 형식이나 모든 테스트 모음에서 일반적인 개선을 보장하지 않는다는 점을 보여준다. 이는 imatrix의 영향이 낮은 비트율에서, 그리고 많은 수의 전문가 사이에 작업을 분배하는 모델에서 더 뚜렷하다는 작성자의 결론과도 일치한다.

작성자는 imatrix를 계산할 때 512 대신 2048 길이의 컨텍스트를 사용하는 방법도 테스트했지만, 결과가 개선되지 않았고 오히려 여러 경우 전문가 커버리지가 감소했다. 또한 bf16과 Q8_0에서 계산한 imatrix 결과 사이의 코사인 유사도를 비교한 결과 99.99%를 넘는 유사도가 나타났지만, 일부 이상값도 존재했다.

실용적인 결론은 하나의 dataset이 항상 더 나은 성능을 보장한다는 것이 아니라, 특히 MoE 모델을 낮은 수준으로 양자화할 때 corpus 선택이 조정할 가치가 있는 요소가 되었다는 것이다. 새로운 버전은 파일과 생성 방법과 함께 제공되며, bartowski는 Mistral과 Qwen3-Next-80B-A3B를 포함한 다른 모델에서도 계속 테스트하고 있다.

뉴스 출처
Hugging Face Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기