인공지능 스타트업 PrismML이 Bonsai 2 27B 모델을 출시했다. 이 모델은 Alibaba의 오픈 소스 모델 Qwen3.8 27B를 압축해 파일 크기를 단 5.9기가바이트로 줄인다. 회사는 압축 모델이 벤치마크에서 원본 모델의 종합 점수 98%를 달성하면서 메모리 요구량을 약 9~10배 줄였다고 말한다.
새로운 크기 덕분에 모델을 클라우드 서버에 전적으로 의존하지 않고 개인용 컴퓨터에서, 어쩌면 고급 스마트폰에서도 실행할 수 있게 됐다. 그렇다고 모든 스마트폰에서 실제로 실행할 수 있다는 뜻은 아니다. 출처는 스마트폰 호환성을 가능성의 형태로 제시하고 있으며, 실제 성능은 하드웨어와 모델 실행을 둘러싼 소프트웨어에 따라 달라진다.
압축 기술은 어떻게 작동하는가?
PrismML은 자사가 삼중값 가중치라고 부르는 방식을 사용한다. 모델의 가중치는 학습 과정에서 모델이 습득하는 정보의 일부를 저장하는 값이며, 회사의 설명에 따르면 일반적으로 가중치 하나당 16비트가 필요하다. 새로운 방식에서는 각 가중치를 세 가지 값 중 하나로만 표현한다. 양의 1, 음의 1, 또는 0이다. 가능한 값의 수를 줄이면 모델 저장에 필요한 공간이 크게 감소한다.
회사는 압축 기술 전문가이자 Caltech 교수인 Babak Hassibi가 이끌고 있으며, Ion Stoica가 자문역으로 참여하고 있다. 투자자 명단에는 Khosla Ventures, Cerberus Capital, Caltech가 포함돼 있다. PrismML은 2,225만 달러 규모의 시드 라운드를 유치했다. 대규모 언어 모델 압축에 뛰어든 회사는 PrismML만이 아니며, 출처는 이 분야의 경쟁사로 Multiverse Computing도 언급했다.
이전 버전보다 나은 결과
Bonsai 2는 회사가 3월에 출시한 첫 번째 Bonsai 버전보다 개선된 모델이다. TechCrunch가 회사의 말을 인용해 보도한 내용에 따르면, 첫 번째 버전은 원본 모델 점수의 95%를 달성했다. PrismML은 첫 번째 버전이 1,100만 회 이상 다운로드됐으며, 더 작은 모델들은 추가로 260만 회 다운로드됐다고 말한다.
그러나 98%라는 수치가 원본 모델과 완전히 일치한다는 뜻은 아니며, 남은 차이가 실제 사용에서 나타나지 않을 것임을 단독으로 입증하지도 않는다. Hassibi는 압축이 성능에 어느 정도 영향을 남길 가능성이 높다고 인정한다. 또한 벤치마크는 모든 실제 작업을 반영하지 않으며, 모델이 실행되는 소프트웨어 환경도 정확도에 영향을 준다.
이 발전이 중요한 이유는 무엇인가?
PrismML이 대부분의 기능을 유지하면서 모델을 계속 축소한다면 추론 모델을 로컬에서 실행하는 일이 더욱 실용적이 될 수 있다. Stoica의 주장에 따르면, 이는 데이터를 클라우드로 전송하는 대신 사용자 기기에서 처리할 수 있게 해 개인정보 보호를 지원하고 외부 연결에 대한 의존도를 낮출 가능성이 있다. 그러나 전력 소비, 응답 속도, 기기 호환성에 관한 문제를 아직 해결한 것은 아니며, 모든 시나리오에서 동일한 수준의 성능을 제공한다는 점도 입증하지 못했다.
회사는 압축 기술을 훨씬 더 큰 모델에 적용할 계획이며, Hassibi는 향후 몇 달 안에 차기 버전이 수천억 개의 매개변수 범위에 이를 수 있다고 말했다. 그는 더 큰 모델일수록 압축 과정에서 기능을 유지할 여지가 더 넓어질 수 있다고 본다. 그러나 이 목표는 아직 향후 계획일 뿐, 현재 이용 가능한 결과는 아니다. 보고서는 Apple과의 대화에 관한 소문도 언급했지만, Hassibi는 논평을 거부했다. 따라서 이를 공개된 파트너십이나 합의로 간주할 수 없다.