캘리포니아대학교 버클리와 FuriosaAI의 연구 논문은 대규모 언어 모델 서비스에 필요한 메모리 요구를 충족하기 위해 고대역폭 플래시 메모리, 즉 High Bandwidth Flash(HBF)를 고대역폭 메모리 HBM 및 호스트 메모리와 함께 사용하는 추가 계층으로 제안한다. 이 논문은 증가하는 모델 크기와 더 긴 대화 맥락이 야기하는 문제를 다루며, 추론 성능에서 메모리 용량과 대역폭이 병목이 되는 상황을 분석한다.
대규모 언어 모델 서비스 시스템은 모델 가중치와 KV cache 데이터를 메모리에 보관한다. 시간이 지남에 따라 확장되는 맥락 안에서 반복적인 상호작용을 수행하는 에이전트형 워크로드에서는 이러한 데이터를 유지하는 일이 더욱 중요해진다. 그러나 HBF를 사용해 메모리를 확장하는 데에는 상충 관계가 따른다. 플래시는 접근 속도가 HBM보다 느리고, 휘발성 메모리에 비해 쓰기 내구성이 제한적이기 때문이다.
논문에서는 무엇을 테스트했나?
연구진은 HBM, HBF, 호스트 메모리를 결합한 계층형 스토리지 구조와 함께 캐시 내용 및 데이터 위치를 고려하는 캐시 스케줄링 메커니즘을 제시했다. 또한 운영 추적 데이터를 활용한 시뮬레이션을 사용해 데이터 배치 및 스케줄링 결정이 완료 시간, 에너지 소비, HBF의 예상 쓰기 수명에 미치는 영향을 분석했다.
발표된 결과에 따르면 HBF를 지원하는 가장 빠른 시스템은 HBM만 사용하는 시스템과 비교해 완료 시간을 36.1%에서 87.0%까지 단축했다. 평가된 시나리오에서 계산된 에너지 절감률은 최대 55.8%에 달했다.
모든 워크로드에서 이점이 보장되는 것은 아니다
연구 결과는 HBF를 HBM의 직접적인 대체재로 제시하지 않는다. 논문은 일부 경량 워크로드에서 HBF 사용이 에너지 소비를 증가시켰다고 지적했다. 이는 이점이 워크로드의 특성, 유지되는 데이터의 크기, 읽기 및 쓰기 작업의 스케줄링 방식에 좌우된다는 뜻이다.
쓰기 관리는 운영 수명 추정에서 분명한 중요성을 보인다. 평가된 설정에서 캐시 인식 스케줄링은 HBF의 예상 쓰기 수명을 4.77년에서 14.82년으로 늘렸다.
이 연구가 중요한 이유
결과는 더 큰 메모리 계층을 추가하는 것만으로는 모델 서비스의 병목을 해결하기에 충분하지 않다는 점을 보여준다. 이점은 데이터 위치와 스케줄링 정책의 조정에 달려 있으며, 이를 통해 긴 맥락을 사용하는 추론 워크로드가 플래시의 수명을 소진하거나 불필요한 에너지 비용을 초래하지 않으면서 추가 용량을 활용할 수 있다.
AI 가속기 설계자와 인프라 운영자에게 이 논문은 HBM 외부로 메모리 용량을 확장하는 연구 경로를 제시하지만, 아직 일반적인 상용 배포의 타당성을 입증한 것은 아니다. 결과는 시뮬레이션과 운영 추적 데이터에 기반하며, 실제 성능과 수명은 하드웨어 설계, 워크로드 특성, 실제 시스템의 메모리 관리 정책에 따라 달라질 수 있다.
논문 제목은 “Characterizing High Bandwidth Flash for LLM Serving”이며, Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer, Amir Gholami가 공동으로 작성했다. 2026년 9월 arXiv에 연구 초안으로 공개되었으며, arXiv 번호는 2609.39131이다.