人工知能

高帯域幅フラッシュメモリは大規模言語モデルのサービス時間を最大87%短縮する可能性

カリフォルニア大学バークレー校とFuriosaAIの論文は、大規模言語モデルの実行時にAIアクセラレーターのメモリを拡張するため、High Bandwidth Flashの利用を検討している。シミュレーションでは、完了時間を最大87%短縮できる可能性が示されており、ストレージを意識したスケジューリングによって、消費電力の改善や書き込み寿命の延長も見込まれる。

2026-10-02
1 分で読めます
12 閲覧数
certi.news Editorial Team
高帯域幅フラッシュメモリは大規模言語モデルのサービス時間を最大87%短縮する可能性

カリフォルニア大学バークレー校とFuriosaAIの研究論文は、大規模言語モデルのサービスに必要な容量を確保するため、高帯域幅フラッシュメモリ、すなわちHigh Bandwidth Flash(HBF)を、高帯域幅メモリHBMおよびホストメモリと併用する追加層として利用することを提案している。論文では、モデルの大規模化と会話コンテキストの長期化によって生じる問題を扱っている。これにより、メモリ容量と帯域幅が推論性能のボトルネックになっている。

大規模言語モデルのサービスシステムは、モデルの重みとKV cacheのデータをメモリに保持する。時間の経過に伴って拡大するコンテキスト内で反復的なインタラクションを実行するエージェント型ワークロードでは、これらのデータを保持する重要性が増している。しかし、HBFによるメモリ拡張にはトレードオフもある。フラッシュはアクセス速度でHBMより遅く、揮発性メモリと比較して書き込み耐久性も限られている。

論文で検証された内容

研究者らは、HBM、HBF、ホストメモリを組み合わせた階層型ストレージアーキテクチャに加え、キャッシュの内容とデータの配置を考慮する一時的なスケジューリング機構を提示した。そして、運用トレースに基づくシミュレーションを用いて、データ配置とスケジューリングの判断が完了時間、消費電力、HBFの予想書き込み寿命に及ぼす影響を分析した。

公表された結果によると、HBFを利用した最速のシステムは、HBMのみを使用するシステムと比較して、完了時間を36.1%から87.0%短縮した。また、評価されたシナリオでは、算出されたエネルギー削減率は最大55.8%に達した。

すべてのワークロードで効果が得られるわけではない

結果は、HBFをHBMの直接的な代替手段として提示するものではない。論文は、一部の軽量なワークロードではHBFの利用によって消費電力が増加したと指摘している。これは、効果が負荷の性質、保持されるデータ量、読み書き処理のスケジューリング方法に左右されることを意味する。

書き込み管理の重要性は、動作寿命の推定にも明確に表れている。評価された構成では、キャッシュを意識した一時的なスケジューリングにより、HBFの予想書き込み寿命は4.77年から14.82年に延びた。

この研究が重要な理由

結果は、より大容量のメモリ層を追加するだけでは、モデルサービスのボトルネックに対処するのに十分でないことを示している。効果は、データの配置とスケジューリングポリシーの調整に結び付いている。これにより、長いコンテキストを持つ推論ワークロードは、フラッシュの寿命を消耗させたり、不要な電力コストを発生させたりすることなく、追加容量を活用できる。

AIアクセラレーターの設計者やインフラ運用者にとって、この論文はHBMの外部へメモリ容量を拡張する研究経路を提示するものだが、一般的な商用展開の実現可能性をまだ証明してはいない。結果はシミュレーションと運用トレースに基づいており、実際の性能と寿命は、ハードウェア設計、ワークロードの特性、現実のシステムにおけるメモリ管理ポリシーに依存する。

論文のタイトルは“Characterizing High Bandwidth Flash for LLM Serving”であり、Yu、Zack、Chloe Wong、Coleman Hooper、Minjae Lee、Wonjun Kang、Youngjin Cho、Michael W. Mahoney、Yakun Sophia Shao、Kurt Keutzer、Amir Gholamiが執筆に参加した。2026年9月、arXiv:2609.39131として研究草稿がarXivに公開された。

ニュースの出典
Semiconductor Engineering
原文を開く ↗
c
著者

certi.news Editorial Team

同じカテゴリー

おすすめ記事

すべてのニュースを見る