Um artigo de pesquisa da Universidade da Califórnia em Berkeley e da FuriosaAI propõe o uso de memória flash de alta largura de banda, ou High Bandwidth Flash (HBF), como uma camada adicional ao lado da memória de alta largura de banda HBM e da memória do host para atender às necessidades de serviço de grandes modelos de linguagem. O artigo aborda o problema imposto pelo aumento do tamanho dos modelos e pelo prolongamento dos contextos de conversação, à medida que a capacidade e a largura de banda da memória se tornam gargalos para o desempenho da inferência.
Os sistemas de serviço de grandes modelos de linguagem mantêm os pesos do modelo e os dados de KV cache na memória. A retenção desses dados se torna mais importante em cargas de trabalho agentivas, que executam interações repetidas dentro de contextos que se expandem ao longo do tempo. Porém, ampliar a memória usando HBF envolve compromissos: o flash é mais lento que a HBM no acesso, e sua capacidade de suportar operações de gravação é limitada em comparação com a memória volátil.
O que o artigo testou?
Os pesquisadores apresentaram uma arquitetura de armazenamento hierárquica que combina HBM, HBF e memória do host, juntamente com um mecanismo de escalonamento temporário que considera o conteúdo do cache e os locais dos dados. Eles usaram uma simulação orientada por rastros operacionais para analisar o impacto das decisões de distribuição de dados e escalonamento no tempo de conclusão, no consumo de energia e na vida útil esperada de gravação da HBF.
De acordo com os resultados divulgados, os sistemas mais rápidos apoiados por HBF reduziram o tempo de conclusão entre 36,1% e 87,0% em comparação com sistemas baseados apenas em HBM. As economias de energia calculadas também chegaram a 55,8% nos cenários avaliados.
O ganho não é garantido em todas as cargas de trabalho
Os resultados não apresentam a HBF como substituta direta da HBM. O artigo indicou que o uso de HBF aumentou o consumo de energia em algumas cargas de trabalho leves, o que significa que o benefício depende da natureza da carga, do volume de dados mantidos e da forma como as operações de leitura e gravação são escalonadas.
A importância do gerenciamento de gravações aparece claramente na estimativa da vida útil operacional. O escalonamento temporário consciente do cache aumentou a vida útil esperada de gravação da HBF de 4,77 para 14,82 anos na configuração avaliada.
Por que esta pesquisa é importante?
Os resultados mostram que adicionar uma camada de memória maior, por si só, não é suficiente para resolver os gargalos do serviço de modelos. Os ganhos estão ligados à coordenação da localização dos dados com a política de escalonamento, para que as cargas de inferência com contextos longos aproveitem a capacidade adicional sem esgotar a vida útil do flash ou incorrer em custos energéticos desnecessários.
Para projetistas de aceleradores de inteligência artificial e operadores de infraestrutura, o artigo propõe uma linha de pesquisa para ampliar a capacidade de memória além da HBM, mas ainda não comprova a viabilidade de uma implantação comercial geral. Os resultados são baseados em simulação e rastros operacionais, e o desempenho e a vida útil reais dependerão do projeto do hardware, das características das cargas de trabalho e das políticas de gerenciamento de memória nos sistemas reais.
O artigo recebeu o título “Characterizing High Bandwidth Flash for LLM Serving”, e teve a participação de Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer e Amir Gholami. Foi publicado como um artigo preliminar de pesquisa no arXiv em setembro de 2026, sob o número arXiv:2609.39131.