Chips e semicondutores

REACH propõe uma arquitetura de menor custo para proteger a HBM contra erros de memória durante a inferência de modelos de IA

Pesquisadores do Rensselaer Polytechnic Institute e da IBM apresentaram a arquitetura REACH para gerenciar códigos de correção de erros de longo alcance dentro de um controlador HBM, com o objetivo de reduzir o custo de decodificação em cargas de trabalho de inferência de grandes modelos de linguagem. A ideia utiliza códigos internos para erros comuns e um código externo para corrigir partes conhecidas como apagadas.

2026-09-11
4 min de leitura
10 visualizações
فريق تحرير certi.news
REACH propõe uma arquitetura de menor custo para proteger a HBM contra erros de memória durante a inferência de modelos de IA

Pesquisadores do Rensselaer Polytechnic Institute e do IBM T.J. Watson Research Center publicaram um artigo técnico que propõe uma nova arquitetura para gerenciar a correção de erros da memória de alta largura de banda HBM usada em cargas de trabalho de inferência de inteligência artificial. A arquitetura se chama REACH, abreviação do título do artigo “REACH: Controller-Managed Long-Span ECC for HBM AI Inference”.

O artigo aborda um problema prático nos sistemas HBM: o alto custo da memória aumenta a necessidade de uma proteção mais robusta, capaz de lidar com uma faixa mais ampla de taxas de erro dos dispositivos de memória, sem transformar o mecanismo de correção de erros em uma grande sobrecarga para o controlador de memória ou para a largura de banda disponível à inferência.

Como a ideia funciona?

A REACH propõe o uso de códigos internos de correção de erros para tratar primeiro os erros comuns e, em seguida, identificar as partes que ainda não foram corrigidas. Depois, um código externo de longo alcance é reservado para corrigir essas partes quando elas são conhecidas como casos de apagamento, em vez de tratar todos os acessos à memória como se necessitassem de uma decodificação de amplo alcance.

O artigo indica que a aplicação direta de códigos de longo alcance pode vincular pequenos acessos a uma condição que se estende por uma faixa maior de dados, além de impor um alto custo de decodificação nas velocidades da HBM. Por isso, a arquitetura proposta se concentra em executar parte da proteção dentro do controlador de memória, adiando a correção mais ampla para os casos em que há informações suficientes sobre a localização dos dados que não podem ser recuperados diretamente.

Por que isso é importante?

A REACH aproveita as características das cargas de trabalho de inferência de grandes modelos de linguagem, que, de acordo com a descrição do artigo, são predominantemente de leitura. As leituras sequenciais podem permitir a agregação de faixas de dados antes da aplicação do mecanismo de proteção mais amplo, enquanto as escritas esparsas limitam o tráfego de atualização dos dados de paridade. Dessa forma, a arquitetura tenta adaptar o mecanismo de correção de erros ao padrão efetivo de acesso na inferência, em vez de usar um projeto uniforme para todos os tipos de carga de trabalho.

A importância prática não está apenas na adição de uma camada de proteção, mas no equilíbrio entre confiabilidade, custo do controlador e largura de banda. Aumentar a capacidade de correção de erros pode ser útil quando as taxas de erro dos dispositivos de memória aumentam, mas também pode resultar em operações computacionais e transferências de dados adicionais. A REACH apresenta uma abordagem para reduzir essa sobrecarga usando o código externo nos casos de correção conhecidos, enquanto mantém os códigos internos responsáveis pelo caminho habitual.

O que o material comprova e o que não comprova?

O que está disponível no material publicado é um resumo da ideia da arquitetura e do motivo pelo qual ela é adequada à inferência de grandes modelos de linguagem. O texto extraído não inclui números sobre a magnitude da redução de custo ou do consumo de energia, nem sobre o impacto da REACH na latência e na taxa de transferência de dados, e também não apresenta uma comparação quantitativa com outros projetos de HBM. Portanto, ela deve ser considerada uma proposta de pesquisa, não uma solução comercial pronta ou um número de desempenho divulgado.

O artigo foi incluído no arXiv com seu título completo em setembro de 2026 e tem o número arXiv:2609.10861; seu identificador DOI é 10.48550/arXiv.2609.10861. Participaram de sua elaboração Rui Xie, Yunhua Fang, Asad Ul Haq, Linsen Ma, Sanchari Sen, Swagath Venkataramani, Liu Liu e Tong Zhang.

Fonte da notícia
Semiconductor Engineering
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias