Chips e semicondutores

Por que as unidades NPU precisam ser redesenhadas à medida que a IA de borda migra para modelos LLM

Sharad Chol, da Expedera, analisa como a migração dos dispositivos de borda das redes de visão tradicionais para modelos LLM e VLM altera a natureza do gargalo, que passa da capacidade computacional para o movimento de memória. Ele apresenta o papel do processamento baseado em pacotes na redução da transferência externa de dados e na melhoria da execução de modelos em carros e dispositivos incorporados.

2026-08-13
7 min de leitura
8 visualizações
فريق تحرير certi.news
Por que as unidades NPU precisam ser redesenhadas à medida que a IA de borda migra para modelos LLM

O design das unidades de processamento neural de IA, NPUs, está mudando à medida que os dispositivos de borda deixam de depender exclusivamente de redes de visão e passam a executar grandes modelos de linguagem, LLMs, modelos de visão e linguagem, VLMs, e recursos de IA generativa ao lado das redes tradicionais de percepção. Sharad Chol, cientista-chefe e cofundador da Expedera, considera que essa mudança desloca o centro do problema da maximização das operações computacionais para o gerenciamento do movimento de dados e da memória, especialmente em telefones, carros e gateways incorporados.

O material foi publicado em formato de blog patrocinado na Semiconductor Engineering. Portanto, os números e resultados relacionados à arquitetura Origin Evolution são apresentados como resultados e experimentos indicados pela Expedera, e não como um teste independente realizado pela publicação.

Do gargalo computacional ao gargalo de memória

Em cargas de trabalho de visão baseadas em redes CNN, como detectores YOLO, classificadores MobileNet e redes de segmentação de imagens, a principal limitação historicamente era a capacidade computacional. Os dados e pesos eram reutilizados em grande medida, e a execução durante a inferência permanecia praticamente sem estado, o que levou o design dos aceleradores a se concentrar no aumento do número de operações de multiplicação e acumulação, MAC, dentro dos limites de área e energia.

A Expedera afirma que o agendamento do trabalho em formato de pacotes, em vez de camadas grandes, melhorou a utilização das unidades MAC e reduziu o movimento das ativações para a memória DDR externa. Entretanto, os modelos LLM e VLM mudam a natureza da carga. A fase de Prefill ainda pode ser intensiva em operações computacionais, enquanto a fase de Decode rapidamente se torna limitada pelo acesso ao cache de chaves e valores, KV cache, pelo tamanho dos parâmetros e por seus padrões de acesso, com redução do reúso efetivo.

Segundo a análise, as unidades NPU projetadas principalmente para o processamento paralelo e sem estado de CNNs não podem ser avaliadas apenas pelo número nominal de TOPS quando as operações de decodificação de transformadores são limitadas pela largura de banda da memória e pelo tamanho do KV cache.

Pacotes em cargas de trabalho de transformadores

A Expedera está investigando a expansão do conceito de processamento baseado em pacotes das redes CNN para blocos de transformadores e acessos ao KV cache, projetando hardware e software em conjunto de acordo com o comportamento dos modelos LLM e VLM, em vez de tratá-los simplesmente como outro modelo.

A arquitetura, segundo a descrição do autor, é composta por blocos de processamento separados para operações frontais, atenção e vetores, e os pacotes são direcionados entre eles de acordo com a estrutura da rede e a fase atual da execução, seja Prefill ou Decode. A empresa afirma que seu mecanismo pode escalar para 128 teraflops em um único núcleo e para o nível de petaflops ao usar configurações multinúcleo, mantendo o comportamento da memória no centro do design.

A arquitetura, segundo a Expedera, mantém os modelos em execução conforme foram treinados, sem retreinamento ou redução de precisão. A empresa também afirma que o processamento baseado em pacotes reduziu, em comparação com métodos alternativos, o movimento da memória externa em mais de 75% ao executar Llama 3.2 1B e Qwen2 1.5B. Ela também menciona resultados descritos como milhares de teraflops efetivos e dezenas de tokens por segundo por milímetro quadrado de silício em cenários limitados pela memória.

O que isso significa para dispositivos de borda e carros?

Executar a inferência localmente pode reduzir a latência de ponta a ponta e manter os dados da cabine ou do dispositivo fora da nuvem. Isso ganha importância em carros e dispositivos móveis, nos quais os requisitos da experiência do usuário se combinam com limitações de privacidade e requisitos regulatórios, segundo o autor.

Por outro lado, transmitir o KV cache para DDR ou HBM a cada etapa da decodificação representa uma carga de energia e custo, especialmente em nós de borda e sistemas veiculares. A Expedera considera que reduzir as transferências externas e aumentar o reúso local pode permitir um número maior de tokens por segundo dentro de um orçamento de energia definido.

Os sistemas automotivos em um chip também precisam executar simultaneamente percepção, monitoramento do motorista, entretenimento e informação e recursos generativos. Do ponto de vista do autor, uma família de NPUs que trate CNN e LLM como cargas de trabalho fundamentais em conjunto pode simplificar o design da plataforma e reduzir a necessidade de aceleradores separados, em vez de adicionar suporte a LLM a um núcleo originalmente otimizado para redes CNN.

O artigo menciona que a Origin Evolution recebeu o prêmio de «Melhor propriedade intelectual de processador de IA de borda» no âmbito do Edge AI and Vision Product of the Year Awards de 2026, relacionando essa premiação à importância de processar gargalos de memória e energia, em vez de apenas elevar os indicadores máximos de desempenho.

Modelagem das fases Prefill e Decode

Chol considera que o valor da engenharia não está apenas no conceito de pacotes, mas na modelagem e otimização separadas das fases Prefill e Decode. A primeira exige alta produtividade computacional e se assemelha parcialmente ao comportamento das redes CNN, embora lide com modelos maiores, enquanto a segunda é dominada por leituras do KV cache, transmissão de memória e cálculos menores a cada etapa.

Os fluxos de pacotes e blocos separados, segundo o material, permitem construir modelos de desempenho e largura de banda que distinguem as duas fases e estudar configurações de sequência de memória e interfaces de transmissão, como a largura da DRAM ou HBM e o tamanho e a divisão da SRAM, de acordo com os padrões reais de acesso ao KV cache. Eles também podem ser usados para analisar a pior latência e o impacto da largura de banda em cargas de trabalho automotivas sensíveis à segurança, quando recursos de LLM ou VLM estão vinculados à interface de interação homem-máquina ou ao monitoramento do motorista.

Compatibilidade de software e o papel das ferramentas de EDA

A Expedera afirma que o pacote Origin Evolution recebe modelos do HuggingFace, Llama.cpp, TVM e outros, e oferece suporte a precisões inteiras e fracionárias, modos mistos, fusão ou divisão de camadas, além do controle centralizado de vários núcleos no nível do chip ou de um chiplet múltiplo.

Do ponto de vista do autor, os pacotes não representam um novo modelo de programação para os usuários dos modelos; a conversão é realizada dentro do fluxo do compilador e do ambiente de execução, com a possibilidade de colocar modelos treinados no hardware sem retreinamento ou redução de precisão. Isso pode reduzir a necessidade de reescrita personalizada para cada hardware e permitir que equipes de EDA e verificação testem o desempenho em relação a aplicações de referência como Llama 3 e Qwen 2.

O artigo conclui que a próxima questão não se limita ao sucesso dos pacotes com CNN, mas diz respeito ao quanto eles simplificam a modelagem, o agendamento e a verificação em cargas de trabalho de IA heterogêneas. À medida que os recursos generativos chegam aos carros e dispositivos de borda, esses fatores podem determinar quais arquiteturas de aceleradores chegam à produção e quais permanecem em demonstrações de referência.

Fonte da notícia
Semiconductor Engineering
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias