随着边缘设备从仅依赖视觉网络转向运行大型语言模型 LLM、视觉语言模型 VLM 以及生成式人工智能功能,并与传统感知网络并行运行,神经人工智能处理单元 NPU 的设计正在发生变化。Expedera 首席科学家兼联合创始人 Sharad Chol 认为,这一转变将问题的核心从最大化计算转移到管理数据流和内存,尤其是在手机、汽车和嵌入式网关中。
该材料以 Semiconductor Engineering 的赞助博客形式发布,因此,与 Origin Evolution 架构有关的数字和结果应被视为 Expedera 所指称的结果和实验,而不是发布方进行的独立测试。
从计算瓶颈到内存瓶颈
在基于 CNN 的视觉负载中,例如 YOLO 检测器、MobileNet 分类器和图像分割网络,历史上的主要限制是计算能力。数据和权重具有很高的重复使用率,推理期间的执行仍近似无状态,因此加速器设计的重点是在面积和功耗限制内提高乘加运算 MAC 的数量。
Expedera 表示,与大型层相比,采用数据包形式调度工作提高了 MAC 单元的利用率,并减少了激活数据向外部 DDR 内存的传输。但 LLM 和 VLM 改变了负载的性质。Prefill 阶段可能仍然具有很高的计算密度,而Decode阶段很快会受到对键值缓存 KV cache 的访问、参数规模及其访问模式的限制,同时有效重复使用率下降。
根据该分析,当 Transformer 的解码操作受内存带宽和 KV cache 大小限制时,主要为并行、无状态 CNN 处理而设计的 NPU,不能仅通过名义 TOPS 数值进行评估。
Transformer 负载中的数据包
Expedera 正在研究将基于数据包的处理概念从 CNN 扩展到 Transformer 模块和 KV cache 访问,同时根据 LLM 和 VLM 模型的行为共同设计硬件和软件,而不是仅仅把它们视为另一种模型。
根据作者的描述,该架构由分别用于前向操作、注意力和向量运算的处理模块组成,并根据网络结构和当前执行阶段在这些模块之间引导数据包,无论当前处于 Prefill 还是 Decode 阶段。公司表示,其引擎可以扩展到单个内核 128 太拉运算,并在使用多核配置时达到拍拉运算级别,同时将内存行为置于设计核心。
据 Expedera 称,该架构无需重新训练或降低精度,即可保持模型按照训练方式运行。公司还表示,与替代方法相比,在运行 Llama 3.2 1B 和 Qwen2 1.5B 时,基于数据包的处理将外部内存流量降低了超过 75%。公司还提到,在受内存限制的场景中,结果达到其所称的数千太拉运算有效性能,以及每平方毫米硅面积每秒数十个 token。
这对边缘设备和汽车意味着什么?
在本地运行推理可以缩短端到端延迟,同时使座舱或设备数据不出云端。根据作者的介绍,这一点对于汽车和移动设备尤为重要,因为用户体验需求与隐私限制及监管要求相互交织。
另一方面,在每个解码步骤中将 KV cache 流式传输到 DDR 或 HBM,会带来功耗和成本负担,尤其是在边缘节点和车载系统中。Expedera 认为,减少外部传输操作并增加本地重复使用,可能在既定功耗预算内实现更高的每秒 token 数。
汽车片上系统还需要同时运行感知、驾驶员监控、信息娱乐和生成式功能。从作者的角度来看,一套同时将 CNN 和 LLM 作为基本负载处理的 NPU 系列,可以简化平台设计并减少对独立加速器的需求,而不是在原本针对 CNN 优化的内核上追加 LLM 支持。
文章指出,Origin Evolution 在 2026 年 Edge AI and Vision Product of the Year 奖项中获得了“最佳边缘人工智能处理器知识产权”奖。作者将该奖项与解决内存和功耗瓶颈的重要性联系起来,而不是仅仅提高峰值性能指标。
对 Prefill 和 Decode 阶段进行建模
Chol 认为,工程价值不只在于数据包概念本身,还在于分别对 Prefill 和 Decode 两个阶段进行建模和优化。前者需要较高的计算吞吐量,在一定程度上类似于 CNN 的行为,但要处理更大的模型;而后者则主要由 KV cache 读取、内存流传输以及每一步规模更小的计算所主导。
根据该材料,数据包流和独立模块可以构建区分两个阶段的性能与带宽模型,并根据对 KV cache 的实际访问模式,研究内存配置和流接口,例如 DRAM 或 HBM 带宽、SRAM 大小及其划分。当 LLM 或 VLM 功能连接到人机交互界面或驾驶员监控时,这些模型还可用于分析对安全敏感的汽车负载中的最坏延迟和带宽影响。
软件兼容性与 EDA 工具的作用
Expedera 表示,Origin Evolution 软件包可接收来自 HuggingFace、Llama.cpp、TVM 等平台的模型,并支持整数和定点精度、混合模式、层融合或层划分,以及在芯片级或多芯粒芯片级对多个内核进行集中控制。
在作者看来,数据包并不代表面向模型用户的新编程模型;模型转换是在编译器流程和运行环境中完成的,同时可以在无需重新训练或降低精度的情况下,将训练好的模型部署到硬件上。这可能减少针对每种硬件进行定制重写的需求,并允许 EDA 和验证团队针对 Llama 3、Qwen 2 等参考应用测试性能。
文章总结称,下一个问题不只是数据包能否适用于 CNN,而是它们能否简化不同人工智能负载之间的建模、调度和验证。随着生成式功能进入汽车和边缘设备,这些因素可能决定哪些加速器架构能够进入量产,哪些仍停留在基准演示中。