Конструкция нейронных процессоров искусственного интеллекта NPU меняется по мере того, как периферийные устройства переходят от использования только сетей компьютерного зрения к запуску больших языковых моделей LLM, моделей зрения и языка VLM и функций генеративного ИИ наряду с традиционными сетями восприятия. Шарад Чоул, главный научный сотрудник и соучредитель компании Expedera, считает, что этот переход смещает центр проблемы с максимизации вычислений на управление перемещением данных и памяти, особенно в смартфонах, автомобилях и встраиваемых шлюзах.
Материал опубликован в формате спонсируемого блога в Semiconductor Engineering, поэтому приведённые показатели и результаты, связанные с архитектурой Origin Evolution, представлены как результаты и эксперименты, на которые ссылается Expedera, а не как независимое тестирование со стороны издателя.
От вычислительного узкого места к узкому месту памяти
В задачах компьютерного зрения на основе сетей CNN, таких как детекторы YOLO, классификаторы MobileNet и сети сегментации изображений, главным ограничением исторически была вычислительная мощность. Данные и веса в значительной степени переиспользуются, а выполнение во время инференса остаётся почти лишённым состояния, поэтому при проектировании ускорителей основное внимание уделялось увеличению числа операций умножения и накопления MAC в пределах ограничений по площади и энергопотреблению.
Expedera утверждает, что планирование работы в виде пакетов, а не крупных слоёв, повысило загрузку блоков MAC и сократило перемещение активаций во внешнюю память DDR. Однако модели LLM и VLM меняют характер нагрузки. Этап Prefill может по-прежнему быть насыщенным вычислениями, тогда как этап Decode быстро становится ограниченным доступом к кэшу ключей и значений KV cache, размером параметров и шаблонами доступа к ним при снижении эффективного повторного использования.
Согласно анализу, NPU, изначально предназначенные для параллельной обработки CNN без состояния, недостаточно оценивать только по номинальному показателю TOPS, когда операции декодирования трансформеров ограничены пропускной способностью памяти и размером KV cache.
Пакетная обработка в задачах трансформеров
Expedera изучает расширение концепции пакетной обработки с сетей CNN на блоки трансформеров и доступ к KV cache, проектируя аппаратное и программное обеспечение совместно с учётом поведения моделей LLM и VLM, а не рассматривая их просто как ещё одну модель.
Согласно описанию автора, архитектура состоит из отдельных вычислительных блоков для прямых операций, механизмов внимания и векторных операций, а пакеты направляются между ними в соответствии со структурой сети и текущим этапом выполнения — Prefill или Decode. Компания утверждает, что её движок может масштабироваться до 128 терафлопс в одном ядре и до петаблопного уровня при использовании многомодульных конфигураций, сохраняя поведение памяти в центре проектирования.
Согласно Expedera, архитектура сохраняет выполнение моделей в том виде, в котором они были обучены, без повторного обучения или снижения точности. Компания также указывает, что по сравнению с альтернативными методами пакетная обработка сократила перемещение внешней памяти более чем на 75% при запуске Llama 3.2 1B и Qwen2 1.5B. Также упоминаются результаты, описываемые компанией как тысячи эффективных терафлопс и десятки токенов в секунду на квадратный миллиметр кремния в сценариях, ограниченных памятью.
Что это означает для периферийных устройств и автомобилей?
Локальное выполнение инференса может сократить сквозную задержку, а также сохранить данные салона или устройства за пределами облака. Согласно автору, это особенно важно для автомобилей и мобильных устройств, где требования к пользовательскому опыту сочетаются с ограничениями конфиденциальности и нормативными требованиями.
В то же время передача KV cache в DDR или HBM на каждом шаге декодирования создаёт нагрузку на энергопотребление и стоимость, особенно в периферийных узлах и автомобильных системах. Expedera считает, что сокращение внешних перемещений и увеличение локального повторного использования может обеспечить большее число токенов в секунду в пределах заданного энергетического бюджета.
Автомобильным системам на кристалле также необходимо одновременно выполнять задачи восприятия, мониторинга водителя, информационно-развлекательной системы и генеративных функций. С точки зрения автора, семейство NPU, совместно обрабатывающее CNN и LLM как основные нагрузки, может упростить проектирование платформы и снизить потребность в отдельных ускорителях вместо добавления поддержки LLM к ядру, изначально оптимизированному для сетей CNN.
В статье указывается, что Origin Evolution получила награду «Лучшая интеллектуальная собственность для периферийного ИИ-процессора» в рамках премии Edge AI and Vision Product of the Year 2026, причём автор связывает эту награду с важностью устранения узких мест памяти и энергопотребления, а не простого увеличения пиковых показателей производительности.
Моделирование этапов Prefill и Decode
Чоул считает, что инженерная ценность заключается не только в концепции пакетов, но и в моделировании и отдельной оптимизации этапов Prefill и Decode. Первый требует высокой вычислительной производительности и частично напоминает поведение сетей CNN, но работает с более крупными моделями, тогда как во втором доминируют чтение KV cache, передача данных из памяти и меньшие вычисления на каждом шаге.
Согласно материалу, потоки пакетов и отдельные блоки позволяют строить модели производительности и пропускной способности, различающие эти два этапа, а также изучать параметры памяти и интерфейсов передачи данных, такие как пропускная способность DRAM или HBM, размер SRAM и её распределение, с учётом фактических шаблонов доступа к KV cache. Их также можно использовать для анализа наихудшей задержки и влияния пропускной способности в чувствительных к безопасности автомобильных задачах, когда функции LLM или VLM связаны с интерфейсом взаимодействия человека и машины или с мониторингом водителя.
Программная совместимость и роль инструментов EDA
Expedera утверждает, что пакет Origin Evolution принимает модели из HuggingFace, Llama.cpp, TVM и других источников, поддерживает целочисленную и дробную точность, смешанные режимы, объединение или разделение слоёв, а также централизованное управление несколькими ядрами на уровне кристалла или многокристальной микросхемы.
С точки зрения автора, пакеты не представляют собой новую модель программирования для пользователей моделей; их преобразование выполняется внутри конвейера компилятора и среды выполнения, при этом обученные модели можно размещать на оборудовании без повторного обучения или снижения точности. Это может уменьшить необходимость в специальной переработке для каждого типа оборудования и позволить командам EDA и верификации тестировать производительность относительно эталонных приложений, таких как Llama 3 и Qwen 2.
В статье делается вывод, что следующий вопрос связан не только с успешностью пакетной обработки в CNN, но и с тем, насколько она упрощает моделирование, планирование и верификацию в разнородных задачах искусственного интеллекта. По мере перехода генеративных функций в автомобили и периферийные устройства именно эти факторы могут определить, какие архитектуры ускорителей перейдут в производство, а какие останутся в демонстрациях на основе эталонов.