Чипы и полупроводники

Почему вычисления для искусственного интеллекта в будущем не будут зависеть от одного типа чипов?

Центры обработки данных переходят к неоднородным кластерам, объединяющим CPUs, GPUs, NPUs, специализированные ускорители и оптические соединения, вместо зависимости от одного GPU для всех задач. Поэтому программное обеспечение, управление сетями и энергопотреблением становятся ключевыми факторами снижения стоимости токенов и повышения эффективности использования оборудования.

2026-08-19
5 мин. чтения
15 просмотров
فريق تحرير certi.news
Почему вычисления для искусственного интеллекта в будущем не будут зависеть от одного типа чипов?

Архитектура центров обработки данных для искусственного интеллекта движется к неоднородным вычислительным кластерам, объединяющим центральные процессоры (CPUs), графические процессоры (GPUs), нейропроцессоры (NPUs) и специализированные ускорители, а также память с высокой пропускной способностью и медные и оптические технологии соединения. Этот переход отражает различия в характере задач обучения и вывода моделей, особенно по мере распространения агентных приложений искусственного интеллекта, которым требуется сочетание параллельных вычислений, управления состоянием, принятия решений и выполнения вызовов инструментов.

Об этом шла речь в дискуссии, организованной Semiconductor Engineering, с участием Satadal Bhattacharjee из Arm, Ashish Darbari из Axiomise, Moshiko Emmer из Cadence, Sharad Chole из Expedera, Cameron Brunner из Siemens EDA и Sumit Vishwakarma из Synopsys. Материал представляет собой третью и последнюю часть серии дискуссий об изменении архитектуры центров обработки данных для искусственного интеллекта.

От мощного сервера к распределённой системе

Кластеры с несколькими типами процессоров меняют саму природу инженерной задачи. Вместо проектирования одного сервера, который балансирует между вычислениями, памятью, вводом-выводом, производительность начинает зависеть от распределения рабочих нагрузок, моделей взаимодействия и способности сети соединения эффективно передавать данные и выполнять операции синхронизации.

Участники пояснили, что разные модели параллелизма, такие как Tensor parallel, data parallel, context parallel и pipeline parallel, требуют различных вариантов топологии сети. Параллелизм конвейера соединяет последовательные этапы, тогда как тензорный параллелизм требует широких операций объединения с последующей повторной трансляцией результатов. Поэтому выбор сети соединения становится частью определения кластера, а не отдельным от него компонентом.

Значение памяти возрастает по мере увеличения размеров моделей. Помимо фиксированных параметров модели существует изменяющийся контекст, зависящий от числа обрабатываемых запросов и объёма информации, которую сохраняет система. Поэтому стоимость памяти HBM и способ её использования становятся факторами, влияющими на эффективность GPU, особенно в центрах обработки данных, стремящихся увеличить количество запросов, обрабатываемых в секунду.

Разделение вывода между специализированными кластерами

Satadal Bhattacharjee считает, что одним из важных направлений является разделение конвейера вывода на отдельные этапы. Процесс начинается с этапа prefill, который обрабатывает запрос и определяет, что от него требуется; это вычислительно интенсивный этап. Затем следует этап decode, создающий ответ, после чего выполняется этап реализации задач агентами, например вызова инструментов или выполнения определённого действия.

В этой модели один кластер оборудования и программного обеспечения можно выделить для этапа prefill, другой — для этапа decode, а вычислительный кластер — для выполнения задач агентов, после чего объединить эти кластеры, согласно обсуждению, обычно посредством Ethernet. Это позволяет использовать каждый тип оборудования для подходящей ему задачи, вместо того чтобы задействовать один GPU для выполнения всех этапов.

Bhattacharjee упомянул объявление Nvidia об использовании Groq 3 LPU в кластере prefill как пример того, что для вывода может требоваться более одного типа процессоров. Он также отметил, что DigitalOcean объявила о развёртывании пятиуровневой архитектуры вывода, оптимизированной для использования неоднородных кластеров с оборудованием AMD и Nvidia, с возможностью последующего добавления нового оборудования.

Программное обеспечение — координационное звено

Недостаточно объединить CPUs, GPUs, NPUs и ускорители в одной системе. Программное обеспечение должно знать характеристики каждого компонента, решать, где выполнять каждый этап, и координировать передачу данных, планирование, ожидание и точки доступа к программным интерфейсам. CPU могут выполнять задачи управления состоянием, маршрутизации инструкций и вызова инструментов, тогда как ускорители берут на себя интенсивные вычисления, включая операции умножения матриц, связанные с выводом и рассуждением.

Виртуальные машины используются для абстрагирования кластеров на более высоком уровне, однако участники назвали среды на основе контейнеров, включая Docker, основным способом воспроизводимого развёртывания компонентов и цепочек инструментов для драйверов GPU. Над уровнем контейнеров остаются специализированные компоненты для выполнения и координации, планирования, управления очередями, развёртывания моделей и обслуживания программных интерфейсов.

Участники сочли наличие комплексной программной экосистемы одной из причин силы Nvidia после того, как компания инвестировала в программное обеспечение более 20 лет. Однако переход к оборудованию нескольких компаний требует координационного уровня, способного управлять этим разнообразием. В качестве компаний, работающих над созданием такого уровня, были упомянуты Gimlet Labs и Together AI, включая оптимизацию работы кластеров prefill, decode и выполнения.

Соединение и энергопотребление определяют масштабируемость

Варианты соединения между кластерами включают Ethernet, InfiniBand и Slingshot — высокоскоростную сетевую технологию на основе Ethernet от Hewlett Packard Enterprise. Согласно обсуждению, Ethernet обеспечивает более широкий стандарт, тогда как специализированные технологии могут предлагать более высокую производительность в определённых случаях, но при этом связывают систему с экосистемой конкретного поставщика.

Растёт также интерес к оптическим соединениям: Google использует модули TPU с оптическими линиями связи, а также исследуются технологии оптики, интегрированной в корпус (co-packaged optics). Привлекательность фотоники заключается в снижении сопротивления и рассеивания энергии по сравнению с электрическими соединениями, что важно для кластеров, уже сталкивающихся с проблемами нагрева и стоимостью охлаждения.

На уровне корпуса объединение нескольких чипов, памяти HBM и различных компонентов усложняет тепловые, механические и электрические эффекты. Температура, деформация, проблемы электромиграции и целостности сигнала могут повлиять на производительность узла и всего кластера. Поэтому требуется не столько одна универсальная технология соединения, сколько совместимые уровни соединения для каждого уровня — от соединения кристаллов внутри корпуса до сети кластера.

Почему это направление важно?

Вывод, сформулированный Bhattacharjee, заключается в том, что энергопотребление представляет собой главную проблему, а эффективность токенов занимает следующее место. Неоднородные кластеры предлагают способ снизить стоимость токена за счёт согласования оборудования с характером каждого этапа, однако для этого необходимы зрелое координационное программное обеспечение и чёткие измерения расположения данных, пропускной способности, теплового состояния и специализации каждого движка. Поскольку такая система обычно опирается на компоненты нескольких компаний, создание эффективно работающей в широком масштабе системы остаётся открытой инженерной задачей, а не простой заменой GPU другим ускорителем.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости