Рани Буркар, которая в Microsoft руководит подразделениями, отвечающими за планирование, проектирование, разработку и развертывание аппаратного обеспечения и инфраструктуры облачной вычислительной платформы, предлагает иной подход к измерению прогресса в эпоху искусственного интеллекта. Вместо концентрации на количестве чипов, размере центров обработки данных или числе токенов, которые может генерировать система, она предлагает использовать понятие «отдачи» (Yield): то есть объёма полезного результата, который можно получить из доступных ресурсов.
Буркар заимствует это понятие из полупроводниковой промышленности, где отдача обозначает количество исправных чипов, которые можно получить из каждой пластины. Согласно её видению, этот принцип следует распространить на капитал, энергию, память, коммуникации, модели и программное обеспечение — вплоть до ценности, которую искусственный интеллект создаёт в работе и повседневной жизни.
Почему одного наращивания инфраструктуры уже недостаточно?
В материале отмечается, что распространение искусственного интеллекта ускорилось сильнее, чем это происходило с интернетом, персональными компьютерами и смартфонами, однако в глобальном масштабе его использование по-прежнему охватывает лишь около 18% рабочей силы, а большая часть применения сосредоточена на диалогах. По мере перехода систем к задачам рассуждения, планирования, использования инструментов и выполнению более продолжительных агентных рабочих процессов требования к инфраструктуре радикально меняются.
Буркар отмечает, что одна агентная задача может использовать более чем в 3400 раз больше токенов, чем обычные диалоговые взаимодействия. Такой рост создаёт нагрузку на энергопотребление, плотность стоек, объём передаваемых данных и ёмкость памяти. Она считает, что традиционный ответ в виде добавления большего количества кремния, памяти, энергии и оптоволокна не может продолжаться бесконечно, поскольку каждое новое улучшение может требовать больше ресурсов, чем предыдущее поколение.
В рамках этого видения предлагаются два параллельных направления: постепенные улучшения существующих архитектур для повышения эффективности, утилизации ресурсов и экономической целесообразности, а также более глубокие преобразования, меняющие кривую производительности за счёт новых архитектур, материалов и методов проектирования систем и моделей. Буркар ссылается на переход процессоров к многоядерной архитектуре после того, как увеличение тактовой частоты столкнулось с энергетическим барьером, а также на переход памяти NAND от планарной к вертикальной конструкции.
Отдача — результат взаимодействия всех уровней
В материале подчёркивается, что узкое место не обязательно устраняется на том уровне, где оно проявляется. Измерения производительности отдельного компонента недостаточно, поскольку выигрыши и потери накапливаются между центром обработки данных, кремнием, моделями и инструментами, координирующими задачи агентов. Поэтому Буркар призывает к «совместному проектированию», при котором сначала определяется требуемый результат, а затем оптимизируется вся система, вместо того чтобы максимизировать производительность одного элемента.
В области памяти Microsoft считает, что проблема заключается не только в нехватке компонентов, но и в системном вызове. Для вывода результатов необходимо обрабатывать более крупные модели и более длинные контексты, а также быстро предоставлять данные, тогда как агенты добавляют генерацию, извлечение, использование инструментов и постоянную память в рамках циклов, которые могут продолжаться минуты или часы. Опыт платформы Azure Maia показывает, что сокращение потребления памяти KV cache может объединять проектирование модели, науку о данных и сжатие, а также управление программным обеспечением и иерархиями памяти, оптимизацию кремния, перемещения данных и компиляторов.
Суть здесь не просто в добавлении новых байтов, а в извлечении большего объёма полезного интеллекта из каждого доступного байта.
От сетей к энергии
На уровне кластеров интеллект создаётся не одним чипом, а тысячами чипов, работающих как единая система. Поэтому результат зависит не только от скорости соединений, но и от управления перегрузками, восстановления после сбоев, распределения рабочих нагрузок, сложности программирования и границ между кремнием, системой и программным обеспечением.
Буркар говорит, что проектирование платформы Maia началось с желаемого результата — эффективного вывода результатов в масштабе всего парка, — а не с заранее заданной конструкции сети. Это включало создание двухуровневой сети масштабирования, интеграцию функций сетевой карты в чип и разработку специализированного транспортного уровня. Согласно материалу, такой подход обеспечил масштабируемую производительность в плотных кластерах вывода, упростил программирование, повысил гибкость рабочих нагрузок и сократил необходимое сетевое оборудование.
Энергия же превратилась из ресурса, который система просто потребляет, в ограничение, учитываемое при проектировании — от электросети до чипа. В материале говорится о росте мощности стоек с десятков до сотен киловатт, а также о работе комплексов центров обработки данных в диапазоне гига-ватт. Среди решений упоминаются твердотельные трансформаторы и распределение постоянного тока напряжением 800 вольт для снижения потерь при распределении.
Microsoft приводит серверный процессор Azure Cobalt 200 на базе Arm как пример такого совместного проектирования: он позволяет каждому ядру отдельно управлять напряжением и частотой, а также программно определять энергопотребление каждой виртуальной машины. Компания утверждает, что точное управление позволяет регулировать энергопотребление при сохранении производительности критически важных рабочих нагрузок, благодаря чему в тех же энергетических пределах можно запускать больше серверов.
Что это означает на практике?
Значимость этого подхода заключается в переносе дискуссии от гонки за валовой ёмкостью к эффективности преобразования ресурсов в результаты. Для операторов облачных платформ и центров обработки данных это означает, что оценка оборудования неотделима от сетей, программного обеспечения, охлаждения и управления нагрузками. Для разработчиков моделей и агентов эффективность памяти, продолжительность задач и интеграция инструментов становятся факторами, влияющими на масштабируемость не меньше, чем размер модели.
Однако этот вывод остаётся видением Microsoft и частично основан на её опыте создания и эксплуатации инфраструктуры искусственного интеллекта в крупном масштабе, а не независимым стандартом, подтверждённым для всех сред. Кроме того, в материале не приводятся подробные сравнительные показатели для измерения преимуществ Maia или Cobalt 200 и не указываются стоимость или сроки внедрения упомянутых решений за пределами контекста Azure.
Тем не менее «необходимость отдачи» ставит перед отраслью практический вопрос: приводят ли растущие инвестиции в энергию, чипы и центры обработки данных к искусственному интеллекту, доступному по приемлемой цене, а также к ощутимым производительности и ценности? В представлении Буркар отдача не завершается производством токенов, а возникает тогда, когда эти результаты превращаются в более быстрое научное открытие, медицинский сигнал, выявленный на ранней стадии, более качественное обучение или новые возможности для малых компаний.