Облачные вычисления и центры обработки данных

Оптическое волокно меняет границы масштабирования кластеров искусственного интеллекта

Semiconductor Engineering отмечает, что традиционная зависимость от меди внутри сервера или стойки больше не является неизменным правилом по мере роста кластеров искусственного интеллекта: ограничения по потерям, расстоянию и энергопотреблению стимулируют внедрение оптических соединений в области scale-up. Оптические сети с коммутацией каналов circuit switching также привлекают всё больше внимания параллельно с развитием терминологии и методов масштабирования инфраструктуры.

2026-08-13
5 мин. чтения
14 просмотров
فريق تحرير certi.news
Оптическое волокно меняет границы масштабирования кластеров искусственного интеллекта

Архитектура сетей центров обработки данных, предназначенных для рабочих нагрузок искусственного интеллекта, меняется по мере выхода кластеров за пределы одной стойки, что расширяет роль оптических соединений и ослабляет традиционное правило, связывающее медь с операциями scale-up, а оптическое волокно — с операциями scale-out. Согласно материалу, опубликованному Semiconductor Engineering 13 августа 2026 года, рост скоростей передачи данных внутри стойки приближает медь к ограничениям по потерям, расстоянию и энергопотреблению, тогда как свет может обеспечить более подходящий путь для высоких скоростей передачи данных при условии контроля требований к энергопотреблению и надёжности.

Важность этого перехода обусловлена влиянием задержки на производительность графических процессоров. Эрик Агиляр, генеральный директор и соучредитель Omnitron, заявил, что, согласно многочисленным отчётам, эффективность GPU может составлять около 25%, поскольку они ожидают данные вместо выполнения работы. Поэтому выбор среды соединения определяется не только расстоянием, но и способностью сети поддерживать процессоры занятыми, сокращая задержки и напрасно расходуемую энергию.

От scale-up внутри стойки к более широкому масштабу

Обычно scale-up определялся как соединение внутри одной стойки с использованием меди, позволяющее обращаться к памяти с семантикой памяти. Однако это определение стало менее точным по мере распространения вычислительных кластеров на серверы в соседних стойках. В этом случае расстояние увеличивается, и медь может перестать быть оптимальным выбором.

Вишал Чандрасекар, руководитель направления управления продуктами в Ayar Labs, говорит, что медь, вероятно, будет использоваться внутри стойки, тогда как оптические соединения станут ожидаемым выбором при выходе за пределы соседних стоек. При скорости передачи 200 гигабит медь может подходить для расстояния до пяти метров или до семи метров при работе на пределе, тогда как оптические соединения становятся необходимыми при достижении десяти метров и более, по его оценке.

Это не означает исчезновения меди из всех приложений scale-up: наиболее устойчивым элементом определения scale-up может стать использование семантики памяти, а не расположение системы внутри одной стойки или тип физической среды. Приянк Шукла, руководитель направления управления IP-продуктами для интерфейсов в Synopsys, объяснил, что программное определение связано с наличием единого домена операционной системы и единой памяти, благодаря чему процессор может записывать данные в ячейку памяти независимо от её местоположения.

Появление термина scale-in

Наряду с scale-up, scale-out и scale-across появился новый термин — scale-in. По словам Чандрасекар, этот термин начали использовать в течение трёх месяцев, предшествовавших публикации материала; он обозначает объём полосы пропускания, исходящей от GPU и остающейся внутри одного серверного корпуса.

  • Scale-in: соединение между процессорами внутри одного сервера или на одной плате.
  • Scale-up: соединение в пределах общей памяти, традиционно связывавшееся с внутренним пространством стойки и медью.
  • Scale-out: соединение между стойками, использующее семантику Ethernet RDMA и всё больше опирающееся на оптические соединения.
  • Scale-across: соединение между разными центрами обработки данных или кампусами по оптическому волокну.

Стандарт UALink сохраняет основное ожидание для сред scale-up: каждый ускоритель должен находиться на расстоянии одного перехода от остальных ускорителей. По словам Шуклы, сети UALink разработаны для поддержания соединения между ускорителями через один коммутатор даже тогда, когда область scale-up выходит за пределы одной стойки. Этот коммутатор можно размещать в разных точках стоечной архитектуры, например в верхней части стойки или в её середине, однако принцип заключается в сохранении движения данных между двумя конечными точками в пределах одного перехода.

Топология и оптическая коммутация

По мере расширения области scale-up одного типа среды уже недостаточно для определения производительности: решающим фактором становится топология сети, соединяющей ускорители, коммутаторы и серверы. Одной из наиболее распространённых конструкций является архитектура Clos, или leaf-and-spine, обеспечивающая короткий путь между серверами. Однако, согласно материалу, Google использует в своей сети искусственного интеллекта топологию torus, в которой модули TPU соединяются с соседними модулями в трёх направлениях, придавая конструкции характер, напоминающий систолическую архитектуру systolic.

Сети torus обычно требуют переменного числа переходов для достижения одной точки из другой; показанный в материале маршрут может включать до четырёх переходов по сравнению с одним переходом в архитектуре leaf-and-spine. При использовании коммутации пакетов информацию о пакете необходимо проверять в каждом коммутаторе или маршрутизаторе. Поскольку оптическая технология не работает с пакетами напрямую, в каждом узле сигнал преобразуется из оптического в электрический для определения следующего перехода, а затем снова в оптический. Эти повторяющиеся преобразования увеличивают задержку и энергопотребление.

По этой причине технологии коммутации каналов circuit switching вновь возвращаются в центр обсуждения. Вместо обработки пакетов в каждом узле коммутация каналов открывает полный путь от источника к месту назначения и выделяет его для одного потока. Google внедрила оптическую сеть с коммутацией каналов в конфигурации torus, тогда как другие организации изучают возможность использования сетей OCS с различными топологиями. Это указывает на то, что масштабирование кластеров искусственного интеллекта связано не только с заменой меди светом, но и с пересмотром способов организации маршрутов, количества переходов и механизма передачи данных.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости