World Labs объявила о выпуске Atlas — новой модели, которую компания описывает как «мировую модель» для пространственного искусственного интеллекта. Atlas объединяет текст, изображения, видео и трёхмерные данные в единой архитектуре, стремясь понимать пространственные взаимосвязи между объектами, а не ограничиваться созданием отдельных изображений или видеороликов.
Fei-Fei Li, исследовательница в области искусственного интеллекта, участвовала в создании World Labs, основанной в 2024 году для развития систем искусственного интеллекта, способных понимать физический мир и трёхмерные взаимосвязи. Компания утверждает, что Atlas предварительно обучалась с нуля и технически основана на архитектуре, объединяющей авторегрессионную мультимодальную диффузионную модель и трансформер (Transformer).
Что предлагает Atlas?
Модель способна объединять различные типы входных данных в общем пространственном контексте, что позволяет ей оценивать невидимые части сцены на основе трёхмерной структуры объектов и сред. Одной из её ключевых особенностей является использование положения камеры и траектории её движения в качестве прямых входных данных, а не только описания движения камеры с помощью текстовых команд.
На основе от одного до шести исходных изображений и заранее заданных траекторий камеры Atlas может создавать видео в разрешении 1440p продолжительностью до одной минуты. Она также может оценивать форму объекта или среды с разных ракурсов, исходя из одного изображения, и расширять сцену, добавляя части, не видимые на исходном изображении. Кроме того, инструмент позволяет размещать несвязанные изображения в соответствующих местах трёхмерного пространства и создавать переходы между ними внутри единой среды.
Реконструкция реального мира
World Labs заявляет, что Atlas можно использовать для реконструкции реальных пространств в трёхмерном формате. Для воссоздания многих сцен может быть достаточно двух или трёх изображений, тогда как предоставление десятков или более ста изображений уменьшает необходимость угадывать невидимые области и повышает сходство результата с исходной средой.
Результаты не ограничиваются изображениями и видео: модель способна создавать трёхмерные облака точек и файлы в формате «3D Gaussian splat» — результаты, которые можно использовать в играх, дизайне, визуальных эффектах и робототехнике.
Роботизированное моделирование и текущие ограничения
Записи, снятые на телефон в реальной среде, также можно использовать для создания трёхмерной симуляции, а затем генерировать данные, которые могли бы видеть камеры виртуального робота и его датчики глубины во время движения. Симуляция позволяет менять положение объектов, освещение, фон и движение робота для создания множества сценариев обучения и тестирования.
Почему это объявление важно? Atlas связывает генерацию контента с пониманием пространства и симуляцией, что делает её скорее инструментом для создания сред, доступных для исследования и использования в роботизированных системах, чем просто моделью для генерации видео. World Labs заявляет, что модель станет основой платформы Marble для создания трёхмерных миров и других продуктов компании.
Тем не менее Atlas по-прежнему находится на этапе раннего доступа для избранных партнёров. Компания не раскрыла цену, сроки публичного запуска, размер модели или вычислительные мощности, использованные для её обучения. Кроме того, утверждение о превосходстве модели над некоторыми специализированными моделями с открытым исходным кодом в реконструкции трёхмерных сцен по разрозненным изображениям основано на тестах компании и пока не было проверено независимыми исследователями.
В феврале 2026 года World Labs привлекла финансирование в размере 1 миллиарда долларов при участии AMD, Autodesk, Nvidia, Fidelity и других инвесторов, увеличив общий объём привлечённых средств примерно до 1,23 миллиарда долларов.