World Labs宣布推出Atlas,这是一种新模型,公司将其描述为用于空间智能的“世界模型”。Atlas在单一架构中融合文本、图像、视频和三维数据,旨在理解元素之间的空间关系,而不只是生成彼此独立的图像或视频片段。
人工智能研究员Fei-Fei Li参与共同创立了World Labs。该公司成立于2024年,专注于让人工智能系统理解物理世界和三维关系。公司表示,Atlas从零开始进行预训练,其技术基础是一种结合了自回归、多模态扩散模型与Transformer的架构。
Atlas能做什么?
该模型能够将不同类型的输入整合到共享的空间上下文中,从而根据物体和环境的三维结构,推断场景中不可见的部分。其主要特点之一,是将摄像机的位置和运动轨迹作为直接输入,而不是仅通过文本指令描述摄像机运动。
基于一张至六张参考图像和预先指定的摄像机轨迹,Atlas可以生成分辨率为1440p、时长最长达一分钟的视频。它还可以根据一张图像,从不同角度推断物体或环境的形状,并扩展场景,使其包含原始图像中不可见的部分。该工具还能够将互不相关的图像放置到三维空间中的相应位置,并在同一环境内生成它们之间的过渡。
重建现实世界
World Labs表示,Atlas可用于以三维形式重建真实空间。重建许多场景可能只需两到三张图像,而提供数十张或超过一百张图像,则可以减少对不可见区域的推测需求,使结果更加接近原始环境。
其输出并不局限于图像和视频;该模型还能够生成三维点云和“3D Gaussian splat”格式的文件,这些输出可用于游戏、设计、视觉特效和机器人技术。
机器人模拟与当前限制
还可以利用真实环境的手机拍摄记录创建三维模拟,然后生成虚拟机器人摄像头和深度传感器在运动过程中可能看到的数据。通过模拟,可以改变物体的位置、光照、背景和机器人的运动,以创建多种训练和测试场景。
为什么这一发布值得关注?Atlas将内容生成、空间理解和模拟连接起来,使其更接近一种用于构建可探索环境并应用于机器人系统的工具,而不仅仅是视频生成模型。World Labs表示,该模型将成为用于创建三维世界的Marble平台及公司其他产品的基础。
不过,Atlas目前仍处于面向选定合作伙伴的早期访问阶段。公司尚未公布价格、公开提供时间、模型规模或训练所使用的计算能力。此外,关于其在根据零散图像进行三维重建方面优于部分专业开源模型的说法,依据的是公司的测试结果,尚未得到独立研究人员的验证。
2026年2月,World Labs在AMD、Autodesk、Nvidia、Fidelity及其他投资者参与下筹集了10亿美元资金,使其累计融资额达到约12.3亿美元。