World LabsはAtlasを発表した。同社はAtlasを、空間知能のための「世界モデル」と説明している。Atlasはテキスト、画像、動画、3Dデータを単一の構造内で統合し、個別の画像や動画を生成するだけでなく、要素間の空間的関係を理解することを目指している。
AI研究者のFei-Fei Liは、物理世界と3Dの関係をAIシステムに理解させることに注力するため2024年に設立されたWorld Labsの共同設立者である。同社によると、Atlasはゼロから事前訓練されており、技術的には自己回帰型のマルチモーダル拡散モデルとTransformerを組み合わせたアーキテクチャを採用している。
Atlasが提供するもの
このモデルは異なる種類の入力を共通の空間コンテキストに統合できるため、物体や環境の3D構造に基づいて、シーンの見えない部分を推定できる。主な特徴の一つは、カメラの位置と移動経路を、テキストによる指示でカメラの動きを説明するだけではなく、直接的な入力として扱える点だ。
1枚から6枚の参照画像と、あらかじめ指定したカメラ経路を基に、Atlasは1440p解像度で最長1分間の動画を生成できる。また、1枚の画像から物体や環境の形状を異なる角度から推定し、元画像には写っていない部分を含むようにシーンを拡張できる。このツールは、関連のない画像を3D空間内の適切な位置に配置し、単一の環境内でそれらの間の遷移を生成することも可能にする。
現実世界の再構築
World Labsによると、Atlasは現実の空間を3D形式で再構築するために利用できる。多くのシーンでは2枚または3枚の画像で再構築できる一方、数十枚、あるいは100枚を超える画像を提供すると、見えない領域を推測する必要性が減り、元の環境により近い結果が得られる。
出力は画像や動画に限られない。モデルは3Dポイントクラウドや「3D Gaussian splat」形式のファイルを生成でき、これらの出力はゲーム、デザイン、視覚効果、ロボット工学に活用できる。
ロボットシミュレーションと現在の制約
現実の環境をスマートフォンで撮影した映像を使って3Dシミュレーションを作成し、仮想ロボットのカメラや深度センサーが移動中に捉える可能性のあるデータを生成することもできる。シミュレーションでは、物体の位置、照明、背景、ロボットの動きを変更し、訓練やテスト用の複数のシナリオを作成できる。
この発表が重要な理由 Atlasはコンテンツ生成、空間理解、シミュレーションを結び付けており、単なる動画生成モデルではなく、ロボットシステムで探索・利用可能な環境を構築するためのツールに近い。World Labsによると、このモデルは3D世界を生成するプラットフォーム「Marble」や、同社のその他の製品の基盤となる。
ただし、Atlasは現在も選ばれたパートナー向けの早期アクセス段階にある。同社は価格、一般公開時期、モデルの規模、訓練に使用した計算能力を明らかにしていない。また、ばらばらの画像からの3D再構築において、一部の専門的なオープンソースモデルを上回るという主張は同社のテストに基づくものであり、独立した研究者による検証はまだ行われていない。
World Labsは2026年2月、AMD、Autodesk、Nvidia、Fidelityなどの投資家の参加を得て10億ドルを調達し、累計調達額は約12億3,000万ドルに達した。