World Labs a annoncé Atlas, un nouveau modèle que l’entreprise décrit comme un « modèle mondial » pour l’intelligence spatiale. Atlas rassemble le texte, les images, les vidéos et les données tridimensionnelles au sein d’une même architecture, afin de comprendre les relations spatiales entre les éléments plutôt que de se contenter de produire des images ou des vidéos séparées.
Fei-Fei Li, chercheuse en intelligence artificielle, a participé à la fondation de World Labs, créée en 2024 pour se concentrer sur la capacité des systèmes d’intelligence artificielle à comprendre le monde physique et les relations tridimensionnelles. L’entreprise affirme qu’Atlas a été préentraîné à partir de zéro et qu’il repose techniquement sur une architecture combinant un modèle de diffusion autorégressif et multimodal avec un Transformer.
Que propose Atlas ?
Le modèle peut intégrer différents types d’entrées dans un contexte spatial commun, ce qui lui permet d’estimer les parties invisibles d’une scène en s’appuyant sur la structure tridimensionnelle des objets et des environnements. L’une de ses principales caractéristiques est de traiter la position de la caméra et sa trajectoire comme des entrées directes, plutôt que de se contenter de décrire les mouvements de la caméra au moyen d’instructions textuelles.
À partir d’une à six images de référence et de trajectoires de caméra prédéfinies, Atlas peut créer une vidéo en résolution 1440p d’une durée allant jusqu’à une minute. Il peut également estimer la forme d’un objet ou d’un environnement sous différents angles à partir d’une seule image, et étendre la scène afin d’y inclure des parties invisibles dans l’image originale. L’outil permet aussi de placer des images sans lien entre elles à leur emplacement dans un espace tridimensionnel et de créer des transitions entre elles au sein d’un même environnement.
Reconstruction du monde réel
World Labs affirme qu’Atlas peut être utilisé pour reconstruire des espaces réels sous forme tridimensionnelle. Deux ou trois images peuvent suffire à recréer de nombreuses scènes, tandis que la fourniture de dizaines d’images ou de plus de cent images réduit la nécessité d’estimer les zones invisibles et augmente la proximité du résultat avec l’environnement original.
Les sorties ne se limitent pas aux images et aux vidéos : le modèle peut produire des nuages de points tridimensionnels et des fichiers au format « 3D Gaussian splat », des sorties pouvant être utilisées dans les jeux vidéo, le design, les effets visuels et la robotique.
Simulation robotique et limites actuelles
Des enregistrements réalisés avec un téléphone d’un environnement réel peuvent également être utilisés pour créer une simulation tridimensionnelle, puis générer les données que pourraient voir les caméras d’un robot virtuel et ses capteurs de profondeur pendant ses déplacements. La simulation permet de modifier la position des objets, l’éclairage, l’arrière-plan et les mouvements du robot afin de créer plusieurs scénarios d’entraînement et de test.
Pourquoi cette annonce est-elle importante ? Atlas relie la génération de contenu, la compréhension de l’espace et la simulation, ce qui en fait davantage un outil destiné à construire des environnements explorables et utilisables dans des systèmes robotiques qu’un simple modèle de génération vidéo. World Labs affirme que le modèle constituera la base de la plateforme Marble, destinée à créer des mondes tridimensionnels, ainsi que d’autres produits de l’entreprise.
Cependant, Atlas n’est encore accessible qu’à certains partenaires dans le cadre d’un accès anticipé. L’entreprise n’a révélé ni son prix, ni sa date de disponibilité générale, ni la taille du modèle, ni la puissance de calcul utilisée pour son entraînement. En outre, l’affirmation selon laquelle il serait supérieur à certains modèles open source spécialisés pour la reconstruction tridimensionnelle à partir d’images disparates repose sur les tests de l’entreprise et n’a pas encore été vérifiée par des chercheurs indépendants.
En février 2026, World Labs avait levé un financement d’un milliard de dollars avec la participation d’AMD, d’Autodesk, de Nvidia, de Fidelity et d’autres investisseurs, portant le total de ses financements à environ 1,23 milliard de dollars.