Ricoh a annoncé le 31 août 2026 le développement d’une technologie d’intelligence artificielle physique (Physical AI) visant à apprendre aux robots des actions liées au travail humain à partir de données d’images, plutôt que de relier directement le modèle à une architecture robotique ou à un mécanisme de contrôle spécifique. L’entreprise a déclaré avoir vérifié l’efficacité de cette technologie dans un environnement simulé construit sur la base de conditions physiques, dans le but de transférer l’entraînement de la simulation vers des robots réels.
Cette initiative s’inscrit dans la volonté de Ricoh d’étendre ses activités dans le domaine de l’intelligence artificielle, parallèlement à sa participation au programme AWS Japan visant à accélérer le développement de la Physical AI, qui fournit des ressources informatiques et des services cloud pour soutenir l’entraînement et les tests des modèles.
Apprendre à partir des actions plutôt que mémoriser les commandes du robot
La technologie repose sur un modèle Latent Action Model (LAM), ou modèle d’actions latentes. Le modèle apprend à partir des changements observés dans les images ou les vidéos enregistrées pendant l’exécution, afin d’inférer des actions telles que saisir un objet, le déplacer, l’éloigner ou déplacer un élément ciblé. Selon la description de Ricoh, le LAM se concentre sur l’apprentissage du comportement réel qui se produit dans la scène, même lorsque tous les détails du mouvement ou les commandes ne sont pas explicitement décrits dans les données d’observation.
L’entreprise indique que cette approche peut réduire la dépendance de l’apprentissage aux spécifications d’un robot particulier, car le modèle apprend une représentation générale de l’action au lieu de se limiter à des instructions liées à des articulations ou à des mécanismes de contrôle spécifiques. Des données issues des actions d’humains et de robots peuvent également être utilisées pour entraîner le modèle, puis ses sorties peuvent servir au développement de modèles Vision Language Action combinant vision, langage et action.
Qu’est-ce qui change concrètement ?
Le problème ciblé par Ricoh concerne le coût de la collecte des données d’entraînement. Les différences entre l’architecture de chaque robot et son mécanisme de contrôle imposent généralement de collecter des données pour chaque appareil séparément, ce qui devient plus complexe encore avec les robots humanoïdes. L’entreprise estime que la séparation entre la représentation de l’action et l’architecture du robot pourrait permettre de réutiliser davantage les données et de favoriser l’adaptation des modèles à plusieurs tâches et robots.
Cela ne signifie pas que la technologie élimine le besoin de données propres aux robots. Le document précise que Ricoh utilise des environnements simulés pour l’apprentissage, puis recourt à des techniques de Sim2Real pour transférer les résultats vers des robots réels, tout en continuant à vérifier l’adéquation des solutions à différents robots et environnements de travail.
Le rôle d’AWS dans l’entraînement et la simulation
Ricoh utilise des services cloud AWS, notamment Amazon EC2 et Amazon S3, pour construire un environnement d’apprentissage évolutif, stocker les données et exécuter l’entraînement des modèles. L’entreprise affirme que la combinaison de la simulation et des services cloud contribue à réduire le coût de la collecte de données physiques et permet également d’effectuer plus efficacement l’entraînement sur de grands volumes de données.
Cette initiative s’inscrit dans la vision annoncée par Ricoh pour sa transformation par l’intelligence artificielle, qui comprend des niveaux allant de la documentation sur l’intelligence artificielle, de l’intelligence artificielle générative et des agents d’intelligence artificielle jusqu’aux agents de Physical AI capables d’interagir avec le monde physique. Selon le document, l’entreprise travaille sur des applications potentielles dans les bureaux, les usines, la logistique et les soins.
Pourquoi cette nouvelle est-elle importante ?
L’importance de cette avancée réside dans la tentative de résoudre un obstacle pratique de la robotique fondée sur l’intelligence artificielle : comment réduire la nécessité de recueillir à nouveau des données et d’entraîner le modèle pour chaque robot ou chaque tâche ? Le LAM offre une voie pour apprendre les actions à partir de données visuelles plus générales, mais il ne prouve pas à lui seul que la technologie est prête pour une production à grande échelle.
Les résultats annoncés restent liés à des environnements simulés et à des tests de validation, tandis que Ricoh indique avoir commencé des démonstrations de faisabilité pour des robots humanoïdes dans des usines et travailler progressivement à des étapes de validation plus avancées. Les questions ouvertes concernent donc toujours le degré de réussite du transfert de la simulation vers la réalité, la quantité de données requise et la stabilité des performances lorsque les robots, les tâches et les environnements opérationnels varient.