Ricoh는 2026년 8월 31일, 로봇을 특정 로봇 구조나 제어 방식에 모델을 직접 연결하는 대신 이미지 데이터를 통해 인간의 작업과 관련된 행동을 학습시키는 물리적 인공지능(Physical AI) 기술을 개발했다고 발표했다. 회사는 물리적 조건을 기반으로 구축한 시뮬레이션 환경에서 이 기술의 효과를 검증했으며, 이는 시뮬레이션에서 실제 로봇으로 학습을 이전하는 것을 목표로 한다.
이번 조치는 Ricoh가 인공지능 사업을 확대하려는 방향의 일환이며, Physical AI 개발을 가속하기 위한 AWS Japan 프로그램에 참여하는 것과도 병행된다. 이 프로그램은 모델 학습과 테스트를 지원하기 위한 컴퓨팅 자원과 클라우드 서비스를 제공한다.
로봇 명령을 저장하는 대신 행동으로부터 학습
이 기술은 Latent Action Model (LAM), 즉 잠재 행동 모델에 기반한다. 이 모델은 작업 중 촬영된 이미지 또는 영상의 변화를 학습해 물체를 잡거나, 움직이거나, 치우거나, 목표 요소를 이동시키는 등의 행동을 추론한다. Ricoh의 설명에 따르면 LAM은 관찰 데이터에 움직임이나 명령의 모든 세부 사항이 명시적으로 기술되어 있지 않은 경우에도 장면에서 실제로 일어나는 행동을 학습하는 데 초점을 둔다.
회사는 이 방식이 특정 로봇의 사양에 대한 학습 의존도를 낮출 수 있다고 설명한다. 모델이 특정 관절이나 제어 방식에 연결된 지시만 학습하는 대신 행동에 대한 일반적인 표현을 학습하기 때문이다. 또한 인간과 로봇의 행동 데이터를 모델 학습에 사용할 수 있으며, 이후 모델의 출력을 시각·언어·행동을 결합하는 Vision Language Action 모델 개발에 활용할 수 있다.
실제로 무엇이 달라지는가?
Ricoh가 해결하려는 문제는 학습 데이터 수집 비용이다. 각 로봇의 구조와 고유한 제어 방식이 다르면 일반적으로 장치별로 데이터를 수집해야 하며, 이는 인간형 로봇에서 더욱 복잡해진다. 회사는 행동의 표현을 로봇 구조와 분리하면 데이터를 더 광범위하게 재사용할 수 있고, 여러 작업과 로봇에 맞게 모델을 조정하는 데 도움이 될 수 있다고 본다.
그렇다고 이 기술이 로봇별 데이터의 필요성을 없앤 것은 아니다. 본문에 따르면 Ricoh는 학습을 위해 시뮬레이션 환경을 사용한 다음, Sim2Real 기술을 활용해 결과를 실제 로봇으로 이전하고 있으며, 다양한 로봇과 작업 환경에 대한 솔루션의 적합성을 계속 검증하고 있다.
학습과 시뮬레이션에서 AWS의 역할
Ricoh는 Amazon EC2와 Amazon S3를 비롯한 AWS 클라우드 서비스를 사용해 확장 가능한 학습 환경을 구축하고, 데이터를 저장하며, 모델 학습을 실행한다. 회사는 시뮬레이션과 클라우드 서비스를 결합하면 물리적 데이터 수집 비용을 줄일 수 있고, 대규모 데이터에 대한 학습을 더욱 효율적으로 수행할 수 있다고 설명한다.
이번 이니셔티브는 Ricoh가 발표한 인공지능 전환 구상에 포함된다. 이 구상은 인공지능 문서화, 생성형 인공지능, 인공지능 에이전트에서 시작해 물리적 세계와 상호작용할 수 있는 Physical AI 에이전트로 이어지는 계층을 포함한다. 본문에 따르면 회사는 사무실, 공장, 물류, 돌봄 분야에서의 잠재적 활용 사례를 추진하고 있다.
이 소식이 중요한 이유
이번 개발의 중요성은 인공지능 기반 로봇에서 발생하는 실질적인 장애물, 즉 로봇이나 작업마다 데이터를 다시 수집하고 모델을 학습해야 하는 필요성을 어떻게 줄일 것인가를 해결하려는 시도에 있다. LAM은 보다 일반적인 시각 데이터로부터 행동을 학습하는 경로를 제시하지만, 그 자체만으로 기술이 대규모 생산에 적용될 준비가 됐음을 입증하는 것은 아니다.
발표된 결과는 여전히 시뮬레이션 환경과 검증 테스트에 기반하며, Ricoh는 공장에서 인간형 로봇을 대상으로 개념 증명 적용을 시작했고 더욱 발전된 검증 단계로 점진적으로 전환하고 있다고 설명한다. 따라서 시뮬레이션에서 현실로의 이전 성공률, 필요한 데이터 규모, 로봇과 작업 및 운영 환경이 달라질 때의 성능 안정성은 여전히 해결되지 않은 과제로 남아 있다.