로봇과 자율주행 차량을 위한 인공지능은 시각을 언어 또는 행동과 연결하는 모델에서, 행동 자체를 모델링하려는 구조로 전환되고 있다. 이 흐름은 ‘대규모 행동 모델’(Large Behavior Model), 즉 LBM이라고 불리며, MONOist는 이것이 자율주행 시스템과 로봇 개발에서 중요한 축이 될 수 있는 개념으로 보고 있다.
LBM은 기존 모델에 제한적인 기능을 추가하는 것이 아니라, 변화하는 물리적 환경에서 시스템이 행동하는 방식을 학습하는 방법을 재검토하는 접근이다. 텍스트나 이미지를 분석하거나 코드를 생성하는 데 그치지 않고, 움직임 및 실제 세계와의 상호작용에 직접 연결된 행동을 생성하는 것을 목표로 한다.
엔드투엔드 모델에서 행동 모델링으로
자율주행 연구는 오랫동안 ‘엔드투엔드’(End-to-End) 접근법에 의존해 왔다. 이 방식에서는 신경망이 카메라와 LiDAR 같은 센서 데이터를 입력받은 뒤, 분석·계획·제어 단계를 거쳐 차량을 주행시키거나 조종하는 출력을 생성한다.
이 접근법은 시스템이 데이터를 통합된 방식으로 학습할 수 있게 하지만, 의사결정을 해석하고 드물거나 변화하는 상황에 대응하는 데 어려움이 있다. 자료에 따르면 LBM은 미래 상태 예측, 환경 변화 이해, 다양한 조건에서 최적의 행동 선택을 포함하는 더 폭넓은 표현을 학습함으로써 이러한 격차를 해결하려 한다.
이 접근법은 대규모 언어 모델(LLM)과 이미지 생성 모델 같은 잘 알려진 생성형 인공지능 모델과 다르며, GitHub Copilot과 Claude Code 같은 프로그래밍용 인공지능 모델과도 다르다. LBM의 기본 출력은 텍스트나 이미지 또는 코드가 아니라 물리적 세계에서 실행할 수 있는 행동이다.
로봇 연구에서 시작된 개념
자료는 Toyota Research Institute(TRI)가 로봇 분야에서 이 개념을 체계적으로 제시한 초기 기관 중 하나였다고 설명한다. 2025년 TRI는 Boston Dynamics와의 공동 연구를 발표했으며, ‘Pretrained Large Behavior Models Accelerate Robot Learning’이라는 제목의 연구 논문을 제시했다.
MONOist는 매사추세츠 공과대학교의 Russ Tedrake가 LBM을 로봇 행동에 대한 포괄적인 모델로 설명했으며, ‘시각·언어·행동’ 또는 VLA 모델을 포함할 수 있는 일반적인 개념으로 보았다고 전했다. 이는 LBM이 반드시 기존 모델을 없애는 것이 아니라, 기존 모델을 포괄하면서 이해를 행동으로 전환하는 데 초점을 맞추는 더 넓은 프레임워크로 기능할 수 있음을 의미한다.
차량으로 개념을 확장하는 XPeng
또 다른 적용 사례는 자동차에서 로봇과 자율주행으로 활동을 확장하고 있는 중국 기업 XPeng에서 나타난다. 이 회사는 2024년에 인식과 차량의 직접 제어를 연결하는 VLA 모델을 발표했지만, VLA 모델만으로는 모든 자율주행 조건에 대응할 충분한 유연성을 제공하지 못한다고 결론 내렸다.
2026년 4월 24일, XPeng은 Auto China 2026에서 VLA 2.0 자율주행 시스템의 양산을 시작한다고 발표했으며, 이 시스템에 LBM이 도입되었음을 반영한다고 밝혔다. 이어 2026년 6월 3일 CVPR 2026에서 열린 콘퍼런스에서 VLA 2.0과 ‘월드 모델’(World Model)의 개발 및 활용에 관한 연구를 공개했다. 자료에 따르면 월드 모델은 LBM 구조의 구성 요소 중 하나다.
월드 모델은 환경을 시뮬레이션하고 환경이 어떻게 변화하는지 이해하는 데 사용되며, 이를 통해 시스템은 행동을 실행하기 전에 가능한 결과를 평가할 수 있다. LBM 이론에서는 이러한 능력이 단일 센서 신호나 개별 상황에 직접 반응하는 대신 가장 적절한 행동을 선택하는 데 도움을 준다.
이 뉴스가 중요한 이유
여기서 실제 변화는 독립적인 제품의 출시라기보다 로봇 및 자율주행 시스템의 아키텍처를 바라보는 사고방식의 전환이다. LBM이 성공한다면 제어 시스템은 각 상황에 별도의 규칙을 적용하는 데 덜 의존하고, 학습한 내용을 새로운 상황에 일반화하는 능력을 더 갖추게 될 수 있다.
그러나 자료는 LBM이 성숙한 표준이 되었거나 VLA 모델 또는 엔드투엔드 모델을 실제로 능가했다고 입증하지 않는다. 이 개념은 여전히 연구 프로그램과 초기 적용 사례에 연결되어 있으며, 물리적 세계에서 안전하고 해석 가능한 행동을 실행하려면 텍스트나 이미지만 생성하는 모델에는 나타나지 않는 요구 사항이 발생한다. 따라서 이러한 모델이 의사결정을 검증하고, 예상하지 못한 상황에 대응하며, 광범위한 상업적 사용에 충분한 신뢰성을 달성할 수 있는지는 여전히 미해결 과제로 남아 있다.
Toyota Research Institute와 XPeng의 참여는 경쟁이 단순히 모델의 규모에만 관한 것이 아니라 행동 데이터, 세계 시뮬레이션, 실제 제어 시스템과 모델의 연결에 관한 것임을 보여준다. 따라서 LBM은 로봇과 자율주행 차량에서 주목할 만한 흐름이지만, 아직 문제에 대한 최종 해법으로 간주해서는 안 된다.