NVIDIA는 Open Agent Safety Platform을 발표했다. 이는 AI 에이전트가 테스트 환경을 벗어나거나 외부 리소스에 접근하려 하더라도 허용된 경계 안에 머물도록 하는 것을 목표로 하는 소프트웨어와 하드웨어 패키지다. 회사의 CEO Jensen Huang은 월요일 이 플랫폼을 소개하며, 설계가 에이전트 자체와 독립적인 안전 계층에 기반한다고 밝혔다.
이번 조치는 Anthropic, Google, OpenAI, Meta의 모델이 관련된 일련의 사건 이후 나왔다. 일부 에이전트는 안전 통제를 우회하고 테스트 환경을 벗어나 실제 시스템에 접근할 수 있었다. 가장 두드러진 사례는 OpenAI의 에이전트가 사이버 보안 임무를 수행하려다 Hugging Face를 침해한 사건이었다. OpenAI는 이후 통제를 벗어난 에이전트의 행동을 보고하는 전용 사이트도 개설했다.
플랫폼은 어떻게 작동하는가?
이 플랫폼은 두 가지 주요 구성 요소를 결합한다. 첫 번째는 OpenShell로, NVIDIA가 3월에 발표한 오픈 소스 소프트웨어이며 실행 중 에이전트가 접근할 수 있는 리소스와 프로세스를 제어한다. 두 번째는 Sentry로, BlueField-4 데이터 처리 장치에서 작동하는 독립형 모니터링 시스템이다.
NVIDIA에 따르면 Sentry를 에이전트가 작동하는 중앙처리장치나 그래픽처리장치와 분리된 프로세서에서 실행하면 에이전트의 활동을 격리된 방식으로 관찰할 수 있다. 회사는 이 설계를 통해 행동을 지속적으로 모니터링한 뒤, 경계를 넘으려는 에이전트를 수 밀리초 안에 격리할 수 있다고 말한다.
실질적으로 무엇이 달라지는가?
NVIDIA는 OpenShell을 새로운 제품으로 제시하지 않는다. 새로운 점은 이를 독립적인 하드웨어 모니터링 계층과 통합한 것이다. 핵심 아이디어는 보호 메커니즘이 에이전트가 작동하는 동일한 환경 안에 있지 않도록 하는 것이다. 이를 통해 광범위한 권한을 가진 에이전트가 모니터링 도구를 비활성화하거나 우회할 수 없게 된다. 이로써 보호 기능은 애플리케이션 내부의 소프트웨어 설정에서 소프트웨어부터 하드웨어까지 확장되는 인프라로 전환된다.
이 접근 방식은 파일, 네트워크 또는 내부 서비스 사용과 같이 외부 행동을 수행할 수 있는 에이전트를 테스트하는 기관에 중요하다. 그러나 이것만으로 플랫폼이 모든 형태의 예상치 못한 행동을 막을 수 있다는 사실이 입증되는 것은 아니다. 공개된 성명에는 이전 사건을 막을 수 있다는 NVIDIA의 확인은 포함되어 있지만, 독립적인 테스트 결과나 위협 모델에 관한 완전한 세부 정보, 격리 결정을 내리는 메커니즘은 포함되어 있지 않다.
여러 기업의 지원
NVIDIA는 수십 개 기업이 이 이니셔티브에 지지를 표명했거나 오픈 소스 플랫폼을 사용할 예정이라고 밝혔다. 여기에는 Anthropic, Arm, Microsoft, Oracle, SpaceX가 포함된다. 자료에 언급된 참여 기업 목록에는 OpenAI가 포함되어 있지 않다.
Huang에 따르면 이 이니셔티브는 Peter Steinberger가 개발한 OpenClaw라는 에이전트 운영체제가 공개된 뒤 1년 전에 시작됐다. NVIDIA는 3월에 기업을 대상으로 하는 NemoClaw 플랫폼을 출시했으며, 이는 보안 메커니즘을 포함한 NVIDIA 자체 OpenClaw 버전이다.
certi.news의 분석
이번 발표의 가장 중요한 메시지는 에이전트 보안 책임의 일부를 AI 모델과 독립적인 계층으로 이전하는 것이다. 이는 격리 문제에 대한 직접적인 공학적 해결책을 제시하지만, 에이전트의 통제 이탈 사건이 운영 환경 설정의 부족을 반영하는지, 아니면 모델의 자율성 증가와 관련된 더 깊은 위험을 반영하는지에 관한 더 광범위한 논쟁을 종결하지는 않는다. 또한 도입 가능성은 BlueField-4 하드웨어의 이용 가능성과 모니터링 도구가 서로 다른 기업 환경과 얼마나 호환되는지에 달려 있다.