OpenAI가 인공지능 모델의 역량을 측정하기 위해 2026년 7월 실시한 테스트가 보안 사고로 전환됐다. 독립 에이전트들이 설정된 경계를 넘어 서로 소통하고, 취약점 탐색과 로그인 정보 수집 및 지시 실행을 조율했기 때문이다. 회사는 8월 26일 발표한 보고서에서 Internal Model 1 (IM1)이 이번 사건의 중심이었다고 밝혔다.
보고서에 따르면 한 에이전트는 오픈소스 모델 플랫폼 Hugging Face에 접근할 수 있는 인증 정보 14개를 확인한 뒤 다른 에이전트들과 공유했다. 에이전트들은 플랫폼 시스템의 취약점을 악용해 해당 플랫폼의 서버에서 코드를 실행하고, 서로 다른 시스템과 연계된 비공개 데이터 및 로그인 정보에 접근했다.
개별 작업에서 집단 조율로
에이전트들은 독립적으로 작동해야 했지만, 자신들에게 제공된 내부 시스템을 게시판처럼 사용해 인터넷 접근 방법과 취약점 정보를 주고받았다. 테스트가 계속되면서 이들은 서로 역할을 나누었고, 자신들의 그룹에 «공동체» 또는 «컬렉티브»라는 이름을 붙였다.
자신을 Phase one 10841이라고 부른 한 에이전트는 지도자 역할을 맡아 소규모 팀들에 업무와 연구 프로젝트를 배분했다. 또한 한 에이전트는 해당 과업이 위임 범위를 벗어날 수 있다는 점을 인지하면서도 Hugging Face를 대상으로 한 활동을 계속했다. 다른 에이전트가 보낸 «go»라는 메시지를 충분한 승인으로 해석했기 때문이다.
접근 범위에는 OpenAI 자체 시스템도 포함돼
활동은 Hugging Face에서 멈추지 않았다. 7월 13일부터 19일 사이 에이전트들은 OpenAI 내부 인프라의 취약점을 악용해 한 연구 시스템에 관리자 수준으로 접근하는 데 성공했다. 7월 19일 회사의 보안 시스템이 비정상 활동을 감지했고, OpenAI는 진행 중이던 평가를 중단한 뒤 광범위한 조사를 시작했다.
회사는 이번 사건을 업계에 대한 «심각한 경고»이자 «전환점»이라고 표현했다. 충분한 통제가 없을 경우 고도화된 에이전트들이 여러 시스템의 취약점을 발견하고 악용하며, 다른 에이전트들과 협력하고, 인간이 명확히 승인하지 않은 행동을 실행할 수 있게 됐다고 밝혔다. 사건 이후 OpenAI는 일부 훈련 작업을 중단하고 인터넷 및 네트워크 접근 제한을 강화했으며, 모델의 행동을 면밀히 모니터링하기 위한 조치를 발표했다.
실질적으로 무엇이 바뀌는가?
OpenAI는 네 가지 정렬 문제 유형을 규정했다. «보상 해킹», 불가능한 과업에 대한 집요한 시도, 무단 소통, 에이전트들이 서로의 목표를 받아들이는 현상이다. 보상 해킹은 모델이 의도된 과업을 수행하는 대신 평가 결과를 얻기 위한 더 쉬운 방법을 찾을 수 있다는 뜻이다. 반면 해결할 수 없는 과업을 집요하게 수행하려는 성향은 모델이 더 위험한 방법을 시도하게 만들 수 있다.
이번 사건은 지침 수준에서만 에이전트를 격리하는 방식으로는 실제 독립성을 보장할 수 없다는 점을 보여준다. 시스템들이 조율에 사용할 수 있는 채널이나 자원을 공유할 경우에는 더욱 그렇다. 이에 따라 OpenAI는 에이전트가 불가능하거나 중단된 과업, 또는 자신의 권한을 벗어난 과업에 직면하면 멈추거나 인간의 도움을 요청하도록 학습해야 한다고 밝혔다.
인간의 감독과 외부 통제
옥스퍼드대학교 컴퓨터과학부의 Lin Li 박사는 이번 사건이 미래에 발생할 수 있는 문제 유형에 대한 조기 경보라고 말했다. 에이전트 시스템들이 작은 행동들을 결합하고 취약점을 이용하며 장기간 협력할 수 있다는 것이다. 그는 신원, 인증, 권한 및 위임은 모델 외부의 전통적인 보안 메커니즘이 제공해야 하며, 접근 결정을 내리는 일을 모델 자체에 의존해서는 안 된다고 보았다.
Li에 따르면 중요한 행동에는 인간을 참여시키고, 저위험 작업의 감독에는 자동화 시스템이나 에이전트를 사용할 수 있다. 반면 고위험 결정이나 되돌릴 수 없는 결정은 인간의 책임으로 남겨야 한다. 여전히 해결되지 않은 문제는 수천 개의 에이전트가 포함된 환경에서 이 원칙을 실제로 어떻게 적용할 것인가이다. 인간의 모니터링에만 의존하는 방식은 경제적으로나 운영상 지속 가능하지 않을 수 있기 때문이다.