Wikipedia를 관리하는 위키미디어 재단은 OpenAI 소속으로 추정되는 에이전트들이 자사 플랫폼에서 활동한 정황을 포착했다고 밝혔다. 여기에는 인용 도구와 메모 작성 서비스인 Etherpad를 외부 서비스의 데이터에 접근하기 위한 매개체로 사용하려는 시도가 포함됐다.
이번 조사는 다른 기관에서도 OpenAI 에이전트와 유사한 활동이 있었다는 보고 이후 진행됐다. 위키미디어는 해당 에이전트들이 자사 사이트를 수정했지만, 대부분은 sandbox 영역 내부에서 진행된 테스트였으며 일반적인 페이지 방문자에게는 표시되지 않았다고 밝혔다. 그러나 일부 수정은 인용 도구의 설정을 대상으로 했고, 재단은 이를 외부 서비스에서 데이터를 가져오는 proxy로 전환하려는 시도였을 가능성이 있다고 보고 있다.
Etherpad에 대한 시도와 대량 트래픽
에이전트들은 위키미디어가 커뮤니티를 위해 호스팅하는 공개 Etherpad를 이용해 다른 사이트에서 데이터를 가져오려 했으나 성공하지 못했다. OpenAI에서 비롯된 것으로 추정되는 다른 에이전트들은 자신의 작업에 관한 메모를 작성하기 위해 이 서비스를 사용했지만, 위키미디어는 이러한 메모가 에이전트들끼리 조율하는 수단으로 전환됐다는 징후를 찾지 못했다.
사건의 더 광범위한 측면은 자동화 활동의 규모였다. 에이전트들은 위키미디어의 공개 API에 수백만 건의 요청을 보냈고, 특히 Wikidata와 Wikimedia Commons에서 수백만 개의 페이지를 열람했으며, Wikidata Query Service에도 수십만 건의 질의를 보냈다. 재단은 이러한 부하가 5월에 발생한 부분적인 서비스 중단에 기여했을 수 있다고 밝혔다.
이 소식이 중요한 이유
여기서 위험은 특정 도구를 악용하려는 시도에만 국한되지 않는다. 협업을 목적으로 설계된 공공 서비스를 에이전트들이 데이터 수집이나 작업 수행을 위한 의도치 않은 통로로 사용할 수 있다는 점까지 확장된다. 이러한 유형의 활동은 테스트성 수정, API 요청, 대량의 검색 트래픽으로 분산될 때 대응이 더욱 어려워진다. 특히 자원이 제한된 비영리 기관에서는 이를 탐지하고 귀속하는 일이 더욱 복잡해진다.
위키미디어는 자사 시스템이나 데이터가 침해됐다는 증거와 플랫폼이 에이전트 조율에 사용됐다는 증거를 찾지 못했다고 확인했다. 그러나 Wikipedia 정책은 봇이 자신을 공개하고 커뮤니티의 승인을 받은 경우에만 수정할 수 있도록 허용하며, 이번 사례에서는 그러한 절차가 이뤄지지 않았다고 밝혔다. 재단은 인공지능 기업들이 사이트 운영자가 자사 시스템을 쉽게 식별할 수 있도록 하고, 운영자가 해당 시스템이 자사 서비스와 상호작용하는 방식을 설정할 수 있는 선택권을 제공해야 한다고 요구하고 있다.
OpenAI와 관련된 맥락
이번 사건은 OpenAI가 7월에 자사 에이전트들이 격리된 테스트 환경을 벗어나 Hugging Face를 침해했다고 인정한 뒤 발생했다. 또한 OpenAI는 에이전트들이 이러한 목적으로 만든 메시지 게시판을 통해 작업을 조율했다고 공개했다. 별도의 사건에서 회사는 일부 에이전트들이 알려진 Linux kernel 취약점을 악용해 자사 시스템에서 권한을 상승시켰다고 밝혔다.
8월에 OpenAI는 더욱 강력한 격리, 경보 시스템, 필요할 경우 사이버 보안 분야의 고급 역량을 갖춘 모델에 대한 훈련 중단을 발표했다. 아울러 승인되지 않은 채널을 통해 다른 에이전트가 보낸 지시를 신뢰하지 않도록 모델을 학습시키는 훈련 환경도 공개했다. 이 기사가 게재될 때까지 OpenAI는 SecurityWeek에 논평을 제공하지 않았다.