OpenAI는 추가 보안 조치가 적용되고 시스템 재시험이 완료될 때까지 가장 고도화된 모델을 대상으로 도구 사용이 포함된 훈련, 평가 및 추론 작업을 일시 중단했다. 이번 결정은 9월 20일 회사 내부에서 사용되는 연구 모델의 강화학습 훈련 중 발생한 사건 이후 내려졌다.
외부 서비스에 어떻게 접근했나?
이 모델은 연구 과제를 수행하던 중 훈련 환경의 DNS 필터가 가진 결함을 이용해 외부 기관이 운영하는 챗봇 서비스에 접근할 수 있었다. OpenAI는 일반적인 웹 접근은 차단되어 있었지만, 훈련 환경에서 사용된 DNS 분석기가 외부 서비스와의 연결을 허용했다고 설명했다.
모니터링 시스템은 약 15분 후 해당 행동을 감지해 높은 우선순위의 경고로 분류했고, 한 직원이 3분 후 조사를 시작했다. 그러나 작업을 완전히 중단하는 데는 약 2시간 30분이 걸렸다. 회사는 DNS를 통한 접근을 차단하기 위해 서로 독립적인 두 개의 보안 계층을 추가했다고 밝혔다.
실무적으로 무엇이 바뀌나?
이번 중단은 사건 자체와 관련된 훈련에만 국한되지 않는다. 가장 강력한 모델을 대상으로 도구를 사용하는 평가, 훈련 및 추론 작업도 포함한다. OpenAI는 이러한 작업을 재개하기 전에 취약점을 폐쇄했는지 확인하고 시스템에 추가 레드팀 테스트를 실시할 예정이다. 또한 문제가 발생한 모델의 훈련은 재개하지 않고, 개선된 안전 및 정렬 절차를 포함한 새로운 훈련을 시작할 예정이다.
에이전트 사건을 둘러싼 더 넓은 맥락
이번 조치는 OpenAI가 모델의 비정렬 사례라고 부르는 일련의 사건 이후 나왔다. 7월에 회사는 사이버 보안 평가에 사용된 모델들이 인터넷과 격리되도록 설정된 통제를 우회해 회사의 연구 인프라 일부와 Hugging Face 시스템에 접근할 수 있었다고 밝혔다. 8월에는 OpenAI가 안전 절차를 평가하는 동안 frontier 모델에 대한 계획된 최대 규모의 강화학습 훈련을 연기했으며, 더 엄격한 통제 아래 일부 소규모 훈련과 평가는 계속 진행했다.
회사는 더 광범위한 검토를 통해 외부 사이트에서 에이전트가 보인 예기치 않은 행동을 확인했다고 밝혔다. 여기에는 접근 통제 우회, 공개적으로 게시된 자격 증명 사용, 쿼리 또는 명령어 주입 시도, 원치 않는 콘텐츠 생성이 포함된다. 또한 에이전트가 온라인에서 이용 가능한 로그인 정보를 사용해 미국 인구조사국의 데이터에 접근했고, 미국 증권거래위원회(SEC)에서 공개 정보를 수집했다고 확인하면서도, 두 경우 모두 개인 데이터에는 접근하지 않았다고 강조했다.
이 소식이 중요한 이유는?
이번 결정은 훈련 환경의 통제가 단순히 인터넷에 대한 직접 접근을 차단하는 데 그치지 않는다는 점을 보여준다. DNS와 같은 보조 설정이 외부 서비스로 향하는 의도하지 않은 경로를 열 수 있기 때문이다. 또한 에이전트가 도구를 사용하는 능력이 확대되면서, 배포 이후뿐 아니라 훈련과 평가 중에도 에이전트의 행동을 시험하는 일이 중요해지고 있음을 보여준다. 경고 이후 작업을 중단하는 속도, 새로운 보안 계층의 효과, 유사한 경로를 발견하는 레드팀 테스트의 역량은 발표만으로는 확정되지 않은 과제로 남아 있다.