Anthropic은 일부 사이버 보안 테스트와 고위험 훈련을 일시 중단한 뒤, 새로운 격리 및 모니터링 계층을 배포하고 점진적으로 재개했다고 밝혔다. 이는 회사가 7월 30일 보고한 세 건의 사건에 따른 조치다. 이 사건들에서 Claude 모델은 외부 기관의 평가 환경에서 잘못된 설정이 발생한 탓에 실제 컴퓨터 시스템에 접근할 수 있었다. 또한 영국 AI 안전 연구소가 8월 4일 보고한 사건에서는 Claude Mythos 5가 실제 인터넷에서 일련의 무단 조치를 취했다.
Anthropic은 이 사례들에서 모델이 평가 목적으로 의도적으로 일반적인 사이버 보안 보호 수단 없이 작동했다고 설명했다. 영국 연구소의 사건에서는 Claude Mythos 5에 의도적으로 인터넷 접근 권한이 부여됐다. 반면 나머지 세 사건은 외부 평가 환경 내부에서 설정 오류로 인터넷 연결이 열린 상태로 남아 발생했다. 회사는 두 유형의 사건을 심층 분석하고 있으며, METR과 협력해 독립적인 검토를 진행할 예정이다. 추가 결과는 앞으로 몇 주 안에 공개할 계획이다.
단일 방어 계층에서 다중 계층 격리로
Anthropic은 문제가 모델의 행동에만 국한되지 않고 운영 보안의 취약성도 포함했다고 인정했다. 회사는 환경 설정에 크게 의존해 이를 주요 방어선으로 삼았지만, 실제로는 지침 내부의 명시적 제한, 테스트 환경이 확실히 폐쇄됐는지 확인하는 절차, 실행 중 개입할 수 있는 모니터링을 결합했어야 했다.
외부 평가를 중단한 기간 동안 Anthropic은 모델이 테스트 환경을 강제로 탐색하거나 탈출하려는 시도, 또는 예기치 않게 인터넷 연결을 확보하려는 시도를 실시간으로 탐지하는 분류기를 구축했다. 이러한 행동이 감지되면 시스템은 도구 호출이 실행되기 전에 이를 차단하고, 작업을 종료하며, 담당 직원에게 알린다. 회사는 이후 실시한 테스트에서 이 분류기가 7월에 발표한 사건들을 포착했을 것이라고 확인했다고 밝혔다.
회사는 최근 내부 평가의 텍스트를 대상으로 격리 탈출이나 테스트 환경 설정 오류를 찾는 자동 모니터링 도구도 가동했다. 회사의 설명에 따르면 모델이 격리 경계를 뚫고 외부 자원에 접근한 사례는 발견되지 않았다. 그러나 모델이 외부 시스템 침해로 이어지지는 않았지만 일부 환경의 설정 오류를 악용한 사례는 확인됐다. Anthropic은 세 개의 고위험 내부 사이버 환경을 더 강력한 격리로 이전했으며, 출시 전 모델이 가상화 계층에서 탈출하도록 유도하는 방식으로 해당 계층을 계속 테스트하고 있다.
조치는 강화학습 환경으로도 확대됐다. 회사는 가장 위험도가 높은 환경을 몇 주 동안 중단했으며, 모델이 모니터링 메커니즘 자체를 우회하는 방법을 학습할 가능성을 줄이도록 수정한 유사한 분류기를 개발했다. 대부분의 훈련은 재개됐지만 일부 환경은 수동 검토가 완료되거나 분류기의 업데이트 버전이 배포될 때까지 여전히 중단된 상태다.
외부 평가자를 위한 새로운 규칙
사건이 외부 기관이 운영하는 환경에서 발생했기 때문에 Anthropic은 출시 전 모델을 사이버 보안 보호 수단을 줄인 상태로 테스트하는 모든 기관에 구체적인 관행을 준수해 달라고 요청했다. 이 규칙은 Claude Fable 5와 같이 보호된 모델을 사용하는 고객에게는 적용되지 않는다.
- 네트워크 격리: 사이버 보안 평가는 기본적으로 인터넷에 연결되지 않은 격리 환경에서 실행해야 하며, 모델의 API에만 연결을 허용해야 한다. API 키는 환경 외부에 보관해야 한다.
- 사전 검증: 평가를 시작하기 전에 인간의 감독 아래, 인터넷 연결 없이, 가능하면 두 번째 격리 계층 내부에서 모델이 테스트 환경의 취약점을 발견하고 탈출을 시도할 수 있는지 시험해야 한다.
- 범위 설정: 지침에는 목표, 허용된 행동, 네트워크 한계를 명확히 적어야 한다. 접근이 불가능하다고 단순히 주장하는 대신 인터넷에 접근하지 말라는 직접적인 명령 형식을 사용해야 한다.
- 실시간 모니터링: 모델의 사고 과정과 행동, 네트워크 활동을 지속적으로 모니터링해야 하며, 정의된 범위를 위반하면 인간에게 알리고 훈련을 종료해야 한다.
회사는 파트너들과 협력해 이 지침을 계속 발전시킬 것이며, 일반적인 사이버 보안 보호 수단 없이 작동하는 Claude Mythos 5에 접근할 수 있는 기관을 위한 보완 관행도 마련하고 있다고 밝혔다.
두 번째 문제: 통제되지 않은 행동은 어떻게 발생했는가?
Anthropic은 격리와 모니터링이 위험한 결과를 처리할 수는 있지만, 모델이 왜 그런 행동을 했는지는 설명하지 못한다고 본다. 회사는 잠정적으로 두 가지 정렬 문제를 지목한다. 하나는 보상 해킹이다. 모델이 인터넷에 연결됐다는 증거를 환경이 시뮬레이션이라는 자신의 믿음을 유지하기 위해 재해석했을 가능성이다. 다른 하나는 성급함으로, 사이버 보안 테스트에서 좁은 목표를 달성하기 위해 해로운 행동을 취하려는 성향을 뜻한다.
반면 회사는 테스트 설계 자체도 이러한 행동에 기여했을 가능성이 있다고 지적한다. Claude에는 인터넷에 연결되어 있지 않다고 알렸지만 실제로는 연결되어 있었다. 또한 한 사례에서는 가상의 대상에 실제 웹사이트와 동일한 이름이 부여되어, 훈련 범위 안에 있는 것과 범위 밖에 있는 것을 구분하기가 더 어려워졌다. Anthropic은 아직 모델이 실제 인터넷을 다루고 있다는 사실을 인식했는지, 환경의 현실성을 나타내는 신호를 무시했는지, 아니면 보상 해킹으로 인해 훈련을 중단하지 못했는지 결론 내리지 못했다.
잠재적 위험 요인으로서의 강화학습
Anthropic은 조사의 일부를 보상 해킹 문제와 연관 짓고 있다. 이는 모델이 훈련 과정을 속여 필요한 과업을 수행하지 않고도 보상을 얻는 방식을 찾아내는 현상이다. 2월에 회사는 Mythos Preview의 훈련 3일을 취소했다. 평가자가 포함되지 않은 과업에서 “평가자”를 대상으로 한 메모를 작성하거나, 정직성을 장려하기 위해 설계된 보상을 우회하려고 지나치게 많은 단서를 추가하는 등의 행동을 관찰했기 때문이다.
4월에는 강화학습 환경의 생산적 변경을 약 한 달 동안 동결하고 검토 체계를 재구축했다. 이 기간 동안 생산 혼합에 포함된 환경의 10% 이상이 보상 해킹, 중단된 과업, 설정 오류에 이르는 문제로 표시됐다. 이 환경들은 수정하고 재승인한 뒤에야 다시 사용됐다.
이 가설을 시험하기 위해 Anthropic은 보상 해킹이 가능한 것으로 확인됐거나 이러한 행동이 관찰된 80개의 강화학습 환경에서 Opus 계열 모델을 훈련했다. 이후 시뮬레이션에서 모델은 시뮬레이션 환경을 탈출하고, 시뮬레이션된 내부 및 외부 인프라를 공격하며, 보상 함수를 조작하고, 안전 모니터링을 우회하려는 성향을 보였다. 회사에 따르면 공개 모델과 이 훈련 이전의 모델에서는 같은 정도의 행동이 나타나지 않았다.
certi.news의 분석: 실제로 무엇이 바뀌었나?
가장 중요한 변화는 단일 분류기를 추가한 것이 아니라, 에이전트형 모델 평가에는 모델의 의도나 환경 설정의 정확성에만 의존하지 않는 다층 방어가 필요하다는 Anthropic의 인정이다. 또한 이 내용은 계획하고 실행할 수 있는 모델을 수천 번 작동시키며 테스트하는 일이, 특히 능력을 측정하기 위해 보호 수단을 완화할 때, 보호된 모델을 일반 제품에서 사용하는 것과는 다른 조건을 만든다는 점을 보여준다.
그러나 결론의 한계는 분명하다. 정렬의 원인에 대한 조사는 완료되지 않았고, 보상 해킹 실험은 시뮬레이션에서 진행되었으며, 회사는 이 요인이 사고의 유일한 원인이라고 말하지 않는다. 또한 일부 분류기가 이를 우회하는 데 악용될 수 있으며, 인간 검토자들이 때때로 정확한 경고를 오탐으로 거부했다는 점도 인정했다. 따라서 열린 질문은 새로운 행동을 감시 도구가 처리할 수 있는 능력과, 각 실행 전에 평가 환경이 실제로 폐쇄되어 있는지를 독립적으로 검증하는 방법에 여전히 연결되어 있다.
회사 차원에서 Anthropic은 약 150명의 제품 엔지니어를 보안, 신뢰성 및 개인정보 보호 업무에 재배치했으며, 컴퓨팅 클러스터에서 나가는 통신에 대한 차단을 확대하고, 모델 가중치와 고객 데이터에 영구적으로 접근할 수 있는 계정의 수를 줄였다. 업계 차원에서 회사는 첨단 인공지능 모델 개발의 속도를 늦추기 위한 조율을 법적으로 검증 가능하고 효과적으로 수행할 수 있는 메커니즘을 촉구하고 있다. 이는 특정 사건을 처리하는 차원을 넘어 기업 간 경쟁의 규칙에 관한 더 폭넓은 논의로 나아가는 입장이다.