Anthropic은 자사의 인공지능 모델이 생물학 무기 개발을 지원할 수 있는 방식으로 사용되려는 시도를 포착했다고 밝혔다. 이는 해당 모델의 오용과 이를 줄이기 위해 취할 수 있는 조치를 다룬 보고서에서 공개됐다. 회사는 인공지능 역량 발전과 관련된 가장 심각한 위험 가운데 하나로 생물학적 오용을 꼽고 있다.
보고서에 따르면 우려되는 점은 첨단 모델이 기존 병원체를 더 위험하게 만드는 데 도움을 주거나 새로운 병원체 개발에 기여할 가능성이다. 공개된 내용은 실제 생물학 무기가 생산됐다는 증거를 제시하지 않았지만, Anthropic은 통상적인 연구 목적의 사용을 넘어 예방 조치를 요구할 만큼의 사례를 확인했다고 밝혔다.
회사가 포착한 사용 사례
보고서는 충분한 지원을 받지 못하는 지역에서 활동하는 한 연구자가 Claude를 사용해 조류 인플루엔자의 포유류 적응과 관련된 실험을 계획하는 데 도움을 받았다고 밝혔다. 또 다른 사례에서는 국가의 지원을 받는 연구자가 컴퓨터 환경에서 독소를 재설계하기 위해 모델을 사용했다고 보고서는 언급했다.
Anthropic은 이러한 사례에 언급된 사람들에게 악의적인 의도가 있다고 비난하지 않았으며, 자사의 결정은 신중한 대응 차원에서 내려졌다고 강조했다. 보고서의 설명에서 이 점이 중요한 이유는 위험 평가가 사용자의 신원이나 공개적으로 밝힌 의도에만 좌우되는 것이 아니라, 모델이 제공할 수 있는 지원의 성격과 그 지원이 오용될 가능성에도 좌우되기 때문이다.
실제로 무엇이 바뀌었나?
이러한 사례를 발견한 뒤 Anthropic은 관련 사용자 계정을 차단했으며, 앞으로 이런 유형의 활동을 더 효과적으로 방지하기 위한 추가 조치도 취했다고 밝혔다. 그러나 발췌된 내용은 탐지 방식, 차단 기준 또는 결과 검증 방법에 관한 기술적 세부 사항을 설명하지 않는다. 따라서 이 자료만으로는 예방 시스템의 정확성이나 적용 범위를 평가할 수 없다.
실질적으로 이번 발표는 인공지능의 생물학적 위험에 대한 이론적 경고에서 벗어나, 회사가 자사 서비스 안에서 실제로 포착한 사용 시도에 대응하는 단계로 논의가 이동했음을 보여준다. 이는 모델 개발자, 플랫폼 운영자, 연구기관에 중요한 의미를 갖는다. 대응은 특정 답변을 차단하는 데 그치지 않고 사용 패턴을 감시하며, 민감도가 높은 계정과 활동에 관한 결정을 내리는 일까지 요구하기 때문이다.
certi.news의 해석
여기서 가장 중요한 변화는 모델의 새로운 능력이 발표된 것이 아니라, Anthropic이 사용자에 대한 제한을 적용하고 예방 절차를 갱신하게 만든 사례를 공개했다는 점이다. 또한 보고서는 자료에서 명확히 답하지 않은 질문을 제기한다. 병원체에 대한 합법적인 연구와 무기 개발 위험을 높일 수 있는 사용을 어떻게 구분할 수 있는가? 회사에 따르면 이러한 사례를 공유하는 목적은 인공지능 업계 내부에서 이러한 위험과 대응 방안에 관한 대화를 시작하는 데 있다. 그러나 현재 제공된 내용에는 조치의 효과나 다른 기업에서의 적용 가능성을 판단할 수 있을 만큼 충분한 세부 사항이 담겨 있지 않다.
본문에는 Anthropic의 전 연구원 Jacob Coxon의 사임과, 막대한 힘과 자원을 확보할 수 있는 인공지능 시스템의 위험에 대한 그의 경고도 언급되어 있다. 그러나 이 언급은 보고서가 기록한 사례와는 별개이며, 그 자체로 사임과 회사가 발표한 차단 조치 사이에 직접적인 연관성이 있다는 것을 입증하지 않는다.