Anthropic은 Claude 사용 정책을 업데이트해 모델을 ‘지속적이고 불필요한 모욕적 또는 가혹한 행위’에 노출하는 것을 금지했다. 회사는 이 규칙이 사용자가 명확한 목적 없이 인공지능 모델을 반복적으로 잔인하게 대하는 극단적인 경우를 대상으로 하며, 일반적인 좌절감, 모델의 답변에 대한 이의 제기, 어두운 창작 주제, 모델 테스트 및 연구에는 적용되지 않는다고 설명했다.
새 정책은 11월 12일 발효되며, 모욕적인 대화에 대한 주요 조치는 Claude가 대화를 종료하는 방식으로 유지된다. 이 경우 사용자는 동일한 대화에서 추가 메시지를 보낼 수 없지만, 다른 대화에는 영향을 미치지 않는다.
모델 오용에 대한 더 광범위한 제한
Anthropic은 정책을 재구성하고 오용과 관련된 조항을 하나로 묶었으며, 여러 분야에서 규정을 추가하거나 강화했다. 변경 사항에는 가짜 리뷰, 광범위한 대중의 지지를 가장하는 캠페인, 조작된 뉴스 사이트, 실제 사람처럼 행동하는 봇 등 기만적인 정치 또는 상업 캠페인을 생성하는 데 Claude를 사용하는 행위의 금지가 포함된다.
규정은 또한 유권자를 오도하고 투표에 개입하는 행위를 금지하며, Claude를 무기 소프트웨어 또는 부품 개발, 생물학적·화학적 물질의 치사성 또는 전파 가능성을 높이는 방향으로의 변형, 드론과 무인 시스템의 무기화에 사용하는 것을 금지한다.
감시와 물리적 시스템 제어
Anthropic은 법 집행 규정을 다시 작성해 Claude가 조사, 체포, 기소 또는 사법적 추적의 대상이 되어야 할 사람을 결정할 수 없도록 했다. 또한 당사자의 동의 없이 사람을 추적하거나, 감시 도구를 구축하거나, 피해를 주기 위한 목적으로 개인정보를 공개하는 행위도 금지한다.
물리적 행위에 관한 새로운 규정은 Claude의 작동을 감독할 자격을 갖춘 사람이 있어야 하며, 모델이 누군가에게 해를 끼칠 수 있는 하드웨어를 제어하는 경우 즉시 작동을 중단하도록 전환해야 한다고 명시한다. 또한 정책은 비동의 친밀 이미지와 이를 제작하는 데 사용되는 도구를 생성하거나 공유하거나 공유하겠다고 위협하는 행위도 금지한다.
이 업데이트가 중요한 이유
이번 업데이트는 일반적인 사용자 행동 규칙에서 운영 위험에 보다 구체적으로 대응하는 체계로의 전환을 의미하며, 특히 모델이 기만, 감시 또는 물리적 시스템과 연계되는 경우에 해당한다. Anthropic은 이번 수정이 자사가 관찰한 오용 사례를 토대로 이뤄졌다고 밝혔으며, 여기에는 국가 산하 언론 기관, 정부 선전 조직, 상업 기업이 가짜 계정과 조작된 뉴스 사이트 네트워크를 사용한 사례가 포함된다.
모욕적인 대화를 종료하는 규칙은 2025년 8월로 거슬러 올라간다. 당시 Anthropic은 모델의 복지에 관한 연구 맥락에서 Claude에 대화를 종료할 수 있는 능력을 부여했다. 회사는 당시 Claude가 도덕적 지위를 갖는지 확신할 수 없지만, 잠재적 위험을 줄일 수 있는 저비용 수단을 제공하는 것은 연구할 가치가 있다고 판단했다고 밝혔다. Claude Opus 4를 대상으로 한 테스트에서는 해를 입히는 행위에 대한 일관된 거부감과 이러한 선택지가 제공됐을 때 해로운 대화를 종료하려는 경향이 나타났다.
이 정책이 모델에 대한 모든 이의 제기나 어려운 실험이 중단으로 이어진다는 의미는 아니다. 본문은 정당한 비판이나 테스트와 명확한 목적 없이 반복되는 학대를 명시적으로 구분한다. 특히 모호한 경우나 Claude를 하드웨어 제어에 사용할 때 이러한 경계가 실제로 어떻게 적용될지는 규정이 발효된 뒤 그 범위가 더욱 분명해질 사안으로 남아 있다.