사이버 보안

AI 생성 텍스트의 워터마크 제거 도구가 효과 입증 없이 확산

Anthropic이 Claude가 생성하는 텍스트에 보이지 않는 워터마크를 활성화한다고 발표한 지 며칠 만에, 이러한 워터마크를 우회한다고 주장하는 오픈 소스 프로젝트와 상용 서비스가 잇따라 등장했다. 그러나 Anthropic이 워터마크 방식이나 탐지 도구를 공개하지 않았기 때문에 현재로서는 이러한 주장을 검증할 수 없다.

2026-08-13
4 분 읽기
8 조회수
فريق تحرير certi.news
AI 생성 텍스트의 워터마크 제거 도구가 효과 입증 없이 확산

Anthropic이 Claude가 작성하는 모든 텍스트에 보이지 않는 워터마크를 활성화한다고 발표한 지 며칠 만에, AI가 생성한 텍스트에서 워터마크를 제거한다고 주장하는 도구 시장이 인터넷에서 빠르게 성장하고 있다. 이 시장에는 GitHub에서 별 4500개 이상을 받은 오픈 소스 프로젝트, 최근 등록된 여러 웹사이트, AI 생성 콘텐츠 탐지 도구를 우회하는 데 특화된 상용 서비스가 포함된다.

그러나 Anthropic이 아직 작동 방식의 세부 내용을 공개하지 않았고, 정제된 텍스트에 여전히 워터마크가 포함되어 있는지 확인할 수 있는 공개 탐지 도구도 출시하지 않았기 때문에, 현재로서는 이러한 도구들이 텍스트 워터마크를 제거한다는 주장을 검증할 수 없다.

다양한 프로젝트와 서비스

주요 프로젝트 가운데 하나는 Memo의 설립자인 Guillaume Meyer가 개발한 MIT 라이선스 도구 watermarks-remover다. 이 도구는 처음에 Claude 에이전트용 맞춤형 스킬로 시작했으며, 이후 Claude와 Gemini, SynthID-Text에 대한 지원과 함께 OpenAI의 출처 증명 표면 및 Kirchenbauer 방식의 워터마크를 사용하는 오픈 웨이트 모델에 대한 지원을 발표했다.

이와 함께 claude-watermark-cleaner, remove-ai-watermarks, noai-watermark 같은 저장소도 있으며, 최근 등장한 웹사이트로는 claudewatermark.com, claudewatermark.rip, gptcleanup.com, claudewatermarkremover.app 등이 있다. AI 생성 콘텐츠 탐지 우회 도구를 판매하는 서비스인 StealthGPT도 서비스 페이지에 Claude 워터마크 제거 도구를 추가했다. Human Writes 역시 에세이와 과제에서 Turnitin과 GPTZero를 우회한다고 홍보하면서 Claude 워터마크 제거를 주장하고 있다. 다만 학업 성실성 정책에 부합하는 방식으로 서비스를 사용하라는 경고문도 포함되어 있다.

이 도구들이 실제로 제거하는 것은 무엇인가?

이 도구들은 서로 다른 세 종류의 데이터를 다룬다. 제로 폭 문자, 양방향 제어 문자, 특수 Unicode 문자, 일반 공백과 유사한 공백 등 숨겨진 문자를 제거하는 작업은 검증하고 측정할 수 있다. PNG, JPEG, SVG, PDF, DOCX, ODT, HTML, Markdown 파일에서 C2PA, EXIF, XMP 메타데이터를 제거하는 것도 마찬가지다. 그러나 이러한 데이터는 파일을 다시 저장하거나 형식을 변환하거나 스크린샷을 촬영하면 대개 남지 않는다.

반면 텍스트 워터마크 자체는 숨겨진 문자에 존재하는 것이 아니라 모델이 선택하는 단어와 연결되어 있다. 따라서 이를 처리하는 것으로 알려진 방법은 다른 모델을 사용해 텍스트를 상당히 다시 작성하는 것이다. Meyer는 현재 자신의 도구가 메타데이터만 제거하며, 실제 워터마크 제거 기능은 나중에 추가될 수 있지만 현재는 제공되지 않는다고 설명한다.

일부 상용 웹사이트는 깨끗하고 탐지할 수 없는 텍스트를 생성한다고 약속하지만, 일부 결과는 Anthropic의 워터마크가 아니라 공개된 일반 탐지 도구를 기준으로 측정된다. Anthropic의 워터마크에는 공개 탐지 도구가 없다. 또한 Pasquale Pillitteri는 프로젝트를 복제하고 코드를 읽은 뒤, 널리 사용되는 한 텍스트 정리 도구가 숨겨진 데이터를 담는 일반적인 기술을 변경하지 않았다는 사실을 발견했다. 해당 도구가 텍스트를 정리했다고 주장한 뒤에도 페이로드를 해독하고 복원할 수 있었다.

워터마크를 적용하는 이유와 공급망 위험

Anthropic은 2026년 8월 2일 또는 그 이후에 출시된 모델에서 나온 텍스트에 문장 구성에 통합된 감지할 수 없는 워터마크가 포함되며, 지원되는 파일 형식에는 서명된 C2PA 데이터가 포함된다고 밝혔다. 이 표시는 API, claude.ai, Claude Code, Claude Cowork, Claude Tag뿐 아니라 AWS, Google Cloud, Microsoft Foundry를 통해서도 모델 수준에서 적용된다.

이 조치는 8월 2일 시행이 시작된 유럽연합 AI 법 제50조와 관련이 있으며, 위반 시 최대 1500만 유로 또는 전 세계 매출의 3%에 해당하는 제재가 부과될 수 있다. Anthropic은 워터마크가 탐지된다는 것이 해당 콘텐츠가 Claude를 통해 처리되었다는 의미이지, 반드시 Claude가 전부 작성했다는 뜻은 아니라고 설명한다. 모델을 문법 교정, 번역 또는 요약에 사용한 경우에도 워터마크가 나타날 수 있다. 또한 광범위한 편집, 재작성 및 번역으로 워터마크가 제거될 수 있으며, 향후 제3자의 탐지를 지원하고 기술 문서를 공개하겠다고 밝혔다.

이러한 발전은 공급망 위험에도 주의를 환기한다. watermarks-remover 도구는 소프트웨어 에이전트용 스킬로 설치되며, 제3자가 운영하는 연구 저장소를 복제하고 약 220MB 크기의 파일을 다운로드하도록 설정될 수 있다. BleepingComputer는 언급된 도구를 테스트하거나 감사하지 않았으므로, 특히 주장을 독립적으로 검증할 수단이 없는 상황에서는 이를 인터넷에서 가져온 신뢰할 수 없는 코드로 취급해야 한다.

뉴스 출처
BleepingComputer
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기