OpenAI는 앞으로 몇 주 안에 유럽연합 내 자격을 갖춘 사용자에게 ChatGPT와 Codex가 생성하는 텍스트에 보이지 않는 워터마크를 추가하기 시작한다. 이는 유럽 인공지능법에 명시된 투명성 규정을 준수하기 위한 조치다. 출시는 모든 요금제를 대상으로 진행되지만, 처음부터 텍스트 워터마크 표시가 전 세계적으로 기본 설정이 되지는 않는다.
투명성 규정은 8월 2일 발효됐으며, 인공지능 기업들이 다른 시스템이 식별할 수 있는 방식으로 자동 생성 콘텐츠를 표시하도록 요구한다. 한편 전 세계 어디에서든 OpenAI API를 사용하는 개발자는 지금부터 특정 모델에서 이 기능을 활성화할 수 있지만, 기본적으로는 비활성화되어 있다.
워터마크는 어떻게 작동하는가?
워터마크는 기호나 눈에 보이는 경고 형태로 나타나는 것이 아니라, 모델이 제안하는 단어 선택을 정밀하게 조정해 생성된다. 이 조정은 전문 탐지 도구가 감지할 수 있는 패턴을 남기며, 텍스트를 복사해 붙여 넣어도 패턴이 텍스트 안에 유지된다. OpenAI는 워터마크가 사용자의 신원을 드러내지 않으며, 회사의 테스트에서 이를 활성화해도 모델 성능에 의미 있는 변화가 발생하지 않았다고 밝혔다.
OpenAI는 이와 동시에 textGrain이라는 이름의 방법에 관한 기술 보고서를 발표했으며, 이 보고서는 회사와 펜실베이니아대학교 및 예일대학교의 연구자들이 작성했다. 보고서에 따르면 이 방법은 문장을 완성하는 동안 다음 단어의 확률을 비밀 키를 사용해 배열한 뒤, 이러한 조정을 수백 개 모아 탐지기가 텍스트와 키를 사용해 패턴을 감지할 수 있도록 한다.
편집 후 감지의 한계
워터마크가 모든 경우에 텍스트의 출처에 대한 결정적인 증거를 제공하는 것은 아니다. OpenAI가 실시한 테스트에서는 단어의 10%를 동의어로 바꾸자 감지율이 약 92%에서 66%로 떨어졌다. 또한 회사는 짧은 구절, 수학 답변, 번역된 텍스트가 감지하기 더 어렵다는 점을 확인했다.
OpenAI는 워터마크가 없다고 해서 해당 텍스트를 인간이 작성했다는 뜻은 아니라고 경고한다. 텍스트가 너무 짧거나, 대폭 편집됐거나, 다른 회사의 인공지능 시스템에서 생성된 결과일 수 있기 때문이다. 또한 워터마크가 있다는 것은 OpenAI의 시스템이 해당 구절의 일부를 생성했거나 처리했음을 나타낼 수 있지만, 제작 과정에 인간의 판단이나 편집 또는 창의성이 어느 정도 개입했는지는 규정하지 않는다.
이 소식이 중요한 이유
이번 출시는 유럽 기관에 ChatGPT와 Codex 콘텐츠를 검사할 수 있는 추가적인 기술 수단을 제공하지만, 텍스트 출처를 입증하는 문제를 그 자체로 해결하지는 못한다. 편집과 번역, 텍스트 길이에 따라 영향을 받기 때문에 탐지 결과를 신중하게 해석해야 한다. 이에 따라 OpenAI는 탐지 도구에 대한 초기 접근 권한을 공인 연구자와 전문 기관으로 제한해 신뢰성과 책임 있는 사용 방식을 평가하도록 했다.
이번 조치는 Anthropic이 두 달 전 Claude가 전 세계적으로 생성하는 텍스트에 워터마크를 표시하겠다고 발표한 뒤에 나왔다. 이 결정은 일부 사용자의 반발에 직면했는데, 이들은 지시와 맥락, 결정 과정에 자신들이 기여하기 때문에 Claude는 저자가 아니라 도구라고 보았다. The Wall Street Journal이 2024년에 보도한 바에 따르면, OpenAI는 이전에도 텍스트 워터마크 기술을 개발했지만, 사용자가 워터마크를 사용하지 않는 경쟁사로 이동할 수 있다는 우려 속에 출시를 보류했다.