В ближайшие недели OpenAI начнёт добавлять невидимую водяную метку к текстам, создаваемым ChatGPT и Codex для соответствующих требованиям пользователей в Европейском союзе, чтобы обеспечить соблюдение требований прозрачности, предусмотренных Европейским законом об искусственном интеллекте. Запуск будет охватывать все тарифные планы, однако на начальном этапе маркировка текстов не станет глобальной настройкой по умолчанию.
Требования прозрачности вступили в силу 2 августа и обязывают компании, занимающиеся искусственным интеллектом, маркировать автоматически созданный контент таким образом, чтобы другие системы могли его распознавать. При этом разработчики, использующие программный интерфейс OpenAI в любой точке мира, уже сейчас могут включить эту функцию для определённых моделей, однако по умолчанию она отключена.
Как работает водяная метка?
Метка не отображается в виде символа или видимого предупреждения, а создаётся посредством тонкой корректировки выбора слов, предлагаемых моделью. Эта корректировка оставляет шаблон, который может обнаружить специализированный инструмент, причём шаблон сохраняется в тексте при его копировании и вставке. OpenAI заявляет, что метка не раскрывает личность пользователя, а её включение не привело к существенным изменениям производительности моделей в ходе испытаний компании.
Одновременно OpenAI опубликовала технический отчёт о своём методе под названием textGrain, подготовленный исследователями компании и Пенсильванского и Йельского университетов. Согласно отчёту, метод использует секретный ключ для упорядочивания вероятностей следующих слов при завершении предложений, а затем объединяет сотни таких изменений, чтобы детектор мог обнаружить шаблон с помощью текста и ключа.
Ограничения обнаружения после редактирования
Водяная метка не является безусловным доказательством происхождения текста во всех случаях. В одном из испытаний OpenAI замена 10% слов синонимами снизила показатель обнаружения примерно с 92% до 66%. Компания также установила, что короткие фрагменты, математические ответы и переведённые тексты сложнее обнаруживать.
OpenAI предупреждает, что отсутствие метки не доказывает, что текст написан человеком: текст может быть слишком коротким, подвергнуться значительному редактированию или быть созданным системой искусственного интеллекта другой компании. Наличие метки также может указывать на то, что система OpenAI создала или обработала часть фрагмента, но не определяет степень человеческого суждения, редактирования или творчества, вложенных в его создание.
Почему эта новость важна?
Запуск предоставляет европейским организациям дополнительное техническое средство для проверки контента ChatGPT и Codex, но сам по себе не решает проблему подтверждения происхождения текста. Уязвимость к редактированию, переводу и длине текста означает, что результаты обнаружения требуют осторожной интерпретации. Именно поэтому OpenAI решила на первом этапе ограничить доступ к инструментам обнаружения аккредитованными исследователями и специализированными организациями для оценки их надёжности и ответственного использования.
Этот шаг последовал за объявлением Anthropic два месяца назад о глобальной маркировке текстов, создаваемых Claude. Решение вызвало возражения со стороны некоторых пользователей, считавших, что их вклад в инструкции, контекст и решения делает Claude инструментом, а не автором. Ранее OpenAI разработала технологию маркировки текстов, но отказалась от её запуска из-за опасений, что пользователи перейдут к конкурентам, не использующим маркировку, согласно материалу, опубликованному The Wall Street Journal в 2024 году.