Искусственный интеллект

OpenAI предоставляет опциональную маркировку генерируемого текста через API и предупреждает о сложности его обнаружения в коде

OpenAI запустила систему textGrain для встраивания статистического сигнала в тексты, генерируемые через API, при этом функция по умолчанию остаётся отключённой, а клиентам предоставляется возможность включить её на уровне проекта или организации. Компания заявляет, что эффективность обнаружения снижается при малом объёме текста или его редактировании, а код представляет собой более сложный случай. В ближайшие недели автоматическая маркировка подходящих текстов в ChatGPT и Codex начнётся на территории Европейского союза.

2026-10-05
3 мин. чтения
2 просмотров
certi.news Editorial Team
OpenAI предоставляет опциональную маркировку генерируемого текста через API и предупреждает о сложности его обнаружения в коде

OpenAI объявила о предоставлении системы textGrain для маркировки текстов, создаваемых её моделями через API, однако функция по умолчанию останется отключённой. Клиенты по всему миру могут уже сегодня включить её на поддерживаемых моделях — на уровне проекта или организации, без изменения отдельных запросов API.

Система встраивает в текст «статистический сигнал», отдавая предпочтение подходящим словам перед альтернативами, если оба варианта логичны в данном контексте. При накоплении таких выборов в достаточно длинном тексте детектор OpenAI, как предполагается, сможет распознать этот шаблон.

Иной подход, чем у Anthropic

OpenAI предоставляет клиентам API больший контроль, чем подход, объявленный Anthropic для моделей Claude в августе. Anthropic заявила, что маркировка будет применяться глобально к поддерживаемым моделям и на уровне модели, включая продукты Claude и Claude Code, а также использование API, не уточнив наличие аналогичной возможности отключения со стороны разработчиков.

По данным OpenAI, в ближайшие недели начнётся автоматическая маркировка подходящих текстов, создаваемых ChatGPT и Codex на территории Европейского союза, в ответ на требования к прозрачности, предусмотренные европейским законом об искусственном интеллекте. Компания пока точно не определила, что именно подразумевается под «подходящими выходными данными» в Codex.

Эффективность обнаружения не является постоянной

OpenAI заявляет, что её детектор распознаёт около 80% маркированных фрагментов длиной 200 символов, а для фрагментов длиной 400 символов в таких областях, как психология, показатель повышается до 95%; целевой показатель ложноположительных срабатываний составляет 1%. Возможность обнаружения снижается в ограниченных материалах, например в математике, где у модели меньше вариантов для выбора слов.

Редактирование текста также заметно ослабляет сигнал. В тестах компании замена 10% слов в фрагменте длиной 400 символов синонимами снизила показатель обнаружения примерно с 92% до 66%, а замена 25% — до 17%. OpenAI также предупреждает, что короткие фрагменты могут не содержать достаточно материала для надёжного обнаружения.

Код — более сложный испытательный случай

OpenAI признаёт, что код сложнее маркировать, чем обычную прозу, поскольку синтаксические и логические ограничения уменьшают количество разумных вариантов следующего слова или символа. Компания заявляет, что сравнила модель Astra с включённым и отключённым textGrain в тестах DeepSWE, AutomationBench и Terminal-Bench и не обнаружила значимой разницы в производительности. Однако эти результаты не доказывают, насколько надёжно можно определить маркированный код после его изменения или переформатирования.

Пока клиенты API, включившие textGrain, автоматически не получают инструмент обнаружения. OpenAI ограничивает первоначальный доступ к детектору аккредитованными исследовательскими и академическими организациями, изучающими происхождение текстов и надёжность обнаружения; The New Stack запросило у компании дополнительные сведения о подходящих выходных данных Codex и показателях обнаружения для кода.

Почему эта новость важна?

Практическое изменение для разработчиков заключается в том, что маркировка текста стала управляемой опцией, а не поведением, обязательным для всех выходных данных API. Однако опубликованные цифры показывают, что сама по себе маркировка не является окончательным доказательством: сокращение и редактирование снижают возможность обнаружения, а код может не предоставлять достаточно пространства для встраивания сигнала. Поэтому остаются открытыми вопросы о сфере применения детектора, доступе к нему и эффективности системы на реальном коде.

Источник новости
The New Stack - Software Development
Открыть первоисточник ↗
c
Автор

certi.news Editorial Team

В той же категории

Вам также может понравиться

Все новости