Anthropic обновила политику использования Claude, запретив подвергать модель тому, что компания назвала «продолжительным и неоправданным оскорбительным или жестоким поведением». Компания поясняет, что это правило направлено на крайние случаи, когда пользователи неоднократно жестоко обращаются с моделями искусственного интеллекта без очевидной цели, и не распространяется на обычное раздражение, несогласие с ответами модели, мрачные творческие темы или тестирование и исследование моделей.
Новая политика вступает в силу 12 ноября, при этом основной мерой против оскорбительных разговоров останется завершение Claude беседы. После этого пользователь не сможет отправлять дополнительные сообщения в той же беседе, однако это не повлияет на другие беседы.
Более широкие ограничения на злоупотребление моделями
Anthropic реорганизовала политику и объединила в ней положения, связанные со злоупотреблениями, а также добавила или ужесточила правила в нескольких областях. Изменения включают запрет на использование Claude для создания обманных политических или коммерческих кампаний, таких как фальшивые отзывы, кампании, имитирующие широкую народную поддержку, поддельные новостные сайты и боты, выдающие себя за реальных людей.
Правила также запрещают вводить избирателей в заблуждение и вмешиваться в голосование, а также не позволяют использовать Claude для разработки программного обеспечения или компонентов оружия, модификации биологических или химических факторов с целью повысить их смертоносность или заразность, а также вооружения дронов и беспилотных систем.
Наблюдение и управление физическими системами
Anthropic переформулировала правила в сфере правоохранительной деятельности, чтобы Claude не мог определять людей, которых следует расследовать, арестовать, обвинить или привлечь к судебному преследованию. Правила также запрещают отслеживать людей без их согласия, создавать инструменты наблюдения и раскрывать персональные данные с целью причинить вред жертвам.
Новое правило, касающееся физических действий, требует, чтобы квалифицированный человек контролировал работу Claude и немедленно переключался на его остановку, если модель управляет оборудованием, способным причинить кому-либо вред. Политика также запрещает создавать, распространять или угрожать распространением интимных изображений без согласия, а также инструментов, используемых для их создания.
Почему это обновление важно?
Обновление означает переход от общих правил поведения пользователей к более конкретной системе регулирования операционных рисков, особенно когда модель связана с дезинформацией, наблюдением или физическими системами. Anthropic заявляет, что изменения основаны на выявленных ею случаях злоупотреблений, включая использование государственными СМИ, правительственными пропагандистскими структурами и коммерческими компаниями сетей фальшивых аккаунтов и поддельных новостных сайтов.
Что касается правила о завершении оскорбительных разговоров, оно восходит к августу 2025 года, когда Anthropic предоставила Claude возможность прекращать диалог в рамках исследований благополучия моделей. Тогда компания заявила, что не уверена в наличии у Claude морального статуса, однако сочла, что предоставление малозатратного способа снизить потенциальные риски заслуживает изучения. Испытания Claude Opus 4 показали наличие устойчивого неприятия вреда и склонности завершать вредоносные разговоры, когда такая возможность доступна.
Политика не означает, что каждое возражение или сложный опыт взаимодействия с моделью приведёт к остановке беседы: текст прямо различает правомерную критику или тестирование и повторяющиеся оскорбления без очевидной цели. То, как эти границы будут применяться на практике, особенно в неоднозначных случаях или при использовании Claude для управления оборудованием, остаётся одним из вопросов, масштаб которых станет понятен после вступления правил в силу.