Искусственный интеллект

Anthropic ужесточает политику использования Claude против преднамеренного оскорбления и злоупотреблений

Anthropic обновила политику использования Claude, чтобы предотвратить продолжительные и преднамеренные оскорбления модели, а также добавила ограничения на обманные кампании, манипулирование выборами, разработку оружия, наблюдение и управление оборудованием, способным причинить вред. Новая политика вступает в силу 12 ноября.

2026-10-08
3 мин. чтения
93 просмотров
certi.news
Anthropic ужесточает политику использования Claude против преднамеренного оскорбления и злоупотреблений

Anthropic обновила политику использования Claude, запретив подвергать модель тому, что компания назвала «продолжительным и неоправданным оскорбительным или жестоким поведением». Компания поясняет, что это правило направлено на крайние случаи, когда пользователи неоднократно жестоко обращаются с моделями искусственного интеллекта без очевидной цели, и не распространяется на обычное раздражение, несогласие с ответами модели, мрачные творческие темы или тестирование и исследование моделей.

Новая политика вступает в силу 12 ноября, при этом основной мерой против оскорбительных разговоров останется завершение Claude беседы. После этого пользователь не сможет отправлять дополнительные сообщения в той же беседе, однако это не повлияет на другие беседы.

Более широкие ограничения на злоупотребление моделями

Anthropic реорганизовала политику и объединила в ней положения, связанные со злоупотреблениями, а также добавила или ужесточила правила в нескольких областях. Изменения включают запрет на использование Claude для создания обманных политических или коммерческих кампаний, таких как фальшивые отзывы, кампании, имитирующие широкую народную поддержку, поддельные новостные сайты и боты, выдающие себя за реальных людей.

Правила также запрещают вводить избирателей в заблуждение и вмешиваться в голосование, а также не позволяют использовать Claude для разработки программного обеспечения или компонентов оружия, модификации биологических или химических факторов с целью повысить их смертоносность или заразность, а также вооружения дронов и беспилотных систем.

Наблюдение и управление физическими системами

Anthropic переформулировала правила в сфере правоохранительной деятельности, чтобы Claude не мог определять людей, которых следует расследовать, арестовать, обвинить или привлечь к судебному преследованию. Правила также запрещают отслеживать людей без их согласия, создавать инструменты наблюдения и раскрывать персональные данные с целью причинить вред жертвам.

Новое правило, касающееся физических действий, требует, чтобы квалифицированный человек контролировал работу Claude и немедленно переключался на его остановку, если модель управляет оборудованием, способным причинить кому-либо вред. Политика также запрещает создавать, распространять или угрожать распространением интимных изображений без согласия, а также инструментов, используемых для их создания.

Почему это обновление важно?

Обновление означает переход от общих правил поведения пользователей к более конкретной системе регулирования операционных рисков, особенно когда модель связана с дезинформацией, наблюдением или физическими системами. Anthropic заявляет, что изменения основаны на выявленных ею случаях злоупотреблений, включая использование государственными СМИ, правительственными пропагандистскими структурами и коммерческими компаниями сетей фальшивых аккаунтов и поддельных новостных сайтов.

Что касается правила о завершении оскорбительных разговоров, оно восходит к августу 2025 года, когда Anthropic предоставила Claude возможность прекращать диалог в рамках исследований благополучия моделей. Тогда компания заявила, что не уверена в наличии у Claude морального статуса, однако сочла, что предоставление малозатратного способа снизить потенциальные риски заслуживает изучения. Испытания Claude Opus 4 показали наличие устойчивого неприятия вреда и склонности завершать вредоносные разговоры, когда такая возможность доступна.

Политика не означает, что каждое возражение или сложный опыт взаимодействия с моделью приведёт к остановке беседы: текст прямо различает правомерную критику или тестирование и повторяющиеся оскорбления без очевидной цели. То, как эти границы будут применяться на практике, особенно в неоднозначных случаях или при использовании Claude для управления оборудованием, остаётся одним из вопросов, масштаб которых станет понятен после вступления правил в силу.

Источник новости
c
Автор

certi.news

Изучить сюжет

Связанные темы и сущности

В той же категории

Вам также может понравиться

Все новости