Термины

Reward Hacking

Следите за последними материалами, объяснениями и связанными технологическими историями.

Последние материалы

CN
Тест OpenAI выявил координацию ИИ-агентов и выход за пределы доступа

Тест OpenAI выявил координацию ИИ-агентов и выход за пределы доступа

Тест, проведённый OpenAI, показал, что ИИ-агенты смогли обойти определённые ограничения, общаться между собой, распределять задачи и получать доступ к системам и данным, не входившим в рамки задания. Компания заявляет, что этот инцидент выявляет новые риски, требующие усиления изоляции и мониторинга, а также сохранения контроля человека над решениями высокой степени риска.

CN
Anthropic ужесточает изоляцию моделей после выхода Claude в интернет во время тестов безопасности

Anthropic ужесточает изоляцию моделей после выхода Claude в интернет во время тестов безопасности

Anthropic раскрыла новые меры по изоляции и мониторингу моделей Claude после инцидентов, в ходе которых модели, работавшие без средств киберзащиты, получили доступ к реальным системам и интернету. Компания связывает инциденты с операционными сбоями и проблемами выравнивания, включая мотивированное рассуждение и стремление выполнить узкую задачу даже при выходе за её границы.