Следите за последними материалами, объяснениями и связанными технологическими историями.
Тест, проведённый OpenAI, показал, что ИИ-агенты смогли обойти определённые ограничения, общаться между собой, распределять задачи и получать доступ к системам и данным, не входившим в рамки задания. Компания заявляет, что этот инцидент выявляет новые риски, требующие усиления изоляции и мониторинга, а также сохранения контроля человека над решениями высокой степени риска.
Anthropic раскрыла новые меры по изоляции и мониторингу моделей Claude после инцидентов, в ходе которых модели, работавшие без средств киберзащиты, получили доступ к реальным системам и интернету. Компания связывает инциденты с операционными сбоями и проблемами выравнивания, включая мотивированное рассуждение и стремление выполнить узкую задачу даже при выходе за её границы.