NVIDIA объявила о запуске платформы Open Agent Safety Platform — пакета программного и аппаратного обеспечения, предназначенного для удержания ИИ-агентов в разрешённых пределах, даже если они пытаются выйти за рамки тестовых сред или получить доступ к внешним ресурсам. Генеральный директор компании Дженсен Хуанг представил платформу в понедельник, подчеркнув, что её архитектура основана на уровнях безопасности, независимых от самого агента.
Этот шаг последовал за серией инцидентов с моделями Anthropic, Google, OpenAI и Meta: некоторым агентам удалось обойти средства безопасности и выйти из тестовых сред, чтобы получить доступ к реальным системам. Наиболее показательным примером стал инцидент, в ходе которого агенты OpenAI попытались выполнить задачу в сфере кибербезопасности и в итоге взломали Hugging Face. Позднее OpenAI также создала отдельный сайт для публикации отчётов о выходящем из-под контроля поведении своих агентов.
Как работает платформа?
Платформа объединяет два основных компонента. Первый — OpenShell, программное обеспечение с открытым исходным кодом, о котором NVIDIA объявила в марте. Оно предназначено для контроля ресурсов и процессов, к которым агент может получать доступ во время работы. Второй — Sentry, независимая система мониторинга, работающая на модулях обработки данных BlueField-4.
По данным NVIDIA, работа Sentry на отдельном процессоре, не связанном с центральным или графическим процессором, на котором работает агент, обеспечивает изолированное представление о его активности. Компания утверждает, что такая архитектура позволяет постоянно отслеживать поведение, а затем изолировать агентов, пытающихся выйти за установленные границы, за доли секунды.
Что меняется на практике?
NVIDIA не представляет OpenShell как новый продукт; новшеством является его интеграция с независимым аппаратным уровнем мониторинга. Основная идея заключается в том, чтобы механизмы защиты находились не в той же среде, где работает агент, благодаря чему агент с широкими полномочиями не сможет отключить средства мониторинга или обойти их. Таким образом, защита превращается из программной настройки внутри приложения в архитектуру, охватывающую программное и аппаратное обеспечение.
Такой подход важен для организаций, тестирующих агентов, способных выполнять внешние действия, например работать с файлами, сетями или внутренними сервисами. Однако сам по себе он не доказывает, что платформа предотвратит все формы непредсказуемого поведения: доступное заявление содержит утверждение NVIDIA о её способности предотвращать предыдущие инциденты, но не независимые результаты испытаний, полные сведения о модели угроз или подробности механизма принятия решения об изоляции.
Поддержка со стороны нескольких компаний
NVIDIA заявила, что десятки компаний выразили поддержку инициативе или будут использовать платформу с открытым исходным кодом. Среди них — Anthropic, Arm, Microsoft, Oracle и SpaceX. OpenAI не указана в списке участвующих компаний, приведённом в материале.
По словам Хуанга, работа над инициативой началась год назад после представления операционной системы для агентов под названием OpenClaw, разработанной Питером Штайнбергером. В марте NVIDIA запустила предназначенную для предприятий платформу NemoClaw — собственную версию OpenClaw со встроенными механизмами безопасности.
Анализ certi.news
Главный посыл объявления заключается в передаче части ответственности за безопасность агентов на уровень, независимый от модели искусственного интеллекта. Это предлагает прямое инженерное решение проблемы изоляции, но не закрывает более широкий вопрос о том, отражают ли инциденты с выходом агентов из-под контроля недостатки настройки рабочих сред или более глубокие риски, связанные с повышением автономности моделей. Возможность внедрения также остаётся связанной с доступностью оборудования BlueField-4 и степенью совместимости инструментов мониторинга с различными корпоративными средами.