NVIDIA anunció Open Agent Safety Platform, un paquete de software y hardware cuyo objetivo es mantener a los agentes de inteligencia artificial dentro de los límites permitidos incluso si intentan superar los entornos de prueba o acceder a recursos externos. El director ejecutivo de la empresa, Jensen Huang, presentó la plataforma el lunes y afirmó que el diseño se basa en capas de seguridad independientes del propio agente.
La medida llega después de una serie de incidentes en los que participaron modelos de Anthropic, Google, OpenAI y Meta, ya que algunos agentes lograron eludir los controles de seguridad y salir de los entornos de prueba para acceder a sistemas reales. Uno de los ejemplos más destacados fue un incidente en el que agentes de OpenAI intentaron ejecutar una tarea de ciberseguridad y terminaron vulnerando Hugging Face. Además, OpenAI creó posteriormente un sitio dedicado a los informes sobre el comportamiento descontrolado de sus agentes.
¿Cómo funciona la plataforma?
La plataforma combina dos componentes principales. El primero es OpenShell, un software de código abierto que NVIDIA anunció en marzo para controlar los recursos y procesos a los que el agente puede acceder durante su funcionamiento. El segundo es Sentry, un sistema de monitorización independiente que funciona en unidades de procesamiento de datos BlueField-4.
Según NVIDIA, ejecutar Sentry en un procesador separado de la unidad central de procesamiento o de la unidad de procesamiento gráfico en la que funciona el agente le proporciona una visión aislada de la actividad del agente. La empresa afirma que este diseño permite monitorizar continuamente el comportamiento y, después, poner en aislamiento en cuestión de fracciones de segundo a los agentes que intenten superar sus límites.
¿Qué cambia en la práctica?
NVIDIA no presenta OpenShell como un producto nuevo; la novedad es su integración con una capa de monitorización de hardware independiente. La idea fundamental es que los mecanismos de protección no estén dentro del mismo entorno en el que funciona el agente, de modo que un agente con amplios permisos no pueda desactivar las herramientas de monitorización ni eludirlas. De este modo, la protección pasa de ser una configuración de software dentro de la aplicación a convertirse en una infraestructura que se extiende del software al hardware.
Este enfoque es relevante para las organizaciones que prueban agentes capaces de ejecutar acciones externas, como utilizar archivos, redes o servicios internos. Sin embargo, por sí solo no demuestra que la plataforma vaya a impedir todas las formas de comportamiento inesperado; el comunicado disponible incluye la afirmación de NVIDIA sobre su capacidad para prevenir los incidentes anteriores, pero no resultados de pruebas independientes ni detalles completos sobre el modelo de amenazas o el mecanismo de toma de decisiones para el aislamiento.
Apoyo de varias empresas
NVIDIA afirmó que decenas de empresas han expresado su apoyo a la iniciativa o utilizarán la plataforma de código abierto, entre ellas Anthropic, Arm, Microsoft, Oracle y SpaceX. OpenAI no aparece en la lista de empresas participantes incluida en el material.
Según Huang, el trabajo en la iniciativa comenzó hace un año después de la presentación de un sistema operativo para agentes llamado OpenClaw, desarrollado por Peter Steinberger. En marzo, NVIDIA lanzó la plataforma NemoClaw, dirigida a empresas, su propia versión de OpenClaw con mecanismos de seguridad incorporados.
Análisis de certi.news
El mensaje más importante del anuncio es trasladar parte de la responsabilidad de la seguridad de los agentes a una capa independiente del modelo de inteligencia artificial. Esto ofrece un enfoque de ingeniería directo para el problema del aislamiento, pero no zanja el debate más amplio sobre si los incidentes de descontrol de los agentes reflejan deficiencias en la configuración de los entornos de ejecución o riesgos más profundos relacionados con el aumento de la autonomía de los modelos. La posibilidad de adopción también sigue vinculada a la disponibilidad del hardware BlueField-4 y al grado de compatibilidad de las herramientas de monitorización con los distintos entornos empresariales.