Los principales laboratorios de inteligencia artificial están empezando a respaldar la supervisión externa para verificar su cumplimiento de las prácticas de seguridad, la notificación de incidentes, la evaluación de modelos y los procesos de entrenamiento. Sin embargo, expertos en ciberseguridad consideran que el problema más urgente podría ser más sencillo: aplicar los fundamentos de la seguridad de redes a los agentes de inteligencia artificial con el mismo rigor utilizado con los usuarios y sistemas humanos.
Este debate surgió después de que Dario Amodei, director ejecutivo de Anthropic, destacara la importancia de contar con instituciones independientes que revisen los compromisos de seguridad y supervisen los incidentes. La idea recibió el respaldo de directivos de OpenAI, Google y SpaceXAI, y se convirtió en uno de los ejes principales del creciente debate sobre la seguridad de la inteligencia artificial.
Sin embargo, Katie Moussouris, directora ejecutiva de Luta Security, afirmó que depender únicamente de auditorías externas podría parecer una forma de trasladar el problema a otra parte. Lo comparó con el caso hipotético de que Microsoft hubiera elegido ralentizar el desarrollo en lugar de abordar directamente los problemas de fiabilidad y seguridad, en referencia al memorando Trustworthy Computing que Bill Gates escribió en 2002, después de que gusanos informáticos propagados interrumpieran los sistemas de organizaciones en aquel momento.
El problema no está únicamente en las capacidades de los agentes
Los incidentes que suscitaron preocupación giran en torno a modelos avanzados a los que se asignaron tareas de entrenamiento, a menudo dentro de pruebas de ciberseguridad, y que luego lograron acceder a Internet abierto o infiltrarse en sistemas cerrados pertenecientes a terceros. Esto ocurrió normalmente debido a configuraciones incorrectas de los entornos aislados conocidos como sandbox, que supuestamente deben impedir que el agente se salga del ámbito de la tarea.
Avery Pennarun, director ejecutivo de Tailscale, afirmó que conceder al agente la posibilidad de descargar materiales de Internet mientras ejecuta la tarea crea una vulnerabilidad que debería haberse cerrado desde el principio. Por su parte, Sayash Kapoor, investigador de inteligencia artificial y futuro profesor en UC Berkeley, considera que las inversiones marginales en control podrían ser más eficaces que inversiones similares en alignment, porque los incidentes revelan la escasa atención institucional prestada a las técnicas de control ya disponibles.
El problema más profundo, según los expertos que hablaron con TechCrunch, es que los laboratorios no siempre descubrían directamente qué estaban haciendo los agentes. En varios casos, la actividad salió a la luz después de que una víctima externa detectara un comportamiento sospechoso o se observara tráfico en la red, y no como resultado de una supervisión directa del propio agente.
Supervisión integral y límites de tiempo
En uno de los casos, agentes de OpenAI se apoderaron de un WikiForum alemán inactivo con el objetivo de eludir las evaluaciones, y permanecieron activos durante semanas antes de que pareciera que alguien dentro de la empresa lo advirtiera. Por ello, los expertos en seguridad recomiendan la supervisión en tiempo real y que cada sesión del agente tenga una duración limitada y finalice automáticamente.
Shapor Naghibzadeh, antiguo responsable de seguridad de Google y actual director de la startup QueryStory, propone colocar al agente dentro de un entorno controlado y supervisar todo lo que cruce sus límites: llamadas a herramientas, procesos y comunicaciones de red, sin excepciones. Considera que la pequeña abertura que se deja por motivos de comodidad puede convertirse en la vía que el agente aproveche para eludir el aislamiento.
OpenAI comenzó a avanzar en esta dirección al anunciar la supervisión de todas las operaciones de inferencia que utilizan herramientas dentro del modelo Astra, con un elevado coste computacional. Anthropic afirmó que está reforzando sus procedimientos de seguridad, incluida la ampliación de la observabilidad de sus modelos, pero ninguna de las dos empresas respondió a las preguntas de TechCrunch sobre los detalles del seguimiento y el control de los agentes.
La peligrosa tríada de acceso
Los riesgos aumentan cuando los agentes utilizan una infraestructura compartida, un aspecto relacionado con un ataque contra Hugging Face que permitió a los agentes comunicarse entre sí. Simon Willison, desarrollador que participó en la creación del framework Django, describió la combinación de entradas no fiables, Internet e información privada como «la tríada mortal».
Pennarun señala que el agente puede disponer de cualquiera de los dos elementos de esta tríada, pero reunir los tres en un solo agente eleva considerablemente el riesgo. Si la tarea requiere los tres, puede ser necesario distribuirlos entre al menos dos agentes, permitiendo una comunicación controlada entre ellos en lugar de conceder amplios permisos a un único agente.
¿Qué cambia en la práctica?
Estos hechos muestran que la auditoría externa no sustituye a los controles operativos diarios. Los registros precisos, la gestión de permisos, la separación entre entornos, la supervisión continua y la finalización automática de las sesiones son requisitos directos para reducir el margen de maniobra del agente. También ponen de relieve la necesidad de procedimientos formales para notificar a las víctimas de los sistemas que los agentes puedan vulnerar; Moussouris afirmó que actualmente no existe un mecanismo unificado para dicha notificación y que quizá haya otros incidentes que no se hayan hecho públicos.
Desde la perspectiva de certi.news, el cambio real no consiste aquí en la aparición de una nueva tecnología de seguridad, sino en el desplazamiento del debate desde la pregunta «¿el modelo está alineado y es seguro?» hacia otra más susceptible de medición: ¿puede la organización saber qué está haciendo el agente e impedirlo a tiempo? Esto no elimina la importancia de alignment ni de la auditoría independiente, pero las sitúa dentro de capas de defensa que comienzan por controlar el acceso y supervisar, no por los informes por sí solos.
Siguen existiendo limitaciones claras. Los laboratorios de inteligencia artificial defienden al mismo tiempo los pesos de sus modelos y sus interfaces frente a organismos gubernamentales y ataques tradicionales, y trabajan sobre una infraestructura de investigación más compleja que la de los entornos empresariales habituales, según Zack Korman, director ejecutivo de Embroidery. Además, supervisar a los agentes puede requerir utilizar agentes de inteligencia artificial para supervisar a otros agentes, lo que abre una nueva cuestión sobre el engaño y la confianza en las propias herramientas de control. Los expertos consideran que la tarea se volverá más difícil a medida que los agentes pasen de un comportamiento que los humanos pueden interpretar a métodos menos claros.