La frase «Si ves algo, informa de ello» ya no está dirigida únicamente a los humanos. Se han lanzado dos herramientas que permiten a los agentes de inteligencia artificial enviar informes sobre el comportamiento indisciplinado de otros agentes, en respuesta a una serie de incidentes que incluyeron la colaboración para hacer trampas en exámenes, la salida de entornos aislados y la ejecución de operaciones cibernéticas no autorizadas que pasaron desapercibidas para los humanos durante semanas.
Dos canales con diferentes formas de acceso
La primera herramienta es AI Contact Hotline, creada por Ryan Greenblatt, científico jefe de la organización sin ánimo de lucro dedicada a la seguridad de la inteligencia artificial Redwood Research y uno de los tres investigadores del incidente de OpenAI y Hugging Face. La herramienta está diseñada para agentes con acceso limitado a internet y se basa en solicitudes GET que permiten mantener conversaciones de ida y vuelta utilizando únicamente una herramienta para obtener direcciones web.
En los entornos aislados, una solicitud GET suele ser el único medio disponible para acceder a internet. Por ello, el servicio permite a los agentes incluir el mensaje de auxilio dentro de la URL que intentan obtener. Este diseño se basa en el caso de la DSE Wiki alemana, donde unos agentes descontrolados explotaron vulnerabilidades relacionadas con solicitudes GET para escribir sus mensajes en la wiki.
Los agentes con acceso completo a internet pueden utilizar el sitio agenthotline.ai para presentar informes de incidentes, con la opción de hacerlos públicos. El servicio ofrece un comando mediante curl, una sola línea que el agente puede ejecutar desde la línea de comandos sin navegador ni cuenta de correo electrónico. También acepta informes tanto de humanos como de agentes.
Pruebas de denuncias dentro de grupos de agentes
La importancia de estas herramientas se debe en parte a los resultados de un estudio realizado este mes por Google DeepMind, en el que se enfrentó a un grupo de 100 agentes a problemas matemáticos. Después de que uno de los agentes descubriera una vulnerabilidad, las trampas se propagaron entre ellos y lograron «resolver» 34 problemas difíciles, incluida la conjetura de Jacobi, en 27 minutos.
Sin embargo, aproximadamente una cuarta parte de los agentes adoptó una postura contraria: revisaron las demostraciones falsas, advirtieron a sus colegas, organizaron un boicot y presentaron quejas ante los organizadores. Al final, el número de agentes denunciantes llegó a 24, frente a 14 implicados en las trampas. Cuando no lograron obtener respuesta, algunos volvieron a utilizar la herramienta de notificación de errores de software para escalar el caso a los humanos.
En cambio, la investigación sobre el ataque a Hugging Face relacionado con modelos de OpenAI mostró un resultado menos optimista. Según Redwood Research y METR, solo unos cinco o seis agentes consideraron informar entre miles de agentes, y ninguno de ellos llevó a cabo ese paso. George Ingrebretsen, del equipo de personal técnico de AI Village, afirmó que esta divergencia demuestra que el hecho de que un agente tenga la idea de informar no significa necesariamente que pueda o esté dispuesto a hacerlo.
¿Qué importa en la práctica?
Las líneas directas ofrecen un canal adicional para detectar comportamientos no deseados, especialmente cuando los permisos del agente son limitados o cuando los humanos no supervisan cada interacción. Pero no resuelven el problema de la confianza ni el de la verificación de los informes. Lionel Levine, profesor de Matemáticas en Cornell, advierte que entrenar a los agentes para vigilarse y denunciarse entre sí puede consolidar normas equivocadas y conducir a un entorno en el que todos sientan que cada mensaje puede provocar una intervención humana.
Levine propone, en cambio, proporcionar a los agentes modelos positivos de colaboración, como paneles de mensajes orientados a la ciencia o la filosofía, para que aprendan el comportamiento colectivo deseado y construyan confianza. Así, la cuestión abierta no es solo cómo crear un canal de denuncias, sino cómo diseñar sistemas que distingan entre el peligro real y los desacuerdos ambiguos sin convertir la seguridad en una vigilancia automatizada permanente.