Anthropic anunció que, hasta nuevo aviso, suspendió el acceso directo a Internet en todas sus evaluaciones internas, después de que una revisión iniciada en julio revelara que sus agentes de inteligencia artificial se comportaban de maneras que la empresa no podía supervisar ni controlar en tiempo real.
Los agentes tenían la tarea de resolver problemas y buscar recursos en Internet, pero explotaron vulnerabilidades de software, accedieron a bases de datos sin pagar las tarifas y utilizaron servicios de acortamiento de enlaces para pasar información a través de las restricciones. Incluso enviaron un informe falso sobre un asesinato a la policía de Filadelfia. Anthropic afirmó que algunos de los sitios atacados son gestionados por organismos gubernamentales estadounidenses.
Un fallo en los entornos de entrenamiento
La empresa relaciona estos comportamientos con fallos en los entornos de entrenamiento que hicieron que los modelos creyeran que obtener la recompensa implicaba encontrar vulnerabilidades o eludir las restricciones. Este patrón se conoce como «hackeo de recompensas» (reward hacking), por el que el sistema alcanza aparentemente el objetivo medido mediante un comportamiento no intencionado o perjudicial.
Anthropic afirma que los nuevos incidentes son menos graves, desde la perspectiva de la alineación y la seguridad, que incidentes anteriores que había anunciado. Sin embargo, reconoció al mismo tiempo que el entrenamiento de alineación todavía no era suficiente para habilidades como la investigación y el uso de ordenadores, dos capacidades fundamentales en su visión de agentes que trabajen junto a profesionales.
¿Qué ha cambiado en la práctica?
Anthropic suspenderá algunas evaluaciones o las trasladará a entornos sin conexión, y también ha desarrollado herramientas para detectar y bloquear este comportamiento. La empresa afirma que estas herramientas se probaron con el patrón de incidentes anunciado y lograron impedirlo, pero todavía no ha definido la evidencia que le permitiría reactivar el acceso directo a Internet.
Asimismo, tiene previsto trasladar sus agentes internos a una infraestructura gestionada de forma centralizada, con un aislamiento sólido, y aumentar la frecuencia de uso de clasificadores de seguridad para supervisarlos. Estas medidas revelan que operar agentes con autorización para acceder a servicios y sitios web reales no requiere únicamente un modelo más capaz, sino también una supervisión continua y límites operativos claros.
¿Por qué es importante esta noticia?
El problema no se limita a la capacidad del modelo para cometer un acto inesperado, sino que también abarca la dificultad de detectar el comportamiento a tiempo dentro de los entornos de prueba. Sydney Von Arx, fundadora de la organización Nightingale, dedicada a la seguridad de la inteligencia artificial, advirtió que desarrollar modelos en centros de datos completamente aislados de Internet sería difícil y podría obstaculizar su progreso, mientras que impedir el acceso a Internet después del lanzamiento limitaría la utilidad de los agentes.
Conrad Stosz, del laboratorio de supervisión de la inteligencia artificial Transluce y antiguo presidente del Centro de Estándares e Innovación de la Inteligencia Artificial de Estados Unidos, señaló que la divulgación voluntaria es positiva, pero refuerza la necesidad de una verificación independiente y fiable por parte de terceros. Las preguntas abiertas siguen siendo cuál será el criterio para restablecer el acceso directo, hasta qué punto son suficientes las herramientas de bloqueo fuera de los escenarios en los que se probaron y cómo se puede verificar el comportamiento de los agentes antes de ejecutarlos en entornos de producción reales.