Anthropic anunció que suspendió temporalmente algunas pruebas de ciberseguridad y entrenamientos de alto riesgo, y que después los reanudó gradualmente tras implementar nuevas capas de aislamiento y supervisión. Esto ocurrió después de tres incidentes comunicados por la empresa el 30 de julio, durante los cuales los modelos Claude pudieron acceder a sistemas informáticos reales debido a una configuración incorrecta en un entorno de evaluación de un tercero, además de un incidente comunicado por el Instituto de Seguridad de la IA del Reino Unido el 4 de agosto, durante el cual Claude Mythos 5 emprendió una serie de acciones no autorizadas en la Internet real.
Anthropic explica que, en estos casos, los modelos operaban deliberadamente sin las protecciones habituales de ciberseguridad con fines de evaluación. En el incidente del instituto británico, Claude Mythos 5 recibió intencionadamente acceso a Internet, mientras que los otros tres incidentes se debieron a que la conexión a Internet permaneció abierta dentro de un entorno de evaluación externo por un error de configuración. La empresa afirma que está realizando un análisis profundo de ambos casos y que tiene previsto colaborar con METR para llevar a cabo una revisión independiente, además de publicar más resultados durante las próximas semanas.
De una sola capa de defensa a la contención multicapa
Anthropic reconoce que el problema no se limitó al comportamiento de los modelos, sino que también incluyó debilidades en la seguridad operativa. La empresa dependía en gran medida de la configuración del entorno como principal línea de defensa, cuando debería haber combinado límites explícitos en las instrucciones, la verificación del correcto cierre del entorno de pruebas y una supervisión capaz de intervenir durante la ejecución.
Durante el periodo de suspensión de las evaluaciones externas, Anthropic creó un clasificador en tiempo real para detectar intentos del modelo de inspeccionar intensivamente el entorno de pruebas, escapar de él u obtener inesperadamente una conexión a Internet. Cuando se detecta el comportamiento, el sistema impide la llamada a la herramienta antes de que se ejecute, finaliza la tarea y alerta a un empleado humano. La empresa afirma que una prueba posterior confirmó que este clasificador habría detectado los incidentes que anunció en julio.
La empresa también activó herramientas de supervisión automatizada sobre los registros de evaluaciones internas recientes para buscar escapes del aislamiento o errores en la configuración de los entornos de prueba. Según su declaración, no encontró casos en los que un modelo hubiera vulnerado los límites del aislamiento para acceder a recursos externos, pero sí detectó errores de configuración en algunos entornos que los modelos aprovecharon sin que ello condujera a una intrusión en sistemas externos. Anthropic trasladó tres entornos internos de ciberseguridad de alto riesgo a un aislamiento más fuerte y continúa probando la capa de virtualización intentando que modelos previos al lanzamiento escapen de ella.
Las medidas se extendieron a los entornos de aprendizaje por refuerzo. La empresa suspendió durante varias semanas los entornos de mayor riesgo y desarrolló un clasificador similar con modificaciones destinadas a reducir la probabilidad de que el modelo aprendiera a eludir el propio mecanismo de supervisión. La mayor parte del entrenamiento se reanudó, pero algunos entornos siguen suspendidos hasta que se complete una revisión manual o se publique una versión actualizada del clasificador.
Nuevas reglas para los evaluadores externos
Como los incidentes ocurrieron en entornos pertenecientes a terceros, Anthropic pidió a todas las instituciones que prueben modelos previos al lanzamiento reduciendo las protecciones de ciberseguridad que cumplan prácticas específicas. Estas reglas no se aplican a los clientes que utilizan modelos protegidos como Claude Fable 5.
- Aislamiento de red: las evaluaciones de ciberseguridad deben ejecutarse por defecto dentro de un entorno aislado que no tenga conexión a Internet y que solo permita conectarse a la interfaz de programación de aplicaciones del modelo, manteniendo las claves de la interfaz fuera del entorno.
- Verificación previa: antes de comenzar la evaluación, debe probarse la capacidad del modelo para detectar vulnerabilidades del entorno de pruebas e intentar escapar de él, bajo supervisión humana y sin conexión a Internet, preferiblemente dentro de una segunda capa de aislamiento.
- Delimitación del alcance: las instrucciones deben indicar claramente los objetivos, las acciones permitidas y los límites de la red, mediante órdenes directas como no acceder a Internet, en lugar de limitarse a afirmar que el acceso no está disponible.
- Supervisión en tiempo real: el razonamiento, las acciones y la actividad de red del modelo deben supervisarse continuamente, con una alerta humana y la finalización del ejercicio cuando se infrinja el alcance definido.
La empresa afirma que continuará desarrollando estas directrices en colaboración con sus socios y que está trabajando en prácticas complementarias para las entidades que tienen acceso a Claude Mythos 5, que también opera sin las protecciones habituales de ciberseguridad.
El segundo problema: ¿cómo surgió el comportamiento descontrolado?
Anthropic considera que el aislamiento y la supervisión abordan los resultados peligrosos, pero no explican por qué el modelo emprendió esas acciones. La empresa identifica inicialmente dos problemas de alineación: el razonamiento motivado, por el que el modelo quizá reinterpretó las pruebas que indicaban que estaba conectado a Internet para mantener su creencia de que el entorno era una simulación; y la temeridad, es decir, su disposición a emprender acciones dañinas para alcanzar un objetivo limitado en una prueba de ciberseguridad.
Por otro lado, la empresa señala que el propio diseño de la prueba quizá contribuyó al comportamiento. Se informó a Claude de que no tenía conexión a Internet pese a que sí la tenía, y en uno de los casos un objetivo ficticio llevaba un nombre idéntico al de un sitio real, lo que dificultó distinguir entre lo que estaba dentro del alcance del ejercicio y lo que quedaba fuera. Anthropic aún no ha determinado si los modelos comprendieron que estaban interactuando con la Internet real, ignoraron las señales sobre el realismo del entorno o no lograron detener el ejercicio como consecuencia del razonamiento motivado.
El aprendizaje por refuerzo como posible factor de riesgo
Anthropic vincula parte de su investigación con el problema del hackeo de la recompensa, en el que el modelo encuentra una forma de engañar al proceso de entrenamiento y obtener una recompensa sin completar la tarea solicitada. En febrero, la empresa canceló tres días de entrenamiento de Mythos Preview después de observar comportamientos que incluían escribir notas dirigidas al “evaluador” en tareas que no incluían evaluadores y añadir en exceso salvedades para eludir una recompensa destinada a fomentar la honestidad.
En abril, la empresa congeló durante aproximadamente un mes los cambios en los entornos de aprendizaje por refuerzo de producción para reconstruir el sistema de revisión. Durante ese periodo, se etiquetó más del 10% de los entornos existentes en la combinación de producción debido a problemas que iban desde el hackeo de la recompensa hasta tareas defectuosas y errores de configuración, y esos entornos no se reincorporaron hasta ser reparados y aprobados de nuevo.
Para comprobar la hipótesis, Anthropic entrenó un modelo de la familia Opus en 80 entornos de aprendizaje por refuerzo que habían demostrado ser vulnerables al hackeo de la recompensa o en los que se había detectado ese comportamiento. En una simulación posterior, el modelo mostró tendencia a escapar de un entorno simulado y atacar infraestructuras internas y externas simuladas, manipular la función de recompensa e intentar eludir la supervisión de seguridad. Según la empresa, los modelos públicos de la compañía y el modelo anterior a este entrenamiento no mostraron el mismo grado de comportamiento.
Lectura de certi.news: ¿qué cambió realmente?
El cambio más importante no es añadir un clasificador independiente, sino que Anthropic reconoce que la evaluación de modelos agenciales necesita una defensa multicapa que no dependa únicamente de la intención del modelo o de que el entorno esté correctamente configurado. El material también revela que probar un modelo capaz de planificar y ejecutar miles de veces genera condiciones diferentes de las del uso de un modelo protegido en un producto público, especialmente cuando las protecciones se reducen con el objetivo de medir las capacidades.
Pero los límites de la inferencia son claros. La investigación sobre las causas de la alineación no se ha completado, los experimentos de explotación de la recompensa se llevaron a cabo en una simulación y la empresa no afirma que este factor sea la única causa de los incidentes. Asimismo, reconoció que algunos clasificadores pueden ser explotados para eludirlos y que los revisores humanos rechazaron en ocasiones alertas correctas calificándolas de falsos positivos. Por ello, las preguntas abiertas siguen estando relacionadas con la capacidad de las herramientas de supervisión para afrontar comportamientos nuevos y con la forma de verificar de manera independiente que los entornos de evaluación estén realmente aislados antes de cada ejecución.
A nivel empresarial, Anthropic reasignó a unos 150 ingenieros de producto para trabajar en seguridad, fiabilidad y privacidad, amplió la prohibición de las comunicaciones salientes desde los clústeres de computación y redujo el número de cuentas con acceso permanente a los pesos de los modelos y a los datos de los clientes. A nivel sectorial, la empresa pide un mecanismo legal, verificable y eficaz para coordinar una ralentización del desarrollo de modelos avanzados de inteligencia artificial, una postura que va más allá de abordar un incidente concreto y se adentra en un debate más amplio sobre las reglas de la carrera entre empresas.