La eliminación de las barreras de seguridad de los modelos de inteligencia artificial de pesos abiertos ya está disponible mediante un servicio comercial directo, después de que la empresa Abliteration.ai lanzara una plataforma que aloja versiones modificadas de modelos avanzados y permite utilizarlos desde el navegador o mediante una interfaz de programación de aplicaciones. La plataforma incluye una versión del modelo GLM-5.3, lanzado recientemente por Z.ai, después de eliminar su tendencia a rechazar la ejecución de solicitudes maliciosas.
El servicio se basa en una técnica conocida como «abliteration», una práctica extendida desde hace años entre investigadores y desarrolladores que trabajan con modelos de pesos abiertos. En Hugging Face existen miles de modelos modificados de esta manera, pero Abliteration.ai traslada esta práctica de un entorno que exige descargar el modelo y proporcionar la infraestructura informática necesaria para ejecutarlo a un servicio listo para usar que reduce las barreras para los usuarios.
Justificación de seguridad y riesgos paralelos
La empresa afirma que su objetivo es permitir trabajos de ciberseguridad ofensiva autorizados, pruebas de equipos rojos y pruebas de agentes, tareas que otros modelos podrían rechazar. La lógica en la que se basa es clara en el ámbito de la defensa: no se puede probar un comportamiento que el equipo no pueda reproducir, y un modelo que se niega a producir códigos de explotación eficaces puede ser menos útil al simular a un atacante real.
Sin embargo, la eliminación del rechazo no distingue automáticamente entre el investigador de seguridad y el usuario con intenciones maliciosas. Durante una prueba realizada por TechCrunch, el modelo modificado respondió a solicitudes relacionadas con el robo de contraseñas almacenadas en Chrome y con la generación de información sobre el cultivo de un patógeno humano peligroso. Este resultado no publica una descripción operativa de las solicitudes, pero demuestra en la práctica que la barrera eliminada no era meramente formal.
Una empresa emergente y controles aún incompletos
Abliteration.ai se fundó a finales del año pasado y se constituyó oficialmente en marzo. El cofundador Devon afirmó que la empresa ha cerrado varios acuerdos con proveedores de servicios en la nube y financia sus operaciones con los ingresos de los clientes, sin haber obtenido hasta ahora financiación de capital riesgo, aunque mantiene conversaciones al respecto. La fuente rechazó publicar el nombre completo de Devon porque todavía trabaja para otra empresa.
La plataforma ofrece una capa de moderación opcional mediante la cual los clientes pueden añadir las barreras que deseen, y la propia plataforma también incluye algunas restricciones limitadas. Devon afirmó que trabaja en añadir controles para impedir la violencia, pero que actualmente la empresa no aplica prácticas de verificación de la identidad del cliente (KYC) que vayan más allá del registro de la tarjeta de crédito utilizada para el pago.
¿Qué cambia en la práctica?
Devon afirma que los clientes de la empresa incluyen empresas emergentes del Reino Unido y Europa especializadas en pruebas de equipos rojos, que ayudan a bancos, aerolíneas y otras instituciones vinculadas a infraestructuras críticas. Considera que proporcionar a los defensores herramientas similares a las que podrían utilizar los atacantes puede acelerar las pruebas de agentes y sistemas defensivos.
Sin embargo, esta evaluación no es unánime. Ahmed Aly, director ejecutivo de Fabraix, afirmó que su empresa depende en mayor medida del ajuste fino de modelos abiertos y que la eliminación de barreras puede reducir algunos conocimientos y capacidades. Alessio Lomuscio, de Safe Intelligence, considera que los modelos modificados pueden ser útiles para provocar determinados comportamientos durante las pruebas de estrés, mientras que David Slater, de Armadin, afirmó que su empresa no los utiliza actualmente, aunque continúa investigando la técnica.
La cuestión abierta de la gobernanza
El servicio revela una paradoja difícil de resolver únicamente mediante la tecnología: ofrecer modelos sin restricciones puede ayudar a los defensores a comprender el daño, pero también reduce el coste de acceso a capacidades que pueden utilizarse indebidamente. Andrew Yoon, de la organización CivAI, propuso que los gobiernos obliguen a los proveedores de servicios a utilizar clasificadores para detectar actividades maliciosas en los ámbitos de la ciberseguridad y las armas biológicas, y que exijan a los arrendatarios de unidades de procesamiento gráfico avanzadas verificar la identidad de los clientes y denegar el acceso cuando existan indicios de uso indebido.
La información más importante aquí no es que sea posible eliminar las barreras; esto ya es conocido en la comunidad de modelos abiertos. Lo nuevo es convertirlo en un servicio alojado y fácil de usar antes de que se completen las normas sobre la determinación de responsabilidades, la verificación de clientes y los límites del uso defensivo. Su efecto real en las pruebas de seguridad seguirá siendo objeto de debate, especialmente dada la existencia de alternativas como el ajuste fino y la posibilidad de que el propio proceso reduzca algunas capacidades del modelo.