Artificial Intelligence Underwriting Company, conocida abreviadamente como AIUC, recaudó 40 millones de dólares en una ronda de financiación Serie A liderada por Ribbit Capital, con la participación de First Harmonic, con el objetivo de construir una capa independiente para auditar y certificar la seguridad de los agentes de inteligencia artificial utilizados dentro de las empresas o desarrollados por compañías de modelos y aplicaciones.
La empresa está dirigida por Rune Kvist, antiguo empleado inicial de Anthropic, y Rajiv Dattani, quien ocupó el cargo de director de operaciones de la organización de investigación sobre seguridad de la inteligencia artificial METR entre 2024 y 2025 y sigue siendo miembro de su consejo de administración. AIUC afirma que Cursor, Lovable, Harvey y ElevenLabs se encuentran entre sus clientes.
Un estándar inspirado en las auditorías de ciberseguridad
AIUC apuesta por trasladar un modelo conocido de la ciberseguridad a los riesgos de los agentes de inteligencia artificial. La empresa desarrolló un estándar llamado AIUC-1, junto con un servicio de pruebas y auditoría que mide hasta qué punto el agente se comporta de forma segura y fiable. La idea se basa en el estándar SOC 2, habitual para evaluar los controles de las empresas tecnológicas, pero la fuente no indica que AIUC-1 sea un estándar reconocido o ampliamente adoptado fuera de la empresa y sus clientes.
Para formular el estándar, la empresa reunió una coalición de unos 250 responsables de seguridad y gestión de riesgos, el grupo que compra los agentes o decide desplegarlos. AIUC utiliza las opiniones de estos participantes para determinar las preguntas y los riesgos que deberían cubrir las pruebas.
Unos 5.000 tests y una verificación humana final
La empresa somete al agente a un conjunto de unos 5.000 tests en escenarios que incluyen intentos de eludir barreras de seguridad, alucinaciones y filtraciones de datos. El proceso produce un informe de cerca de 100 páginas que detalla las áreas en las que el agente se comporta de manera segura y fiable, así como aquellas en las que aparecen debilidades o motivos de preocupación.
AIUC utiliza agentes de inteligencia artificial para ejecutar las pruebas y analizar los datos, pero Rune Kvist afirmó que auditores humanos verifican el resultado final de la auditoría. El informe pretende proporcionar a la organización información independiente antes de decidir comprar o desplegar el agente, no ofrecer una garantía absoluta de que el sistema sea seguro en todas las circunstancias.
¿Qué diferencia hay con las evaluaciones de METR?
METR realiza pruebas similares en el ámbito de la autonomía y la evaluación, pero hasta hace poco su trabajo se centraba en mayor medida en el rendimiento de los agentes y su capacidad para completar tareas específicas de forma fiable. AIUC, en cambio, intenta orientar la evaluación hacia los riesgos que preocupan a las organizaciones en el uso práctico, como las filtraciones de datos y los comportamientos no deseados.
La lectura de certi.news
Lo más importante aquí no es solo la financiación, sino el intento de convertir la seguridad de los agentes de inteligencia artificial en un proceso de auditoría externa y comparable antes de la compra. Esto podría beneficiar a las organizaciones que no pueden limitarse a las afirmaciones de los proveedores de modelos sobre la seguridad, pero deja abiertas preguntas sobre el grado de reconocimiento del estándar AIUC-1 en el mercado, cómo cambiarán los resultados de las pruebas con las actualizaciones de los agentes y si los 5.000 tests representan los entornos operativos reales. Además, el hecho de que una parte de las pruebas y del análisis dependa de la propia inteligencia artificial convierte la verificación humana final en un elemento crucial para la credibilidad del servicio.
Los dos fundadores de AIUC vinculan este modelo con la dificultad de desplegar sistemas más inteligentes dentro de bancos, hospitales, gobiernos y entidades militares cuando las organizaciones no pueden garantizar a sus clientes los límites del comportamiento del sistema. Esto coincide con el llamamiento de Dario Amodei, director ejecutivo de Anthropic, a ralentizar el desarrollo de modelos avanzados y utilizar evaluadores independientes para supervisar y verificar la seguridad, mencionando a METR como una de las opciones posibles.