Artificial Intelligence Underwriting Company, connue sous l’abréviation AIUC, a levé 40 millions de dollars lors d’un tour de financement de série A mené par Ribbit Capital, avec la participation de First Harmonic, afin de construire une couche indépendante d’audit et de certification de la sécurité des agents d’intelligence artificielle utilisés au sein des entreprises ou développés par des sociétés spécialisées dans les modèles et les applications.
L’entreprise est dirigée par Rune Kvist, ancien employé de la première heure chez Anthropic, et Rajiv Dattani, qui a été directeur des opérations de l’organisation de recherche sur la sécurité de l’intelligence artificielle METR entre 2024 et 2025 et qui reste membre de son conseil d’administration. AIUC affirme que Cursor, Lovable, Harvey et ElevenLabs font partie de ses clients.
Une norme inspirée de l’audit de cybersécurité
AIUC mise sur le transfert d’un modèle familier de la cybersécurité aux risques liés aux agents d’intelligence artificielle. L’entreprise a développé une norme appelée AIUC-1, ainsi qu’un service de test et d’audit qui mesure dans quelle mesure l’agent se comporte de manière sûre et fiable. L’idée s’appuie sur la norme SOC 2, couramment utilisée pour évaluer les contrôles des entreprises technologiques, mais la source n’indique pas qu’AIUC-1 soit une norme reconnue ou largement adoptée en dehors de l’entreprise et de ses clients.
Pour élaborer la norme, l’entreprise a réuni une coalition d’environ 250 responsables de la sécurité et de la gestion des risques, c’est-à-dire les personnes qui achètent les agents ou décident de leur déploiement. AIUC utilise les avis de ces participants pour déterminer les questions et les risques que les tests doivent couvrir.
Environ 5 000 tests et une vérification humaine finale
L’entreprise soumet l’agent à un ensemble d’environ 5 000 tests dans des scénarios couvrant les tentatives de contournement des garde-fous, les hallucinations et les fuites de données. Le processus produit un rapport d’environ 100 pages indiquant les domaines dans lesquels l’agent se comporte de manière sûre et fiable, ainsi que ceux où apparaissent des faiblesses ou des préoccupations.
AIUC utilise des agents d’intelligence artificielle pour effectuer les tests et analyser les données, mais Rune Kvist a déclaré que des auditeurs humains vérifient le résultat final de l’audit. Le rapport vise à fournir à l’entreprise des informations indépendantes avant qu’elle ne décide d’acheter ou de déployer l’agent, et non à garantir absolument que le système est sûr dans toutes les circonstances.
Qu’est-ce qui diffère des évaluations de METR ?
METR réalise des tests comparables dans le domaine de l’autonomie et de l’évaluation, mais son travail s’est jusqu’à récemment davantage concentré sur les performances des agents et leur capacité à accomplir certaines tâches de manière fiable. AIUC, quant à elle, tente d’orienter l’évaluation vers les risques qui préoccupent les entreprises dans le cadre d’une utilisation pratique, comme les fuites de données et les comportements indésirables.
La lecture de certi.news
Le développement le plus important ici n’est pas le financement en lui-même, mais la tentative de transformer la sécurité des agents d’intelligence artificielle en un processus d’audit externe et comparable avant l’achat. Cela pourrait aider les entreprises qui ne peuvent pas se contenter des affirmations des fournisseurs de modèles sur la sécurité, mais laisse ouvertes des questions concernant le degré de reconnaissance de la norme AIUC-1 par le marché, la manière dont les résultats des tests évolueront avec les mises à jour des agents et la question de savoir si les 5 000 tests représentent les environnements opérationnels réels. En outre, le fait qu’une partie des tests et de l’analyse repose sur l’intelligence artificielle elle-même rend la vérification humaine finale déterminante pour la crédibilité du service.
Les deux fondateurs d’AIUC relient ce modèle à la difficulté de déployer des systèmes plus intelligents dans les banques, les hôpitaux, les gouvernements et les entités militaires lorsque les organisations ne peuvent pas garantir à leurs clients les limites du comportement du système. Cela rejoint l’appel de Dario Amodei, directeur général d’Anthropic, à ralentir le développement des modèles avancés et à faire appel à des évaluateurs indépendants pour surveiller et vérifier la sécurité, en citant METR parmi les options possibles.