L’entreprise Circuit Breaker Labs construit une couche de test pour l’intelligence artificielle axée sur les risques psychologiques susceptibles d’apparaître lors d’interactions naturelles avec les utilisateurs, et non uniquement sur les tentatives de contourner le système au moyen de méthodes hostiles. L’entreprise utilise des agents de simulation qu’elle décrit comme des sortes de « mannequins numériques de crash-tests », afin de représenter des utilisateurs d’âges, d’origines, de langues et de cultures différents.
Cette idée intervient à un moment où des entreprises d’intelligence artificielle font face à des poursuites concernant l’impact des chatbots sur des utilisateurs mineurs confrontés à des crises psychologiques ou à des idées suicidaires. Les fondateurs de l’entreprise, les frères Shirali Nigam et Arul Nigam, affirment que certains risques n’apparaissent pas lorsque l’utilisateur tente de tromper le système, mais lorsqu’il l’utilise de manière normale et que ses propos ou son contexte sont mal compris.
Tester la langue telle que les gens l’utilisent réellement
Circuit Breaker Labs s’appuie sur des experts humains pour construire des simulations d’utilisateurs intégrant des modes de langage réalistes, des expressions familières, un langage codé, des fautes d’orthographe et les différences entre un locuteur natif d’une langue et une personne qui la parle comme langue seconde. L’entreprise estime que le modèle peut bien traiter la langue standard, mais mal comprendre une expression courte ou un terme familier lorsque le contexte s’accumule au fil de plusieurs conversations.
La plateforme mène des tests en « équipe rouge » conçus pour révéler les points faibles, avec entre plusieurs dizaines de milliers et plusieurs centaines de milliers d’interactions simulées par jour. L’entreprise utilise ensuite un mécanisme de notation propriétaire pour produire des scores qu’elle affirme auditables et interprétables.
Qu’est-ce qui change concrètement ?
Plutôt que de se contenter d’examiner des réponses isolées, la plateforme tente de vérifier si le modèle réagira de manière appropriée à une interaction à risque qui évolue progressivement au fil de plusieurs conversations. Cela est particulièrement important dans les applications d’entraînement par intelligence artificielle, de tenue de journal intime et de soutien psychologique, où l’utilisateur peut se tourner vers le système pour obtenir de l’aide et non pour tester ses limites.
L’entreprise affirme que le champ d’application de la plateforme pourrait ensuite s’étendre aux agents faisant office de « collègues de travail » et à d’autres applications susceptibles de créer une relation quasi sociale entre l’utilisateur et le programme conversationnel. Mais cette expansion reste une perspective future, car Circuit Breaker Labs fonctionne actuellement comme un laboratoire de test pour les applications d’intelligence artificielle à haut risque et n’a pas révélé les noms de ses principaux clients.
La phase actuelle et les limites
L’entreprise dispose d’un produit opérationnel, mais elle se trouve encore à un stade très précoce et ne compte que cinq employés, dont les frères Nigam. L’article ne fournit pas non plus de détails sur la méthodologie de notation propriétaire, de résultats de comparaison indépendants ou des noms de clients, ce qui limite pour le moment l’évaluation de l’efficacité de la plateforme au-delà de la description de l’entreprise.
Lecture de certi.news : l’initiative révèle une évolution importante dans les tests de sécurité des modèles : le risque peut provenir d’une mauvaise compréhension de l’accent, de l’âge ou du contexte culturel, et pas seulement d’une demande clairement nuisible. La valeur de cette approche dépendra du réalisme des simulations, de sa capacité à détecter les préjudices au fil du temps et de la transparence des scores qu’elle produit. Quant aux déclarations de l’entreprise concernant l’instauration de la confiance, elles ne suffisent pas à elles seules à démontrer une amélioration de la sécurité ; il faudra ultérieurement disposer de données vérifiables et de résultats provenant de clients ou d’organismes indépendants.