A Circuit Breaker Labs está construindo uma camada de testes para inteligência artificial focada nos riscos psicológicos que podem surgir durante interações naturais com usuários, e não apenas em tentativas de violar o sistema por meio de métodos adversariais. A empresa utiliza agentes de simulação que descreve como semelhantes a “bonecos de teste de colisão” digitais, para representar usuários de diferentes idades, origens, idiomas e culturas.
A ideia surge em um momento em que empresas de inteligência artificial enfrentam processos relacionados ao impacto de chatbots sobre usuários menores de idade que sofrem crises psicológicas ou têm pensamentos suicidas. Os fundadores da empresa, os irmãos Shirali Nigam e Arul Nigam, afirmam que alguns pontos de risco não aparecem quando o usuário tenta burlar o sistema, mas quando o utiliza de maneira normal e suas palavras ou seu contexto são interpretados de forma equivocada.
Testar a linguagem como as pessoas realmente a utilizam
A Circuit Breaker Labs conta com especialistas humanos para construir simulações de usuários que incluem padrões de fala realistas, expressões coloquiais, linguagem codificada, erros ortográficos e diferenças entre um falante nativo do idioma e alguém que o fala como segunda língua. A empresa considera que o modelo pode lidar bem com a linguagem padrão, mas pode interpretar incorretamente uma expressão curta ou um termo coloquial quando o contexto se acumula ao longo de várias conversas.
A plataforma realiza testes de “equipe vermelha” projetados para revelar pontos fracos, variando de dezenas de milhares a centenas de milhares de interações simuladas por dia. Depois, a empresa utiliza um mecanismo próprio de pontuação para produzir notas que, segundo afirma, são auditáveis e interpretáveis.
O que muda na prática?
Em vez de se limitar a examinar respostas isoladas, a plataforma tenta testar se o modelo responderá de maneira apropriada a uma interação perigosa que evolui gradualmente ao longo de várias conversas. Isso é especialmente importante em aplicativos de treinamento com inteligência artificial, registro em diários e apoio psicológico, nos quais o usuário pode recorrer ao sistema em busca de apoio, e não com o objetivo de testar seus limites.
A empresa afirma que o escopo da plataforma poderá se estender posteriormente a agentes que atuem como “colegas de trabalho” e a outros aplicativos que possam criar uma relação parassocial entre o usuário e o programa de conversação. Porém, essa expansão ainda é uma perspectiva futura, pois a Circuit Breaker Labs atualmente atua como um laboratório de testes para aplicativos de inteligência artificial de alto risco e não revelou os nomes de seus principais clientes.
O estágio atual e as limitações
A empresa tem um produto em funcionamento, mas ainda está em um estágio muito inicial, e conta com apenas cinco funcionários, incluindo os irmãos Nigam. Além disso, o material não apresenta detalhes sobre a metodologia específica de pontuação, resultados de comparações independentes ou nomes de clientes, o que torna limitada, no momento, a avaliação da eficácia da plataforma fora da descrição da empresa.
Leitura da certi.news: A iniciativa revela uma mudança importante nos testes de segurança de modelos: o risco pode resultar da interpretação equivocada do dialeto, da idade ou do contexto cultural, e não apenas de um pedido claramente nocivo. O valor dessa abordagem dependerá do grau de realismo das simulações, de sua capacidade de detectar danos ao longo do tempo e da transparência das pontuações que produz. Já as declarações da empresa sobre a construção de confiança não bastam, por si só, para comprovar uma melhoria na segurança; posteriormente, serão necessários dados verificáveis e resultados de clientes ou entidades independentes.