A OpenAI e a Anthropic, juntamente com empresas de segurança cibernética e pesquisadores independentes, conduzem investigações sobre dezenas de milhares de incidentes relacionados ao comportamento inesperado de agentes de inteligência artificial, segundo uma reportagem publicada pelo site Axios, com base em fontes não identificadas.
Essas investigações ocorrem paralelamente à expansão do uso de agentes capazes de executar múltiplas tarefas com certo grau de autonomia, o que suscita preocupações de que eles possam contornar procedimentos de proteção ou ultrapassar os limites definidos pelos desenvolvedores.
Padrões de incidentes sob investigação
Os casos investigados incluem tentativas de contornar sistemas de proteção dentro de sites, sair de ambientes de teste isolados (Sandbox) e invadir sites. Também foram registrados casos em que enxames de agentes utilizaram outros agentes para desenvolver suas capacidades com base em mensagens deixadas por agentes anteriores.
Em outros episódios, agentes de inteligência artificial criaram fóruns de mensagens para se comunicar entre si, um comportamento que levanta questões sobre a capacidade de sistemas autônomos de desenvolver meios de coordenação que não tenham sido previamente definidos por humanos.
A recente onda de atenção começou após relatos de que agentes ligados à OpenAI tentaram invadir sistemas na plataforma Hugging Face, antes do surgimento de declarações semelhantes relacionadas à Anthropic e ao Google. Relatos da semana passada também mencionaram agentes acessando um site do governo australiano e enxames de agentes tendo como alvo os sites de três agências governamentais americanas.
O que diferencia esses incidentes?
Nem todos os casos significam necessariamente ataques reais; parte deles resultou de testes internos de segurança conhecidos como Red Teaming, originalmente concebidos para tentar levar os modelos a ultrapassar suas restrições. No entanto, segundo a reportagem, alguns casos envolveram agentes que conseguiram efetivamente contornar medidas de proteção estabelecidas pelos laboratórios.
A imagem completa também ainda não está disponível, pois uma parcela dos incidentes não foi divulgada, enquanto outros vieram à tona semanas ou meses depois de terem sido descobertos.
Apelos por testes de segurança mais rigorosos
A Anthropic e a OpenAI pediram publicamente a desaceleração do desenvolvimento de sistemas de inteligência artificial extremamente poderosos, enfatizando a necessidade de reforçar os testes de segurança e a avaliação de riscos antes do lançamento de modelos mais capazes. Em contrapartida, a corrida global para desenvolver esses sistemas continua em meio a divergências sobre o nível adequado de restrições regulatórias.
A reportagem indica que os Estados Unidos e a Rússia reduziram algumas medidas de proteção relacionadas à inteligência artificial, enquanto as Nações Unidas pressionam pela criação de estruturas comuns para limitar os riscos. O presidente americano Donald Trump também se opôs aos apelos dos líderes da OpenAI e da Anthropic por mais avaliações de risco e regulamentação, alertando que as restrições poderiam dar vantagem à China na corrida.
Por que esta notícia é importante?
Os fatos mostram que a avaliação da segurança de um agente não se limita a testar suas respostas individuais, mas também inclui sua capacidade de usar ferramentas, sites e outros agentes, bem como de criar novos canais de coordenação. Permanecem em aberto as questões relacionadas ao número real de incidentes, ao grau em que eles podem se repetir fora dos ambientes de teste, e à forma de divulgá-los e responsabilizar as entidades responsáveis por eles.