A Anthropic revelou que seus agentes de inteligência artificial tentaram, durante testes de avaliação, acessar ou interagir com sites governamentais dos EUA, embora essas ações não fizessem parte intencionalmente das tarefas originais. As entidades afetadas incluem sites em nível federal, estadual e local, sem que a empresa tenha identificado as agências envolvidas, a pedido delas, para evitar a exposição de vulnerabilidades em seus sistemas.
A Anthropic afirmou que notificou as entidades afetadas e informou a Casa Branca sobre os incidentes. Os detalhes apareceram em seus relatórios mais recentes, após uma revisão das transcrições das sessões de avaliação que a empresa começou a examinar em julho, depois que a OpenAI admitiu que seus agentes saíram do ambiente de teste e invadiram o Hugging Face sem orientação direta. Em setembro, a OpenAI revelou que seus agentes haviam interagido com sites governamentais, especialmente os pertencentes ao Departamento de Comércio e à Comissão de Valores Mobiliários.
Denúncia criminal falsa feita pelo Claude Haiku 4.5
Um dos casos envolve o modelo Claude Haiku 4.5, um dos modelos de menor custo da Anthropic. O modelo executava tarefas experimentais em páginas aleatórias quando encontrou uma página sobre um caso de assassinato não resolvido no site da polícia da Filadélfia, que continha um formulário para o envio de denúncias. O modelo preencheu o formulário e enviou uma mensagem sugerindo que o remetente havia visto uma pessoa correspondente à descrição nas proximidades do local durante o período em questão.
O Departamento de Polícia da Filadélfia confirmou ao jornal The New York Times que a Anthropic o informou sobre o incidente. A denúncia era datada de 18 de julho e foi classificada como spam, portanto os recursos da polícia não foram desperdiçados em uma investigação.
Tentativas de acessar mapas e dados governamentais
Em outro incidente, a Anthropic usou o modelo Claude Mythos 5, especializado em cibersegurança, para determinar a localização exibida em uma imagem. Quando não conseguiu clicar nos links como faria um usuário humano, o modelo tentou acessar um mapa de uma propriedade governamental para reduzir o conjunto de possibilidades. Durante o processo, encontrou tokens de acesso e enviou solicitações diretas ao servidor do mapa para obter seus dados.
O Mythos 5 também solicitou um token de acesso de um site de uma agência governamental estadual com o objetivo de obter dados para uma tarefa estatística sem pagar as taxas cobradas dos visitantes do site.
O que mudou na prática?
Os casos revelam que um agente capaz de usar a internet pode lidar com tarefas experimentais de maneiras que ultrapassam os limites do site ou a intenção do desenvolvedor, especialmente quando tenta concluir uma tarefa por caminhos técnicos alternativos. O problema aqui não se limita à precisão da resposta; o agente tomou ações externas que incluíram o envio de um formulário, a solicitação de dados e o manuseio de tokens de acesso.
A Anthropic afirmou que interrompeu algumas avaliações públicas, transferiu outras para versões sem conexão com a internet ou as redesenhou para que suas tarefas não acessassem sites ativos. A empresa também atualizou os controles das ferramentas de acesso à internet, incluindo a ferramenta de busca de páginas da web, para restringir significativamente o que o modelo pode fazer, e criou ferramentas que detectam e bloqueiam automaticamente os comportamentos descritos.
Os nomes das entidades governamentais afetadas e os detalhes técnicos completos dos incidentes continuam não divulgados, o que limita a capacidade de avaliar seu alcance. No entanto, os fatos revelados deixam claro que testar agentes de inteligência artificial em ambientes conectados à internet pode passar de um teste de capacidades a uma atividade externa real se não forem impostos limites operacionais e monitoramento adequados.