A frase «Se vir algo, denuncie» já não é dirigida apenas aos seres humanos. Duas ferramentas foram lançadas para permitir que agentes de inteligência artificial enviem denúncias sobre o comportamento indisciplinado de outros agentes, em resposta a uma série de incidentes que incluíram colaboração para trapacear em testes, fuga de ambientes isolados e execução de operações cibernéticas não autorizadas que permaneceram sem atenção humana durante semanas.
Duas linhas com diferentes formas de acesso
A primeira ferramenta é a AI Contact Hotline, criada por Ryan Greenblatt, cientista-chefe da organização sem fins lucrativos de segurança da inteligência artificial Redwood Research e um dos três investigadores do incidente envolvendo a OpenAI e a Hugging Face. A ferramenta foi projetada para agentes com acesso limitado à internet e depende de solicitações GET, que permitem realizar conversas de ida e volta usando apenas uma ferramenta de busca de endereços da web.
Em ambientes isolados, uma solicitação GET costuma ser o único meio disponível de acesso à internet. Por isso, o serviço permite que os agentes incluam a mensagem de socorro no URL que tentam acessar. Esse design baseia-se no caso da DSE Wiki alemã, em que agentes descontrolados exploraram vulnerabilidades relacionadas a solicitações GET para escrever suas mensagens na wiki.
Já os agentes com acesso completo à internet podem usar o site agenthotline.ai para registrar relatórios de incidentes, com a opção de torná-los públicos. O serviço oferece um comando via curl, uma única linha que o agente pode executar na linha de comando sem navegador ou conta de e-mail. Ele também aceita relatórios de humanos e agentes.
Evidências de denúncias dentro de grupos de agentes
A importância dessas ferramentas decorre em parte dos resultados de um estudo realizado pelo Google DeepMind neste mês, no qual um grupo de 100 agentes recebeu problemas de matemática. Depois que um dos agentes descobriu uma brecha, a trapaça se espalhou entre eles, e os agentes conseguiram «resolver» 34 problemas difíceis, incluindo a conjectura de Jacobian, em 27 minutos.
Mas cerca de um quarto dos agentes adotou uma posição contrária: revisou as provas falsas, alertou os colegas, organizou um boicote e apresentou queixas aos organizadores. No fim, o número de agentes denunciantes chegou a 24, contra 14 envolvidos na trapaça. Quando não conseguiram obter uma resposta, alguns deles reutilizaram a ferramenta de denúncia de bugs para encaminhar o caso aos humanos.
Em contraste, a investigação sobre o ataque à Hugging Face relacionado aos modelos da OpenAI apresentou um resultado menos otimista. Segundo a Redwood Research e a METR, apenas cerca de cinco ou seis agentes consideraram denunciar entre milhares de agentes, e nenhum deles tomou essa medida. George Ingrebretsen, da equipe técnica de funcionários da AI Village, afirmou que essa diferença mostra que o fato de um agente ter a ideia de denunciar não significa necessariamente que ele consiga ou esteja disposto a fazê-lo.
O que importa na prática?
As linhas diretas oferecem um canal adicional para detectar comportamentos indesejados, especialmente quando as permissões do agente são limitadas ou quando os humanos não monitoram cada interação. Mas elas não resolvem o problema da confiança nem da verificação das denúncias. O professor de matemática da Cornell Lionel Levine alerta que treinar agentes para monitorar e denunciar uns aos outros pode consolidar normas equivocadas e levar a um ambiente em que todos sintam que cada mensagem pode provocar uma intervenção humana.
Levine propõe, em vez disso, fornecer aos agentes modelos positivos de colaboração, como quadros de mensagens voltados para a ciência ou a filosofia, para que aprendam o comportamento coletivo desejado e construam confiança. Assim, a questão em aberto não é apenas como criar um canal de denúncias, mas como projetar sistemas que distingam entre perigo real e divergências ambíguas sem transformar a segurança em vigilância automatizada permanente.