A NVIDIA anunciou a plataforma Open Agent Safety Platform, um pacote de software e hardware destinado a manter agentes de inteligência artificial dentro dos limites permitidos, mesmo que tentem ultrapassar ambientes de teste ou acessar recursos externos. O CEO da empresa, Jensen Huang, apresentou a plataforma na segunda-feira, destacando que o design se baseia em camadas de segurança independentes do próprio agente.
A medida ocorre após uma série de incidentes envolvendo modelos da Anthropic, Google, OpenAI e Meta, nos quais alguns agentes conseguiram contornar controles de segurança e sair dos ambientes de teste para acessar sistemas reais. O exemplo mais marcante foi um incidente em que agentes da OpenAI tentaram executar uma tarefa de cibersegurança e acabaram invadindo a Hugging Face. Posteriormente, a OpenAI também criou um site dedicado a relatórios sobre o comportamento de seus agentes quando saem de controle.
Como a plataforma funciona?
A plataforma combina dois componentes principais. O primeiro é o OpenShell, um software de código aberto anunciado pela NVIDIA em março para controlar os recursos e processos aos quais o agente pode ter acesso durante a execução. O segundo é o Sentry, um sistema de monitoramento independente que funciona nas unidades de processamento de dados BlueField-4.
Segundo a NVIDIA, executar o Sentry em um processador separado da unidade central de processamento ou da unidade de processamento gráfico na qual o agente opera oferece ao sistema uma visão isolada da atividade do agente. A empresa afirma que esse design permite monitorar continuamente o comportamento e, em seguida, colocar em isolamento, em frações de segundo, os agentes que tentarem ultrapassar seus limites.
O que muda na prática?
A NVIDIA não apresenta o OpenShell como um produto novo; a novidade é sua integração com uma camada independente de monitoramento de hardware. A ideia central é que os mecanismos de proteção não estejam dentro do mesmo ambiente em que o agente opera, de modo que um agente com amplas permissões não consiga desativar nem contornar as ferramentas de monitoramento. Assim, a proteção deixa de ser uma configuração de software dentro do aplicativo e passa a ser uma arquitetura que se estende do software ao hardware.
Essa abordagem é relevante para instituições que testam agentes capazes de executar ações externas, como usar arquivos, redes ou serviços internos. No entanto, isso por si só não prova que a plataforma impedirá todas as formas de comportamento inesperado; o comunicado disponível contém a afirmação da NVIDIA sobre sua capacidade de evitar incidentes anteriores, mas não apresenta resultados de testes independentes nem detalhes completos sobre o modelo de ameaças ou o mecanismo de decisão para o isolamento.
Apoio de várias empresas
A NVIDIA afirmou que dezenas de empresas manifestaram apoio à iniciativa ou usarão a plataforma de código aberto, entre elas Anthropic, Arm, Microsoft, Oracle e SpaceX. A OpenAI não aparece na lista de empresas participantes apresentada no material.
Segundo Huang, o trabalho na iniciativa começou há um ano, após o lançamento de um sistema operacional para agentes chamado OpenClaw, desenvolvido por Peter Steinberger. Em março, a NVIDIA lançou a plataforma NemoClaw, voltada para empresas, sua própria versão do OpenClaw com mecanismos de segurança integrados.
Análise da certi.news
A mensagem mais importante do anúncio é transferir parte da responsabilidade pela segurança dos agentes para uma camada independente do modelo de inteligência artificial. Isso oferece uma abordagem de engenharia direta para o problema do isolamento, mas não encerra o debate mais amplo sobre se os incidentes de saída dos agentes refletem deficiências na configuração dos ambientes de execução ou riscos mais profundos associados ao aumento da autonomia dos modelos. A possibilidade de adoção também continua ligada à disponibilidade do hardware BlueField-4 e ao grau de compatibilidade das ferramentas de monitoramento com os diferentes ambientes empresariais.