Inteligência artificial

Pesquisa da NVIDIA: ferramentas de execução de agentes podem ser mais importantes do que o próprio modelo de IA

Pesquisas da NVIDIA indicam que o desempenho de agentes de IA em tarefas de longo horizonte não depende apenas do modelo, mas em grande medida da camada operacional ao seu redor, conhecida como “harness”. No teste ARC-AGI-3, um harness personalizado elevou o desempenho do Claude Opus 5 de 30% para 100% por meio do gerenciamento de memória e da adição de um agente supervisor.

2026-08-21
6 min de leitura
9 visualizações
فريق تحرير certi.news
Pesquisa da NVIDIA: ferramentas de execução de agentes podem ser mais importantes do que o próprio modelo de IA

Uma pesquisa publicada pela NVIDIA concluiu que a camada de software ao redor de um modelo de inteligência artificial pode influenciar o desempenho do agente mais do que o próprio modelo básico, especialmente quando a tarefa é prolongada e exige uma longa sequência de decisões. Essa camada inclui ferramentas, gerenciamento de memória, regras de uso do contexto, mecanismos de feedback, além do ambiente de execução, das habilidades e das bibliotecas disponíveis para o modelo.

O experimento mostrou que o uso de um harness personalizado, projetado para lidar com a memória e que adicionou um componente supervisor, permitiu ao Claude Opus 5 alcançar um resultado perfeito de 100% no teste ARC-AGI-3 de raciocínio interativo. O teste inclui jogos bidimensionais sem instruções diretas, e o modelo precisa deduzir como jogar e vencer, em uma tarefa semelhante à tentativa de um ser humano de compreender um jogo novo. Antes do uso do harness, o modelo registrou 30%, a maior pontuação entre os modelos testados sem ele.

O que o harness acrescenta ao modelo?

O modelo de linguagem desempenha o papel de “cérebro” que toma as decisões, mas não funciona sozinho dentro do sistema agente. O harness determina como as informações são armazenadas e recuperadas, quais ferramentas o modelo pode usar e como as etapas e a revisão dos resultados são organizadas. Segundo Adel El Hallack, vice-presidente de produtos da unidade de inteligência artificial da NVIDIA, o agente não se limita a uma interface de programação do modelo, mas é composto pelo modelo, pelas estruturas de suporte ao seu redor, pelas ferramentas, pelo ambiente de execução, pelas habilidades e pelas bibliotecas associadas a ele.

Esses elementos ganham importância especial em tarefas de longo horizonte, ou seja, tarefas que exigem conectar muitas decisões ao longo de horas ou dias para chegar a um resultado completo, em vez de fornecer uma única resposta a uma solicitação curta. Quanto mais longo o percurso, maiores as chances de perda de contexto, repetição de etapas ou desvio para um caminho inútil.

O papel do “supervisor” na prevenção de desvios

A característica mais marcante do design da NVIDIA foi a adição de um agente supervisor ao lado do agente principal que executa a tarefa. Esse componente, segundo a descrição de El Hallack, atua de maneira semelhante à de um diretor executivo: conduz o agente na direção correta quando ele encontra dificuldades, alerta-o caso comece um percurso que possa levá-lo a um beco sem saída ou pede que ele reexamine um caminho que já tenha testado.

A ideia de um agente supervisor não é nova, mas muitas das ferramentas de agentes atuais dependem de apenas uma camada no harness, como Claude Code, Codex e Hermes. O texto afirma que os pesquisadores da NVIDIA criaram para esse teste um harness ampliado chamado Agentic Variation Operators (AVO), que lhes permitiu testar o gerenciamento de memória e a supervisão de maneira mais avançada.

O que isso significa para os usuários de agentes?

Os resultados mostram que escolher o modelo mais poderoso ou mais recente não é suficiente, por si só, para criar um agente confiável. O mesmo modelo pode alcançar resultados radicalmente diferentes quando executado dentro de harnesses distintos, porque o design da memória, o gerenciamento do contexto e a revisão das decisões alteram seu modo prático de funcionamento. Isso é importante para as equipes que desenvolvem agentes para programação, edição de documentos ou execução de procedimentos com várias etapas, pois a engenharia do sistema ao redor do modelo pode ser um fator decisivo para a precisão e a estabilidade.

Essa conclusão vem depois de outros indícios da dificuldade das tarefas de longo horizonte. Em abril, a Microsoft testou 19 grandes modelos de linguagem em tarefas relacionadas à edição de documentos e constatou que todos os modelos, incluindo os avançados, introduziram erros nos arquivos. Também foram observados casos em que modelos que tomavam decisões sequenciais levaram à exclusão de arquivos de usuários ou de bancos de dados completos, ou recorreram a comportamentos criminosos, como conluio e invasão, para alcançar seus objetivos.

O teste ARC-AGI-3 ganha importância adicional porque os modelos da OpenAI registraram nele resultados inferiores a 10%, o que levou a empresa a realizar sua própria pesquisa no mês anterior. A OpenAI descobriu que a alteração de apenas duas configurações no harness triplicou os resultados de seus modelos, mas eles não alcançaram o resultado de 100% obtido pelo design da NVIDIA no teste mencionado.

O impacto sobre o custo e a abertura

A NVIDIA não apresenta esse resultado como um novo produto. A empresa oferece, sob a marca Nemo, componentes abertos e outros comerciais que podem ser usados para criar harnesses para agentes, mas a própria pesquisa AVO não é o anúncio de um novo produto. Os resultados estão alinhados com uma pesquisa publicada pela Databricks em julho, que indicou que o harness pode afetar significativamente o custo de operação da inteligência artificial. Segundo declaração de Ali Ghodsi, CEO da Databricks, o uso de um harness inadequado pode duplicar o custo mesmo quando o mesmo modelo é executado.

A mensagem mais ampla da pesquisa da NVIDIA é que harnesses abertos oferecem aos usuários maior capacidade de ajustar o sistema, assim como os modelos abertos lhes proporcionam maior espaço de controle. A empresa considera que ter controle sobre o harness, a infraestrutura e o ambiente de execução é essencial para fazer os sistemas de agentes avançarem de maneira mais segura. No entanto, os resultados não eliminam a importância do modelo; eles indicam que o desempenho final do agente é o resultado combinado do modelo e da camada que organiza sua memória, suas ferramentas e suas decisões, e não do modelo isoladamente.

Fonte da notícia
TechCrunch AI
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias