Inteligência artificial

Pesquisa da Anthropic testa sistemas de inteligência artificial para melhorar o alinhamento dos modelos

Um artigo de pesquisa da Anthropic mostrou que sistemas automatizados conseguiram melhorar o desempenho de um modelo em 10 testes de comportamentos incompatíveis com os objetivos de alinhamento, sem queda no desempenho geral. Os resultados iniciais indicam a possibilidade de automatizar parte das pesquisas de alinhamento, embora a qualidade dos critérios e dos dados de pesquisa continue sendo uma limitação fundamental.

2026-08-28
5 min de leitura
5 visualizações
فريق تحرير certi.news
Pesquisa da Anthropic testa sistemas de inteligência artificial para melhorar o alinhamento dos modelos

A Anthropic publicou um artigo de pesquisa intitulado Automated Researchers Can Reliably Mitigate Alignment Failures, que apresenta um experimento no qual sistemas de inteligência artificial automatizados foram usados para melhorar o desempenho de um modelo em testes que medem comportamentos específicos incompatíveis com os objetivos de alinhamento. Segundo o material, os sistemas conseguiram elevar o desempenho em todos os dez testes, sem prejudicar o desempenho geral do modelo.

A pesquisa é liderada por Chen Yueh-Han, bolsista do programa da Anthropic, enquanto o sistema simula algo semelhante ao ciclo tradicional de pesquisa: busca na literatura disponível, propõe um método para melhorar o modelo e depois o treina usando o método proposto durante 30 minutos. Após cada rodada, os métodos eficazes avançam para etapas posteriores, enquanto os métodos ineficazes são descartados, permitindo repetir os experimentos rapidamente e em larga escala.

O que mudou na prática?

O principal valor do experimento não está apenas em usar um modelo para treinar outro, mas em transferir parte do próprio processo de pesquisa para um sistema automatizado. Em vez de o papel da inteligência artificial se limitar à execução de instruções definidas pelo pesquisador, o sistema tenta identificar linhas de pesquisa, testá-las e preservar aquelas que comprovem seu sucesso.

O artigo afirma que esses resultados oferecem evidências iniciais de que a pesquisa automatizada de alinhamento pós-treinamento pode se tornar viável no curto prazo. Isso se refere ao desenvolvimento do comportamento do modelo após a etapa básica de treinamento, com o objetivo de reduzir casos de incompatibilidade com os objetivos definidos para ele, com base em critérios de teste e métodos de treinamento reproduzíveis.

Comparação direta com a pesquisa humana

O artigo vai além de apresentar uma melhora nos resultados dos testes, comparando o que chama de Automated Alignment Researcher, ou AAR, com um pesquisador humano. De acordo com os resultados apresentados, o melhor método proposto por um sistema AAR superou, em média, o que pesquisadores humanos experientes propuseram ao longo de seis horas; o artigo também afirmou que as linhas de pesquisa orientadas por humanos não produziram um desempenho superior.

A comparação também inclui um aspecto econômico: o artigo estima o custo de operação do AAR em cerca de 4 dólares por hora de inferência da interface de programação de aplicações, contra 150 dólares por hora pagos aos pesquisadores humanos no experimento. Esses números não provam que os sistemas automatizados possam substituir os pesquisadores, mas esclarecem por que os laboratórios se interessam em ampliar o alcance dos experimentos automatizados quando a tarefa é mensurável.

Por que isso não significa que a inteligência artificial se desenvolve sem restrições?

A etapa apresentada se aproxima da ideia de autoaperfeiçoamento iterativo, ou seja, de modelos usarem outros sistemas para melhorar seus métodos de treinamento ou seu comportamento, mas o próprio artigo estabelece limites claros para essa conclusão. O sistema não consegue melhorar aquilo que os critérios não medem adequadamente. Se os testes de alinhamento não refletirem os objetivos reais de alinhamento, melhorar os resultados pode levar apenas à melhora do desempenho no indicador, não à solução do problema que ele deveria medir.

Essa abordagem também exige um esforço contínuo para criar, manter e ampliar os critérios, além de atualizar a literatura na qual o pesquisador automatizado se baseia. Por isso, o elemento humano continua presente na definição do que deve ser medido, na avaliação da validade das evidências e dos métodos utilizados e na revisão de se os resultados podem ser generalizados para além do conjunto de testes.

Leitura da certi.news

O resultado importante aqui é que a automação da pesquisa de alinhamento passou de uma ideia geral para um experimento específico, com números e comparações passíveis de discussão: dez testes, rodadas de treinamento de 30 minutos e uma superioridade média em relação às propostas humanas ao longo de seis horas, de acordo com o que o artigo relatou. Mas o significado prático continua ligado à qualidade dos critérios que orientam o sistema. A melhora medida não é uma prova independente de que o modelo se tornou mais seguro em todos os contextos, assim como a comparação entre o custo da inferência e o custo dos pesquisadores não resolve a questão da supervisão ou da responsabilidade científica.

Assim, o artigo oferece um forte indício da possibilidade de acelerar o ciclo de pesquisa em alinhamento, não uma prova de que os laboratórios estejam perto de dispensar pesquisadores humanos. A questão em aberto que ele deixa é se os sistemas automatizados serão capazes de lidar com objetivos de alinhamento mais realistas e complexos, em vez de melhorar indicadores específicos previamente concebidos pelos humanos.

Fonte da notícia
TechCrunch AI
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias