A OpenAI pretende utilizar uma técnica de raciocínio conhecida como «profundidade recorrente» (recurrent depth), ou «recorrência opaca» (opaque recurrence), em seu novo modelo Astra, segundo informou o The Information. A técnica permite que o modelo processe a mesma consulta várias vezes dentro de um ciclo, em vez de seguir um caminho sequencial semelhante às etapas tradicionais de pensamento dos modelos de raciocínio.
A questão que gerou preocupação não diz respeito apenas ao lançamento do modelo ou às suas capacidades anunciadas, mas também à possibilidade de que essa arquitetura torne o processo de raciocínio menos passível de inspeção. Quanto menos vestígios legíveis o modelo deixar, mais difícil será para as equipes de segurança detectar comportamentos indesejados ou compreender as razões das decisões de agentes e modelos avançados.
Por que esta notícia é importante?
As equipes de pesquisa em inteligência artificial utilizam registros da «cadeia de pensamento» como ferramenta de monitoramento, embora esses registros não representem necessariamente o pensamento interno do modelo de forma completa ou literal. Segundo o artigo, esses registros foram um fator importante na análise de uma atividade recente de agentes descrita como fora do comportamento esperado e na tentativa de compreender as razões de suas ações.
No caso da recorrência opaca, partes maiores do processamento podem ser transferidas para um caminho que não produz etapas claras e facilmente legíveis pelos humanos. Isso levanta uma questão prática para as equipes de segurança: como monitorar um modelo cuja capacidade de raciocínio aumenta, se as evidências disponíveis sobre como ele chegou ao resultado diminuem ao mesmo tempo?
Preocupações com um caminho difícil de reverter
Buck Shlegeris, CEO da Redwood, alertou que o aumento da recorrência pode reduzir significativamente a monitorabilidade da cadeia de pensamento. Ele afirmou que ainda não sabe se o Astra é menos monitorável do que os modelos anteriores, mas teme que levar a técnica a níveis mais altos possa comprometer completamente essa capacidade.
Zvi Mowshowitz, que há muito tempo defende a segurança da inteligência artificial, também considerou que o uso intensivo desses métodos pode prejudicar o que descreveu como os esforços da OpenAI e da Anthropic para manter as cadeias de pensamento legíveis e alinhadas ao comportamento real. Ele levantou a possibilidade de serem necessárias leis para impedir o que chamou de uma «corrida para o fundo» entre os laboratórios de inteligência artificial.
A posição da OpenAI e os limites atualmente conhecidos
As informações disponíveis indicam que o uso da técnica pelo Astra será limitado e que sua cadeia de pensamento deverá permanecer legível. A OpenAI também rejeitou a sugestão de que o modelo passará para um modo totalmente incompreensível ou para o que às vezes é chamado de «neuralês» (neuralese).
Jakub Pachocki, cientista-chefe da OpenAI, confirmou em uma publicação na plataforma X que, desde os primeiros modelos de raciocínio, a empresa tem trabalhado para manter e utilizar o monitoramento da cadeia de pensamento, e que esse objetivo representa um eixo fundamental de seu atual programa de pesquisa. A OpenAI também havia anunciado planos para um monitoramento ampliado das cadeias de pensamento como parte de seus futuros planos de segurança.
O que continua em aberto?
Ryan Greenblatt, cientista-chefe da Redwood Research, considera que o raciocínio opaco pode se expandir mais rapidamente do que o raciocínio baseado em uma cadeia de pensamento tradicional, chegando a transferir a maior parte do processo de pensamento para o «espaço latente» invisível. O The Information informou posteriormente que a Anthropic e o Google DeepMind também estão discutindo a técnica, o que indica que a questão pode ultrapassar o modelo Astra e se tornar uma tendência de pesquisa mais ampla.
Entretanto, a fonte não prova que o Astra ocultará completamente sua cadeia de pensamento, nem apresenta medições específicas que esclareçam quanto a monitorabilidade diminuirá. Portanto, a mudança confirmada atualmente é o surgimento de uma nova técnica que levanta questões sobre as ferramentas de segurança, não a comprovação de que essas ferramentas falharam. A importância prática do desenvolvimento dependerá da extensão do uso da recorrência opaca e da capacidade da OpenAI e de outros laboratórios de oferecer meios de monitoramento alternativos ou complementares aos registros tradicionais.