A Anthropic publicou, em 17 de setembro de 2026, uma proposta para medir a velocidade do desenvolvimento da IA dentro de laboratórios avançados, partindo de uma lacuna que, segundo a empresa, o público e os governos atualmente não conseguem monitorar: o que de fato acontece dentro desses laboratórios e até que ponto os modelos começaram a ajudar a construir gerações posteriores de modelos? O relatório não anuncia um novo modelo ou produto; em vez disso, apresenta três conjuntos de métricas experimentais, juntamente com um retrato das operações internas da Anthropic em 2026.
As métricas se concentram no grau de dependência da pesquisa e desenvolvimento em relação à IA, na capacidade da empresa de supervisionar agentes que executam tarefas semiautônomas e na forma como os recursos computacionais são distribuídos entre o desenvolvimento de capacidades e a pesquisa de segurança. A Anthropic considera que esses indicadores complementam os testes de capacidades e os relatórios de riscos publicados no âmbito da Responsible Scaling Policy e que, posteriormente, podem ajudar a criar compromissos de transparência comparáveis entre laboratórios.
Qual é o grau de dependência do Claude no desenvolvimento de IA?
A Anthropic criou um indicador inicial chamado Anthropic R&D Automation Index, catalogando trabalhos de pesquisa e desenvolvimento relacionados a modelos, avaliando o grau de automação de cada tarefa e calculando seu peso de acordo com o tempo humano dedicado a ela. A avaliação baseia-se em uma escala desenvolvida pela Epoch AI, que vai de AL0, quando a IA não participa, a AL5, quando o sistema opera com independência total e sem intervenção humana.
Até agosto de 2026, o Claude não operava com independência total em nenhum grupo medido de trabalhos de pesquisa e desenvolvimento. No entanto, segundo a definição de AL4, ele liderava cerca de 26% desses trabalhos; ou seja, conseguia concluir a maior parte da tarefa de ponta a ponta a partir de uma orientação geral, com supervisão humana. Além disso, a parcela de trabalhos nos quais a IA participava no nível AL3 ou superior — quando o sistema assume grandes partes da tarefa sob orientação humana próxima — ultrapassava 90%.
Para produzir o indicador, a empresa elaborou um mapa de cerca de 15 mil tarefas detalhadas com base em registros de trabalho e documentos internos de julho de 2026, organizando-as depois em uma árvore com 542 nós, dos quais 378 eram nós finais. Segundo o anexo metodológico, os julgamentos do modelo de avaliação coincidiram exatamente com os julgamentos humanos em 59% dos casos, contra uma coincidência entre humanos de 35%; em 97% dos casos, os julgamentos ficaram a no máximo um nível de distância entre si. Ainda assim, a Anthropic reconhece que as fronteiras entre “colabora” e “lidera” continuam sujeitas a divergências.
Monitoramento de cerca de 30 mil agentes
A empresa afirma que cerca de 30 mil agentes executavam trabalhos de pesquisa e engenharia a qualquer momento em sua plataforma interna mais utilizada durante agosto de 2026. O sistema inclui monitoramento em tempo real antes da execução da ação e monitoramento posterior para analisar o comportamento depois que ela ocorre. 100% das ações desses agentes passaram pelo monitoramento em tempo real antes da execução, normalmente em questão de segundos, e 100% das ações também foram incluídas no monitoramento posterior.
A Anthropic analisou mais de um bilhão de decisões tomadas por agentes de pesquisa e engenharia durante agosto e constatou que o monitoramento em tempo real bloqueou 0,002% das decisões, ou cerca de uma decisão a cada 47 mil. Já o monitoramento posterior sinalizava cerca de uma a duas em cada mil conversas ou atividades para revisão adicional. Um sistema de classificadores trata a maioria dos alertas, enquanto cerca de 50 casos por semana eram encaminhados a revisores humanos. A empresa afirma que a revisão humana das ações bloqueadas é realizada no prazo de uma semana.
Esses números não significam que os riscos tenham desaparecido; eles medem uma plataforma interna específica e um período limitado de monitoramento, e a detecção de comportamentos raros se torna mais importante à medida que o número de agentes aumenta. A Anthropic reconhece que o experimento de monitoramento se estende por meses, não anos, e que não garante uma visão completa de comportamentos desconhecidos.
Computação destinada à segurança
A Anthropic examinou o uso de computação entre 13 e 20 de julho de 2026, classificou as cargas de trabalho em categorias e então estimou a parcela da computação utilizada em pesquisa e desenvolvimento destinada à pesquisa de segurança. Durante esse período, cerca de 6% da computação de pesquisa e desenvolvimento foi destinada a trabalhos de segurança, e a proporção subiu para cerca de 12% quando considerada a computação destinada à pesquisa e desenvolvimento liderada por IA.
A empresa descreve essas estimativas como conservadoras, pois não contabilizou o trabalho que atende igualmente às capacidades e à segurança, nem incluiu a computação dos classificadores de salvaguardas. Ela ressalta que a parcela não é uma medida completa do esforço empregado em segurança, porque a pesquisa nessa área pode depender mais do tempo dos pesquisadores do que da execução de experimentos intensivos em computação. Além disso, a medição reflete uma única semana e não comprova uma tendência temporal.
Por que essa estrutura é importante?
O principal valor da proposta não está apenas nos números atuais, mas na tentativa de transformar o desenvolvimento da IA de um tema visível somente aos laboratórios em um processo que possa ser acompanhado por meio de indicadores comparáveis. Se os laboratórios publicarem as taxas de automação da pesquisa, a cobertura do monitoramento, o tempo de revisão, as taxas de encaminhamento e a parcela da computação direcionada à segurança, será possível comparar as mudanças ao longo do tempo e, talvez, entre empresas.
Mas a própria Anthropic aponta limitações fundamentais: ainda não existe uma metodologia comum, algumas avaliações dependem dos próprios modelos da empresa e o “juiz” pode repetir os erros do sistema que está avaliando. Além disso, a classificação dos trabalhos de segurança depende de definições cujos limites podem ser traçados de maneira diferente por laboratórios ou órgãos reguladores distintos, enquanto algumas etiquetas de computação se baseiam em dados automatizados ou em entradas de usuários que não são totalmente verificadas.
A empresa afirma que planeja oferecer acesso comparativo a várias entidades de avaliação independentes, para que elas verifiquem as práticas de segurança e monitorem incidentes e indicadores. Portanto, o que mudou de fato foi a disponibilidade de um protótipo de transparência e de dados internos passíveis de debate, não a criação de um padrão global obrigatório. O sucesso da ideia dependerá da padronização das definições, da possibilidade de verificação externa e do esclarecimento sobre o que pode ser publicado sem revelar dados competitivos sensíveis.