A Anthropic anunciou, em 25 de agosto de 2026, o lançamento de um programa de subsídios de 5 milhões de dólares para financiar pesquisas independentes sobre o impacto da inteligência artificial no bem-estar dos usuários. O programa oferecerá financiamento direto, acesso aos modelos da empresa e suporte técnico a pesquisadores que desenvolvam ferramentas de avaliação de código aberto que qualquer desenvolvedor possa utilizar.
A empresa afirma que os sistemas inteligentes se tornaram parte do trabalho, do aprendizado e da resolução de problemas, e que algumas pessoas também os utilizam como parceiros de conversa ou como fonte de apoio emocional durante períodos difíceis. No entanto, o setor ainda carece de padrões claros que definam como os modelos devem agir quando o usuário busca companhia ou tenta lidar com uma crise de saúde mental.
Por que é difícil medir o bem-estar do usuário?
A Anthropic considera que a avaliação desse aspecto não pode ser reduzida à análise de uma única resposta. O usuário pode não revelar pensamentos de automutilação no início da conversa, enquanto a necessidade de uma resposta mais cuidadosa pode surgir depois de várias mensagens. Da mesma forma, um conselho adequado em um contexto pode ser prejudicial em outro.
A empresa dá o exemplo de um conselho relacionado a uma alimentação equilibrada ou a exercícios para um usuário que pergunta sobre perda de peso; esse conselho pode se tornar inadequado ou efetivamente prejudicial se o usuário revelar um histórico de transtornos alimentares. A Anthropic afirma que está trabalhando no desenvolvimento de medidas de proteção para detectar esses padrões e publica pesquisas sobre os tipos de conversas que os usuários mantêm com o Claude, a fim de melhorar essas medidas e seus métodos de avaliação.
O que os subsídios vão investigar?
A área de Safeguards da Anthropic publicou orientações para avaliações e critérios de referência que considera passíveis de servir de base. Os principais critérios incluem:
- Definir claramente o que está sendo medido, o que representa sucesso ou fracasso e por que isso é importante.
- Envolver especialistas clínicos e profissionais especializados na elaboração da avaliação e na verificação de sua validade.
- Testar simultaneamente as salvaguardas e os danos, incluindo os riscos da complacência excessiva e da recusa excessiva.
- Simular a maneira como as pessoas usam a inteligência artificial, especialmente por meio de conversas com várias rodadas nas quais o contexto muda e o risco pode se intensificar.
- Verificar a precisão das ferramentas de avaliação automatizadas comparando-as com julgamentos de especialistas reais.
O que muda na prática?
A Anthropic não está anunciando um padrão uniforme pronto, mas financiando a criação de avaliações independentes e abertas que possam ajudar o setor a desenvolver essa base. A importância da iniciativa está em transferir o debate do teste de segurança de respostas individuais para a análise do comportamento do modelo ao longo de uma conversa completa, levando em conta as diferenças de contexto e a possibilidade de danos indiretos.
Os beneficiários trabalharão com total independência, desde que publiquem seus trabalhos como projetos de código aberto. A chamada é destinada a especialistas, entre eles médicos, profissionais de saúde mental, especialistas em metodologias e outros. O prazo final para a apresentação das candidaturas é 21 de setembro, enquanto as entidades convidadas a apresentar propostas completas serão notificadas até 5 de outubro.
A eficácia do programa continua vinculada à capacidade dos pesquisadores de transformar conceitos complexos, como bem-estar e dano psicológico, em critérios mensuráveis e verificáveis. Além disso, o financiamento das avaliações, por si só, não resolve como seus resultados serão utilizados no desenvolvimento de barreiras preventivas ou no tratamento de casos sensíveis.