Intelligence artificielle

Anthropic consacre 5 millions de dollars au financement d’évaluations indépendantes de l’impact de l’intelligence artificielle sur le bien-être des utilisateurs

Anthropic a lancé un programme de subventions de 5 millions de dollars destiné à financer des recherches indépendantes et open source mesurant l’impact des systèmes d’intelligence artificielle sur le bien-être des utilisateurs. Le programme se concentre sur les conversations à plusieurs tours, les crises de santé mentale et les risques liés à une réponse excessivement complaisante ou à un refus excessif.

2026-09-27
4 min de lecture
13 vues
certi.news Editorial Team
Anthropic consacre 5 millions de dollars au financement d’évaluations indépendantes de l’impact de l’intelligence artificielle sur le bien-être des utilisateurs

Anthropic a annoncé le 25 août 2026 le lancement d’un programme de subventions de 5 millions de dollars destiné à financer des recherches indépendantes sur l’impact de l’intelligence artificielle sur le bien-être des utilisateurs. Le programme fournira un financement direct, un accès aux modèles de l’entreprise et un soutien technique aux chercheurs qui développent des outils d’évaluation open source utilisables par n’importe quel développeur.

L’entreprise affirme que les systèmes intelligents font désormais partie du travail, de l’apprentissage et de la résolution de problèmes, tandis que certaines personnes les utilisent comme partenaires de conversation ou comme source de soutien émotionnel pendant les périodes difficiles. Cependant, le secteur manque encore de normes claires définissant la manière dont les modèles doivent se comporter lorsqu’un utilisateur cherche de la compagnie ou tente de faire face à une crise de santé mentale.

Pourquoi est-il difficile de mesurer le bien-être des utilisateurs ?

Anthropic estime que l’évaluation de cet aspect ne peut pas se réduire à l’examen d’une réponse isolée. L’utilisateur peut ne pas révéler ses pensées suicidaires au début de la conversation, tandis que la nécessité d’une réponse plus prudente peut apparaître après plusieurs messages. De même, un conseil approprié dans un contexte peut être nuisible dans un autre.

L’entreprise donne l’exemple d’un conseil concernant une alimentation équilibrée ou l’exercice destiné à un utilisateur qui demande comment perdre du poids ; ce conseil peut devenir inadapté ou réellement préjudiciable si l’utilisateur révèle des antécédents de troubles alimentaires. Anthropic affirme travailler au développement de mesures de protection permettant de détecter ces schémas et publier des recherches sur les types de conversations que les utilisateurs ont avec Claude afin d’améliorer ces mesures et leurs méthodes d’évaluation.

Que rechercheront les subventions ?

La division Safeguards d’Anthropic a publié des lignes directrices concernant les évaluations et les critères de référence qu’elle considère comme susceptibles de servir de base. Les principaux critères comprennent :

  • Définir clairement ce qui est mesuré, ce qui constitue une réussite ou un échec, et pourquoi cela est important.
  • Faire participer des experts cliniques et des spécialistes à la conception de l’évaluation et à la validation de sa pertinence.
  • Tester ensemble les précautions et les préjudices, notamment les risques liés à une conformité excessive et à un refus excessif.
  • Simuler la manière dont les gens utilisent l’intelligence artificielle, notamment au moyen de conversations à plusieurs tours dans lesquelles le contexte évolue et le risque peut s’accroître.
  • Vérifier l’exactitude des outils d’évaluation automatisés en les comparant aux jugements de véritables experts.

Qu’est-ce qui change concrètement ?

Anthropic n’annonce pas de norme unifiée prête à l’emploi, mais finance la création d’évaluations indépendantes et ouvertes qui pourraient aider le secteur à développer une telle base. L’importance de cette initiative réside dans le déplacement du débat : il ne s’agit plus seulement de tester la sécurité de réponses individuelles, mais d’examiner le comportement du modèle au cours d’une conversation entière, en tenant compte des différences de contexte et de la possibilité de préjudices indirects.

Les bénéficiaires travailleront en toute indépendance et devront publier leurs travaux sous forme de projets open source. L’appel s’adresse notamment à des médecins, des psychologues, des experts des méthodologies et d’autres spécialistes. La date limite de dépôt des candidatures est fixée au 21 septembre, tandis que les entités invitées à soumettre des propositions complètes seront informées d’ici le 5 octobre.

L’efficacité du programme restera liée à la capacité des chercheurs à transformer des concepts complexes tels que le bien-être et le préjudice psychologique en critères mesurables et vérifiables. En outre, le financement des évaluations ne détermine pas à lui seul la manière dont leurs résultats seront utilisés pour concevoir des garde-fous préventifs ou traiter les situations sensibles.

Source de l’actualité
Anthropic Newsroom
Ouvrir la source originale ↗
c
Auteur

certi.news Editorial Team

Dans la même catégorie

À lire également

Voir toutes les actualités