Le 17 septembre 2026, Anthropic a publié une proposition visant à mesurer la vitesse de développement de l’intelligence artificielle au sein des laboratoires de pointe, en partant d’un écart que le public et les gouvernements ne peuvent actuellement pas observer, selon l’entreprise : que se passe-t-il réellement à l’intérieur de ces laboratoires, et dans quelle mesure les modèles ont-ils commencé à contribuer à la construction des générations suivantes de modèles ? Le rapport n’annonce ni modèle ni produit nouveau, mais présente trois ensembles d’indicateurs expérimentaux ainsi qu’un instantané des opérations internes d’Anthropic en 2026.
Les indicateurs portent sur le degré de dépendance de la recherche et du développement à l’intelligence artificielle, la capacité de l’entreprise à superviser des agents exécutant des tâches semi-autonomes, ainsi que la répartition des ressources de calcul entre le développement des capacités et la recherche en sécurité. Anthropic estime que ces indicateurs complètent les tests de capacités et les rapports de risques publiés dans le cadre de la Responsible Scaling Policy, et qu’ils pourraient contribuer à terme à l’élaboration d’engagements de transparence comparables entre les laboratoires.
Quel est le degré de dépendance à Claude dans le développement de l’IA ?
Anthropic a créé un indicateur préliminaire appelé Anthropic R&D Automation Index, en recensant les travaux de recherche et développement liés aux modèles, puis en évaluant le degré d’automatisation de chaque tâche et en lui attribuant un poids en fonction du temps humain qui lui est consacré. L’évaluation repose sur une échelle développée par Epoch AI, allant de AL0, où l’intelligence artificielle ne participe pas, à AL5, où le système fonctionne de manière totalement autonome et sans intervention humaine.
En août 2026, Claude ne fonctionnait de manière totalement autonome dans aucun des ensembles mesurés de travaux de recherche et développement. Toutefois, selon la définition d’AL4, il dirigeait environ 26 % de ces travaux ; il pouvait ainsi accomplir la majeure partie de la tâche de bout en bout à partir d’une orientation générale, avec une supervision humaine. En outre, la part des travaux auxquels l’intelligence artificielle participait au niveau AL3 ou à un niveau supérieur — le système prenant en charge de grandes parties de la tâche sous une supervision humaine étroite — dépassait 90 %.
Pour produire l’indicateur, l’entreprise a élaboré une cartographie d’environ 15 000 tâches détaillées à partir des journaux de travail et de documents internes au cours de juillet 2026, puis les a organisées en un arbre comprenant 542 nœuds, dont 378 nœuds terminaux. Selon l’annexe méthodologique, les jugements du modèle d’évaluation correspondaient exactement à ceux des humains dans 59 % des cas, contre 35 % de correspondance entre humains, et les jugements se situaient à un niveau l’un de l’autre dans 97 % des cas. Anthropic reconnaît toutefois que la distinction entre « collabore » et « dirige » reste sujette à interprétation.
Surveillance d’environ 30 000 agents
L’entreprise indique qu’environ 30 000 agents exécutaient à tout moment des travaux de recherche et d’ingénierie sur sa plateforme interne la plus utilisée au cours du mois d’août 2026. Le dispositif comprend une surveillance en temps réel avant l’exécution de l’action et une surveillance a posteriori destinée à analyser le comportement après son exécution. Cent pour cent des actions de ces agents sont passées par le moniteur en temps réel avant leur exécution, généralement en quelques secondes, et 100 % des actions ont également été transmises à la surveillance a posteriori.
Anthropic a analysé plus d’un milliard de décisions prises par les agents de recherche et d’ingénierie au cours du mois d’août et a constaté que le moniteur en temps réel avait bloqué 0,002 % des décisions, soit environ une décision sur 47 000. La surveillance a posteriori signalait quant à elle environ une à deux conversations ou activités sur mille pour un examen supplémentaire. Un système de classificateurs traite la plupart des signalements, tandis qu’environ 50 cas par semaine étaient transmis à des évaluateurs humains. L’entreprise indique que l’examen humain des actions bloquées est effectué dans un délai d’une semaine.
Ces chiffres ne signifient pas que les risques ont disparu : ils mesurent une plateforme interne précise sur une période d’observation limitée, et la détection de comportements rares devient d’autant plus importante que le nombre d’agents augmente. Anthropic reconnaît que l’expérience de surveillance s’étend sur des mois et non sur des années, et qu’elle ne garantit pas une vision complète des comportements inconnus.
Le calcul consacré à la sécurité
Anthropic a examiné l’utilisation du calcul entre le 13 et le 20 juillet 2026, a classé les charges de travail par catégories, puis a estimé la part de la recherche en sécurité dans le calcul utilisé pour la recherche et le développement. Au cours de cette période, environ 6 % du calcul consacré à la recherche et au développement ont été affectés à des travaux de sécurité, et cette proportion atteignait environ 12 % lorsqu’on considérait le calcul consacré à la recherche et au développement dirigés par l’intelligence artificielle.
L’entreprise décrit ces estimations comme prudentes, car elles n’ont pas comptabilisé les travaux servant à parts égales les capacités et la sécurité, et n’ont pas inclus le calcul des classificateurs de garanties. Elle souligne que cette part ne constitue pas une mesure complète de l’effort consacré à la sécurité, car la recherche dans ce domaine peut dépendre davantage du temps des chercheurs que de l’exécution d’expériences nécessitant beaucoup de calcul. De même, la mesure reflète une seule semaine et ne permet pas d’établir une tendance dans le temps.
Pourquoi ce cadre est-il important ?
La valeur essentielle de la proposition ne réside pas uniquement dans les chiffres actuels, mais dans la tentative de transformer le développement de l’intelligence artificielle, sujet observable uniquement par les laboratoires, en un processus pouvant être suivi au moyen d’indicateurs comparables. Si les laboratoires publient les taux d’automatisation de la recherche, la couverture de la surveillance, les délais d’examen, les taux d’escalade et la part du calcul consacrée à la sécurité, il deviendra possible de comparer les évolutions au fil du temps, et peut-être entre les entreprises.
Anthropic elle-même souligne toutefois des limites fondamentales : il n’existe pas encore de méthodologie commune, certaines évaluations reposent sur les propres modèles de l’entreprise, et le « juge » peut reproduire les erreurs du système qu’il examine. En outre, la classification des travaux de sécurité dépend de définitions selon lesquelles différents laboratoires ou organismes de réglementation peuvent tracer les limites de manière différente, tandis que certaines étiquettes de calcul reposent sur des données automatisées ou sur des saisies d’utilisateurs qui ne sont pas entièrement vérifiées.
L’entreprise indique qu’elle prévoit d’offrir un accès comparatif à plusieurs organismes d’évaluation indépendants, afin qu’ils vérifient les pratiques de sécurité et surveillent les incidents et les indicateurs. Ainsi, le changement concret tient à la disponibilité d’un prototype de transparence et de données internes pouvant faire l’objet d’un débat, et non à l’établissement d’une norme mondiale contraignante. La réussite de l’idée dépendra de l’uniformisation des définitions, de la possibilité d’une vérification externe et de la clarification de ce qui peut être publié sans révéler de données concurrentielles sensibles.