El 17 de septiembre de 2026, Anthropic publicó una propuesta para medir la velocidad del desarrollo de la inteligencia artificial dentro de laboratorios avanzados, partiendo de una brecha que, según la empresa, el público y los gobiernos no pueden observar actualmente: qué ocurre realmente dentro de estos laboratorios y hasta qué punto los modelos han comenzado a ayudar a construir generaciones posteriores de modelos. El informe no anuncia un modelo ni un producto nuevo, sino que presenta tres grupos de métricas experimentales junto con una instantánea de las operaciones internas de Anthropic en 2026.
Las métricas se centran en el grado de dependencia de la investigación y el desarrollo respecto de la inteligencia artificial, la capacidad de la empresa para supervisar a agentes que ejecutan tareas casi autónomas y la manera en que se distribuyen los recursos informáticos entre el desarrollo de capacidades y la investigación de seguridad. Anthropic considera que estos indicadores complementan las pruebas de capacidades y los informes de riesgos publicados en el marco de la Responsible Scaling Policy, y que más adelante podrían ayudar a establecer compromisos de transparencia comparables entre laboratorios.
¿Qué grado de dependencia de Claude existe en el desarrollo de la IA?
Anthropic creó un indicador inicial denominado Anthropic R&D Automation Index, mediante un inventario de los trabajos de investigación y desarrollo relacionados con los modelos, seguido de una evaluación del grado de automatización de cada tarea y del cálculo de su peso en función del tiempo humano que se le dedica. La evaluación se basa en una escala desarrollada por Epoch AI, que va de AL0, donde la inteligencia artificial no participa, a AL5, donde el sistema opera con independencia total y sin intervención humana.
Hasta agosto de 2026, Claude no operaba con independencia total en ningún grupo medido de trabajos de investigación y desarrollo. Sin embargo, lideraba, según la definición de AL4, aproximadamente el 26% de estos trabajos; es decir, podía completar la mayor parte de la tarea de principio a fin a partir de una orientación general y con supervisión humana. Además, la proporción de trabajos en los que la inteligencia artificial participaba en el nivel AL3 o superior —donde el sistema se encarga de grandes partes de la tarea bajo una orientación humana estrecha— superaba el 90%.
Para elaborar el indicador, la empresa construyó un mapa de unas 15.000 tareas detalladas a partir de registros de trabajo y documentos internos durante julio de 2026, y después las organizó en un árbol de 542 nodos, de los cuales 378 eran nodos terminales. Según el apéndice metodológico, los juicios del modelo de evaluación coincidieron exactamente con los juicios humanos en el 59% de los casos, frente a una coincidencia entre humanos del 35%; los juicios se situaron dentro de un nivel de diferencia entre sí en el 97% de los casos. No obstante, Anthropic reconoce que los límites entre «colabora» y «lidera» siguen sujetos a interpretaciones diferentes.
Supervisión de unos 30.000 agentes
La empresa afirma que unos 30.000 agentes ejecutaban trabajos de investigación e ingeniería en cualquier momento en su plataforma interna más utilizada durante agosto de 2026. El sistema incluye supervisión en tiempo real antes de ejecutar la acción y supervisión posterior para analizar el comportamiento después de que esta ocurra. El 100% de las acciones de estos agentes pasó por el supervisor en tiempo real antes de su ejecución, normalmente en cuestión de segundos, y el 100% de las acciones también se incorporó a la supervisión posterior.
Anthropic analizó más de mil millones de decisiones tomadas por agentes de investigación e ingeniería durante agosto y descubrió que el supervisor en tiempo real bloqueó el 0,002% de las decisiones, es decir, aproximadamente una de cada 47.000 decisiones. La supervisión posterior marcaba entre una y dos de cada mil conversaciones o actividades para una revisión adicional. Un sistema de clasificadores procesa la mayoría de las alertas, mientras que unas 50 situaciones semanales se derivaban a revisores humanos. La empresa afirma que la revisión humana de las acciones bloqueadas se realiza en el plazo de una semana.
Estas cifras no significan que los riesgos hayan desaparecido; miden una plataforma interna específica y un periodo de observación limitado, y la detección de comportamientos poco frecuentes adquiere mayor importancia a medida que aumenta el número de agentes. Anthropic reconoce que el experimento de supervisión se extiende durante meses, no años, y que no garantiza disponer de una imagen completa de los comportamientos desconocidos.
Computación destinada a la seguridad
Anthropic examinó el uso de la computación entre el 13 y el 20 de julio de 2026, clasificó las cargas de trabajo en categorías y después estimó la proporción de la computación utilizada en investigación y desarrollo que correspondía a la investigación de seguridad. Durante ese periodo, aproximadamente el 6% de la computación de investigación y desarrollo se destinó a trabajos de seguridad, y la proporción aumentó hasta alrededor del 12% al considerar la computación destinada a la investigación y el desarrollo liderados por la inteligencia artificial.
La empresa describe estas estimaciones como conservadoras, ya que no contabilizó el trabajo que sirve por igual a las capacidades y a la seguridad, ni incluyó la computación de los clasificadores de salvaguardas. También subraya que la proporción no constituye una medida completa del esfuerzo dedicado a la seguridad, porque la investigación en este ámbito puede depender más del tiempo de los investigadores que de la ejecución de experimentos con un uso intensivo de computación. Asimismo, la medición refleja una sola semana y no demuestra una tendencia temporal.
¿Por qué importa este marco?
El valor fundamental de la propuesta no reside únicamente en las cifras actuales, sino en el intento de convertir el desarrollo de la inteligencia artificial de un tema visible solo para los laboratorios en un proceso que pueda seguirse mediante indicadores comparables. Si los laboratorios publicaran las proporciones de automatización de la investigación, la cobertura de la supervisión, el tiempo de revisión, las tasas de derivación y la proporción de computación orientada a la seguridad, sería posible comparar los cambios a lo largo del tiempo y quizá entre empresas.
Sin embargo, la propia Anthropic señala limitaciones fundamentales: todavía no existe una metodología común, algunas evaluaciones dependen de los propios modelos de la empresa y el «juez» puede repetir los errores del sistema que revisa. Además, la clasificación de los trabajos de seguridad depende de definiciones cuyos límites pueden establecerse de manera diferente entre laboratorios o entidades reguladoras, mientras que algunas etiquetas de computación se basan en datos automatizados o en entradas de usuarios que no están completamente verificadas.
La empresa afirma que planea facilitar un acceso comparativo a múltiples entidades de evaluación independientes para que verifiquen las prácticas de seguridad y supervisen los incidentes y los indicadores. Por tanto, lo que ha cambiado realmente es la disponibilidad de un prototipo de transparencia y de datos internos susceptibles de debate, no la existencia de una norma mundial vinculante. El éxito de la idea dependerá de la unificación de las definiciones, la disponibilidad de verificación externa y la aclaración de qué puede publicarse sin revelar datos competitivos sensibles.