Искусственный интеллект

Anthropic предлагает публичные метрики для измерения темпов развития ИИ внутри передовых лабораторий

17 сентября 2026 года Anthropic опубликовала экспериментальную систему измерения зависимости исследований в области ИИ от Claude, механизмов мониторинга агентов и доли вычислительных ресурсов, выделенных на исследования безопасности. Согласно данным, Claude руководит 26% исследовательских и разработческих работ компании, однако по состоянию на август 2026 года не работал полностью автономно ни в одном измеряемом направлении. Компания подчёркивает, что для измерений необходимы единые методологии и независимая проверка.

2026-09-18
5 мин. чтения
12 просмотров
فريق تحرير certi.news
Anthropic предлагает публичные метрики для измерения темпов развития ИИ внутри передовых лабораторий

17 сентября 2026 года Anthropic опубликовала предложение по измерению темпов развития ИИ внутри передовых лабораторий, исходя из пробела, который, по словам компании, общественность и правительства в настоящее время не могут наблюдать: что фактически происходит внутри этих лабораторий и в какой степени модели уже помогают создавать последующие поколения моделей? Отчёт не объявляет о новой модели или продукте, а представляет три группы экспериментальных метрик и снимок внутренних процессов Anthropic в 2026 году.

Метрики сосредоточены на степени зависимости исследований и разработок от ИИ, способности компании контролировать агентов, выполняющих частично автономные задачи, а также на распределении вычислительных ресурсов между развитием возможностей и исследованиями безопасности. Anthropic считает, что эти показатели дополняют тесты возможностей и опубликованные отчёты о рисках в рамках политики Responsible Scaling Policy и впоследствии могут помочь сформировать сопоставимые обязательства лабораторий по обеспечению прозрачности.

Насколько разработка ИИ зависит от Claude?

Anthropic создала предварительный показатель, названный Anthropic R&D Automation Index, составив перечень исследовательских и разработческих работ, связанных с моделями, затем оценив степень автоматизации каждой задачи и рассчитав её вес в соответствии с выделенным на неё человеческим временем. Оценка основана на шкале, разработанной Epoch AI, которая простирается от AL0, когда ИИ не участвует, до AL5, когда система работает полностью автономно и без вмешательства человека.

По состоянию на август 2026 года Claude не работал полностью автономно ни в одной измеряемой группе исследовательских и разработческих работ. Однако, согласно определению AL4, он руководил примерно 26% этих работ; то есть мог выполнять большую часть задачи от начала до конца, исходя из общего указания и при человеческом контроле. Кроме того, доля работ, в которых ИИ участвовал на уровне AL3 или выше, когда система выполняет значительные части задачи под тщательным руководством человека, превысила 90%.

Для создания показателя компания составила карту примерно из 15 тысяч детализированных задач на основе рабочих журналов и внутренних документов за июль 2026 года, а затем организовала их в дерево из 542 узлов, включая 378 конечных узлов. Согласно методологическому приложению, оценки модели совпадали с оценками людей ровно в 59% случаев, тогда как совпадение между людьми составляло 35%; при этом оценки отличались друг от друга не более чем на один уровень в 97% случаев. Однако Anthropic признаёт, что границы между «сотрудничает» и «руководит» остаются предметом разногласий.

Мониторинг примерно 30 тысяч агентов

Компания сообщает, что в любой момент в августе 2026 года на её наиболее широко используемой внутренней платформе исследовательские и инженерные работы выполняли примерно 30 тысяч агентов. Система включает мониторинг в реальном времени до выполнения действия и последующий мониторинг для анализа поведения после его совершения. 100% действий этих агентов проходили через мониторинг в реальном времени до выполнения, обычно в течение нескольких секунд; кроме того, 100% действий передавались в систему последующего мониторинга.

Anthropic проанализировала более миллиарда решений, принятых исследовательскими и инженерными агентами в течение августа, и обнаружила, что мониторинг в реальном времени блокировал 0,002% решений — примерно одно решение из 47 тысяч. Последующий мониторинг помечал для дополнительной проверки примерно один-два из каждой тысячи диалогов или действий. Большинство помеченных случаев обрабатывает система классификаторов, тогда как около 50 случаев в неделю передавались на рассмотрение людям. Компания сообщает, что человеческая проверка заблокированных действий проводится в течение недели.

Эти цифры не означают, что риски исчезли: они измеряют конкретную внутреннюю платформу и ограниченный период наблюдения, а выявление редкого поведения становится тем важнее, чем больше агентов используется. Anthropic признаёт, что эксперимент по мониторингу продолжается месяцы, а не годы, и не гарантирует получение полной картины неизвестных моделей поведения.

Вычислительные ресурсы, выделенные на безопасность

Anthropic изучила использование вычислительных ресурсов в период с 13 по 20 июля 2026 года, классифицировала рабочие нагрузки по категориям, а затем оценила долю исследований безопасности в вычислительных ресурсах, использованных для исследований и разработок. В этот период около 6% вычислительных ресурсов исследований и разработок направлялось на работы по безопасности; при рассмотрении вычислительных ресурсов, выделенных на исследования и разработки, которыми руководил ИИ, доля возрастала примерно до 12%.

Компания описывает эти оценки как консервативные, поскольку не учитывала работу, в равной степени служащую развитию возможностей и безопасности, а также не включала вычислительные ресурсы классификаторов гарантий. Она подчёркивает, что эта доля не является полной мерой усилий, затраченных на безопасность, поскольку исследования в данной области могут в большей степени зависеть от времени исследователей, чем от запуска вычислительно ёмких экспериментов. Кроме того, показатель отражает одну неделю и не доказывает наличие временной тенденции.

Почему эта система важна?

Основная ценность предложения заключается не только в текущих цифрах, но и в попытке превратить развитие ИИ из темы, доступной для наблюдения лишь лабораториям, в процесс, который можно отслеживать с помощью сопоставимых показателей. Если лаборатории будут публиковать доли автоматизации исследований, охват мониторинга, время проверки, показатели эскалации и долю вычислительных ресурсов, направленных на безопасность, станет возможным сравнивать изменения с течением времени и, возможно, между компаниями.

Однако сама Anthropic указывает на существенные ограничения: общей методологии пока нет, некоторые оценки зависят от собственных моделей компании, а «судья» может воспроизводить ошибки системы, которую он проверяет. Кроме того, классификация работ по безопасности зависит от определений, границы которых разные лаборатории или регулирующие органы могут проводить по-разному, тогда как некоторые метки вычислительных ресурсов основываются на автоматических данных или неполностью проверенных пользовательских вводах.

Компания сообщает, что планирует предоставить нескольким независимым оценочным организациям сопоставимый доступ, чтобы они могли проверять практики безопасности и отслеживать инциденты и показатели. Поэтому фактически изменилось наличие прототипа прозрачности и внутренних данных, открытых для обсуждения, а не появление обязательного мирового стандарта. Успех этой идеи будет зависеть от унификации определений, возможности внешней проверки и ясного определения того, что можно публиковать без раскрытия чувствительных конкурентных данных.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости