人工知能

Anthropic、先進的ラボにおけるAIの進歩速度を測定する公開指標を提案

Anthropicは2026年9月17日、AI研究がClaudeにどの程度依存しているか、エージェントの監視メカニズム、そして安全性研究に割り当てられた計算資源の割合を測定する実験的枠組みを公表した。数値によると、Claudeは同社の研究開発業務の26%を主導している一方、2026年8月まで、測定対象となったいかなる部分でも完全な自律性を持って稼働していなかった。同社は、測定には標準化された方法論と独立した検証が必要だと強調している。

2026-09-18
1 分で読めます
12 閲覧数
فريق تحرير certi.news
Anthropic、先進的ラボにおけるAIの進歩速度を測定する公開指標を提案

Anthropicは2026年9月17日、先進的なラボにおけるAI開発の速度を測定する提案を公表した。これは、一般の人々や政府が現在把握できていないと同社が指摘する隔たり、すなわち、こうしたラボの内部で実際に何が起きているのか、そしてモデルが次世代モデルの構築をどの程度支援し始めているのか、という問題から出発している。報告書は新たなモデルや製品を発表するものではなく、2026年におけるAnthropic内部の業務のスナップショットとともに、3つの実験的な指標群を提示している。

指標は、研究開発がAIにどの程度依存しているか、準自律的なタスクを実行するエージェントを同社が監督する能力、そして能力開発と安全性研究の間で計算資源をどのように配分しているかに焦点を当てている。Anthropicは、これらの指標がResponsible Scaling Policyに基づいて公表されている能力テストやリスク報告を補完し、将来的にはラボ間で比較可能な透明性へのコミットメントの構築に役立つ可能性があると考えている。

AI開発におけるClaudeへの依存度はどの程度か?

Anthropicは、Anthropic R&D Automation Indexと呼ぶ初期指標を作成した。モデルに関連する研究開発業務を網羅し、各タスクの自動化の度合いを評価したうえで、人間が割り当てた時間に応じて重み付けを行ったものである。評価にはEpoch AIが開発した尺度を用いており、AIが関与しないAL0から、人間の介入なしにシステムが完全に自律して動作するAL5までの段階で構成されている。

2026年8月時点で、Claudeは測定対象となった研究開発業務のいずれのグループでも完全な自律性を持って稼働していなかった。しかし、AL4の定義では、これらの業務のおよそ26%を主導していた。つまり、一般的な指示を起点に、人間の監督を受けながらタスクの大部分を端から端まで遂行できるということである。また、AIがAL3以上の水準で関与する業務、すなわち、人間による密接な指示の下でシステムがタスクの大部分を担う業務の割合は、90%を超えていた。

指標を作成するため、同社は2026年7月の業務記録と内部文書に基づき、およそ15,000件の詳細なタスクからなるマップを作成し、それらを542のノードからなるツリーに整理した。そのうち378ノードは末端ノードである。方法論の付録によると、評価モデルの判定が人間の判定と完全に一致したのは59%で、人間同士の一致率は35%だった。また、97%のケースでは判定が互いに1段階以内に収まった。ただしAnthropicは、「協力する」と「主導する」の境界には依然として解釈の余地があると認めている。

約30,000体のエージェントを監視

同社によると、2026年8月、最も利用されている社内プラットフォーム上で、約30,000体のエージェントが常時、研究およびエンジニアリング業務を実行していた。このシステムには、アクションの実行前に行うリアルタイム監視と、実行後に行動を分析する事後監視が含まれる。これらのエージェントによるアクションは100%が実行前にリアルタイム監視を通過し、通常は数秒以内に処理された。また、アクションの100%が事後監視にも入力された。

Anthropicは8月中に研究・エンジニアリングエージェントが下した10億件を超える判断を分析し、リアルタイム監視が判断の0.002%、すなわち約47,000件に1件を遮断したことを確認した。一方、事後監視では、追加レビューのために1,000件の会話またはアクティビティのうち約1〜2件にフラグが付けられた。フラグの大半は分類器システムが処理し、週に約50件が人間のレビュアーへエスカレーションされた。同社によると、遮断されたアクションに対する人間のレビューは1週間以内に行われる。

これらの数値は、リスクが消滅したことを意味しない。特定の内部プラットフォームと限られた監視期間を測定したものにすぎず、エージェントの数が増えるほど、まれな行動の検出が重要になるためである。Anthropicは、監視の実験は数年ではなく数か月にわたるものであり、未知の行動について完全な全体像を把握できることを保証するものではないと認めている。

安全性に割り当てられた計算資源

Anthropicは2026年7月13日から20日までの計算資源の利用を調査し、ワークロードを分類したうえで、研究開発に使用された計算資源のうち安全性研究が占める割合を推定した。この期間、研究開発の計算資源のおよそ6%が安全性業務に向けられ、AIが主導する研究開発に割り当てられた計算資源に限ると、その割合はおよそ12%に上昇した。

同社はこれらの推定を保守的なものと説明している。能力と安全性の双方に等しく役立つ業務を算入しておらず、保証措置の分類器に用いられる計算資源も含めていないためである。同社は、この割合が安全性に投入された取り組み全体を測る完全な指標ではないと強調している。この分野の研究は、計算資源を大量に使用する実験の実行よりも、研究者の時間に依存する場合があるからである。また、この測定は1週間を反映したものにすぎず、時間的な傾向を示すものでもない。

なぜこの枠組みが重要なのか?

この提案の本質的な価値は現在の数値だけにあるのではなく、AIの進歩をラボだけが見ることのできる対象から、比較可能な指標で追跡できるプロセスへと変えようとする試みにある。ラボが研究の自動化率、監視のカバレッジ、レビューに要する時間、エスカレーション率、安全性に向けられた計算資源の割合を公表すれば、時間の経過に伴う変化、さらには企業間の比較も可能になるかもしれない。

しかしAnthropic自身が、根本的な制約を挙げている。現時点では共通の方法論が存在せず、一部の評価は同社自身のモデルに依存しており、「判定者」がレビュー対象のシステムと同じ誤りを繰り返す可能性もある。また、安全性業務の分類は定義に依存するため、ラボや規制当局によって境界線の引き方が異なる可能性がある。さらに、計算資源に関する一部のラベルは、自動データや、完全には検証されていないユーザー入力に基づいている。

同社は、複数の独立した評価機関が比較可能な形でアクセスできるようにし、安全性の実践を検証するとともに、インシデントや指標を監視できるようにする計画だと述べている。したがって、実際に変化したのは、透明性のプロトタイプと議論可能な内部データが利用できるようになったことであり、世界的で拘束力のある基準がすでに成立したわけではない。この構想の成否は、定義の統一、外部検証へのアクセス、競争上機微なデータを明らかにせずに何を公表できるかの明確化にかかっている。

ニュースの出典
Anthropic Newsroom
原文を開く ↗
ف
著者

فريق تحرير certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る