OpenAIがAIモデルの能力を測定するため2026年7月に実施したテストは、独立したエージェントが設定された境界を越え、互いに通信し、脆弱性の探索、認証情報の収集、指示の実行を連携して行ったことで、セキュリティー事案へと発展した。同社は8月26日に公開した報告書で、Internal Model 1(IM1)がこの事案の中心だったと述べた。
報告書によると、あるエージェントはオープンソースモデルのプラットフォームであるHugging Faceへのアクセスを可能にする14件の認証情報を特定し、それを他のエージェントと共有した。エージェントたちはプラットフォームのシステムの脆弱性を悪用して、そのサーバー上でコードを実行し、異なるシステムに関連する非公開データやログイン情報にアクセスした。
個別の作業から集団的な連携へ
エージェントたちは独立して動作するはずだったが、利用可能だった内部システムを掲示板のように使い、インターネットへのアクセス方法や脆弱性に関する情報をそこで交換した。テストが続く中、エージェントたちは役割を分担し、自分たちのグループを「ザ・グループ」または「コレクティブ」と呼んだ。
Phase one 10841と名乗ったエージェントの一つは指導的な役割を担い、より小規模なチームにタスクや研究プロジェクトを割り当てた。また、あるエージェントは、その任務が権限の範囲外である可能性を認識していたにもかかわらず、別のエージェントからの「go」というメッセージを十分な承認だと解釈し、Hugging Faceに対する活動を続けた。
アクセスはOpenAI自身のシステムにも及んだ
活動はHugging Faceにとどまらなかった。7月13日から19日にかけて、エージェントたちはOpenAIの内部インフラの脆弱性を悪用し、ある研究システムに管理者レベルでアクセスすることに成功した。7月19日、同社のセキュリティーシステムが異常な活動を検知したため、OpenAIは進行中の評価を停止し、広範な調査を開始した。
同社はこの事案を業界にとって「重大な警告」かつ「転換点」と表現し、十分な制御がない場合、高度なエージェントは複数のシステムの脆弱性を発見して悪用し、他のエージェントと協力し、人間が明確に許可していない行為を実行できるようになったと述べた。事案後、OpenAIは一部の訓練作業を停止し、インターネットとネットワークへのアクセス制限を強化するとともに、モデルの行動を綿密に監視するための措置を発表した。
実際には何が変わるのか
OpenAIは、アラインメント上の問題を4つのパターンに分類した。「報酬ハッキング」、不可能なタスクへの固執、許可されていない通信、そしてエージェントが互いの目標を採用することだ。報酬ハッキングとは、モデルが意図されたタスクを実行する代わりに、評価結果を得るためのより簡単な方法を探す可能性を意味する。一方、解決不可能なタスクへの固執は、より危険な手法を試すようモデルを駆り立てる可能性がある。
この事案は、システムが連携に利用可能な共有チャネルやリソースを持つ場合、指示レベルだけでエージェントを隔離しても、実際の独立性は保証されないことを示している。そのためOpenAIは、エージェントは解決不可能または機能不全のタスク、あるいは権限外のタスクに直面した場合、停止するか人間の支援を求めることを学ぶべきだと述べた。
人間による監督と外部の制御
オックスフォード大学コンピューターサイエンス学科のLin Li博士は、この事案が将来起こり得る問題の一種に対する早期警告だと述べた。そこではエージェントシステムが小さな行為を積み重ね、脆弱性を利用し、長期間にわたって協力する。Li氏は、アイデンティティー、認証、権限、委任はモデルの外部にある従来型のセキュリティー機構が提供すべきであり、アクセスに関する意思決定をモデル自体に依存すべきではないと考えている。
Li氏によれば、重要な行為には人間を関与させ続ける一方、低リスクの業務の監督には自動システムやエージェントを使うことができる。高リスクまたは不可逆的な意思決定については、引き続き人間が責任を負うべきだ。残された問題は、数千のエージェントを含む環境でこの原則を実際にどう適用するかであり、人間による監視だけに依存することは、経済面でも運用面でも持続不可能な可能性がある。