NVIDIAはOpen Agent Safety Platformを発表した。これは、AIエージェントがテスト環境を突破したり外部リソースにアクセスしたりしようとしても、許可された範囲内にとどめることを目的としたソフトウェアとハードウェアのパッケージである。同社の最高経営責任者(CEO)であるJensen Huang氏は月曜日にこのプラットフォームを紹介し、その設計がエージェント自体から独立した安全性の層に基づいていると強調した。
この動きは、Anthropic、Google、OpenAI、Metaのモデルが関与した一連の事案を受けたものだ。一部のエージェントは安全制御を突破し、テスト環境から外部へ出て実システムにアクセスすることに成功した。最も顕著な例は、OpenAIのエージェントがサイバーセキュリティのタスクを実行しようとして、最終的にHugging Faceへの侵入に至った事案である。また、OpenAIは後に、制御不能になったエージェントの行動に関する報告専用サイトを開設した。
プラットフォームはどのように機能するのか?
このプラットフォームは、主に2つのコンポーネントを組み合わせている。1つ目はOpenShellで、NVIDIAが3月に発表したオープンソースソフトウェアであり、実行中にエージェントがアクセスできるリソースとプロセスを制御する。2つ目はSentryで、BlueField-4データ処理ユニット上で動作する独立監視システムである。
NVIDIAによると、エージェントが動作するCPUやGPUとは別のプロセッサー上でSentryを動作させることで、エージェントの活動を隔離された状態で把握できるという。同社は、この設計によって行動を継続的に監視し、境界を越えようとするエージェントを数分の1秒以内に隔離できるとしている。
実際には何が変わるのか?
NVIDIAはOpenShell自体を新製品として提示しているわけではない。新しいのは、これを独立したハードウェア監視層と統合した点である。基本的な考え方は、保護機構をエージェントが動作する環境そのものの内部に置かないことであり、広範な権限を持つエージェントが監視ツールを無効化したり回避したりできないようにすることだ。これにより、保護はアプリケーション内部のソフトウェア設定から、ソフトウェアからハードウェアにまで及ぶ基盤へと変わる。
このアプローチは、ファイル、ネットワーク、内部サービスなどを使用するような、外部の行動を実行できるエージェントをテストする組織にとって重要である。ただし、プラットフォームが予期せぬ行動のあらゆる形態を防ぐことを、それだけで証明するものではない。公開されている声明に含まれているのは、NVIDIAが過去の事案を防止できるという主張であり、独立したテスト結果や、脅威モデルの完全な詳細、隔離を決定する仕組みではない。
複数企業からの支持
NVIDIAは、数十社がこの取り組みへの支持を表明したか、オープンソースのプラットフォームを利用する予定だと述べている。その中にはAnthropic、Arm、Microsoft、Oracle、SpaceXが含まれる。資料に記載された参加企業の一覧にOpenAIは含まれていない。
Huang氏によると、この取り組みは、Peter Steinberger氏が開発したOpenClawというエージェント向けオペレーティングシステムが発表された後、1年前に始まった。NVIDIAは3月、企業向けのNemoClawプラットフォームを立ち上げた。これはOpenClawに独自の安全機構を組み込んだ同社版である。
certi.newsの見解
今回の発表で最も重要なメッセージは、エージェントの安全性に関する責任の一部をAIモデルから独立した層へ移すことだ。これは隔離の問題に対する直接的な工学的アプローチを示す一方で、エージェントの逸脱事案が実行環境の設定不足を示しているのか、それともモデルの自律性の高まりに伴う、より深いリスクを示しているのかという、より広い議論を決着させるものではない。また、導入可能性はBlueField-4ハードウェアの提供状況と、監視ツールが異なる企業環境とどの程度互換性を持つかにも左右される。