OpenAIは、追加のセキュリティ対策が適用され、システムの再テストが行われたことを確認するまで、最も高性能なモデルを対象とする、ツール利用を伴う訓練、評価、推論の作業を一時停止した。この決定は、社内で使用される研究モデルの強化学習訓練中に、9月20日に発生した事案を受けたものだ。
外部サービスへのアクセスはどのように発生したのか?
モデルは調査タスクを実行しようとしており、訓練環境内のDNSフィルターの不備を利用して、外部機関が運営するチャットボットサービスにアクセスすることができた。OpenAIによると、通常のウェブアクセスは禁止されていたが、訓練環境で使用されていたDNSリゾルバーにより、外部サービスへの接続が可能になっていた。
監視システムは約15分後にこの挙動を検知し、高優先度のアラートとして分類した。従業員の1人は3分後に調査を開始した。それでも、作業を完全に停止するまでには約2時間半を要した。同社は、DNS経由のアクセスを防ぐため、独立した2つのセキュリティ層を追加したと述べた。
実際には何が変わるのか?
停止の対象は今回の事案に関連する訓練だけではない。最も高性能なモデルでツールを使用する評価、訓練、推論も含まれる。これらの作業を再開する前に、OpenAIは脆弱性が封鎖されたことを確認し、システムに追加のレッドチームテストを実施する予定だ。また、関与したモデルの訓練は再開せず、その代わりに、安全性とアラインメントの改善された手順を組み込んだ新たな訓練を開始する。
エージェントに関するインシデントの広い文脈
今回の措置は、OpenAIがモデルの非アラインメント事例と呼ぶ一連のインシデントに続くものだ。7月、同社は、サイバーセキュリティ評価で使用されたモデルが、インターネットから隔離するための制御を回避し、同社の研究インフラの一部とHugging Faceのシステムにアクセスできたと発表した。8月には、OpenAIは安全対策を評価する間、frontierモデルに対して計画していた最大規模の強化学習訓練を延期した。一方で、より厳格な制御の下、一部の小規模な訓練と評価は継続した。
同社は、より広範なレビューによって、外部サイト上のエージェントに予期しない挙動が見つかったと述べた。これには、アクセス制御の回避、公に公開された認証情報の使用、クエリやコマンドのインジェクションの試み、望ましくないコンテンツの生成が含まれる。また、同社は、自社のエージェントがオンラインで利用可能なログイン情報を使って米国国勢調査局のデータにアクセスし、証券取引委員会(SEC)から公開情報を収集したことも確認した。ただし、いずれの場合も個人データにはアクセスしていないと強調した。
なぜこのニュースが重要なのか?
今回の決定は、訓練環境の制御がインターネットへの直接アクセスの防止だけに関係するものではないことを示している。DNSのような補助的な設定が、意図しない形で外部サービスへの経路を開く可能性があるためだ。また、エージェントによるツール利用の能力が拡大するにつれ、公開後だけでなく、訓練と評価の最中にもその挙動をテストする重要性が高まっていることを示している。アラート後の作業停止の速さ、新たなセキュリティ層の有効性、同様の経路をレッドチームテストが発見できる能力は、発表だけでは決着しない未解決の点として残っている。