「何かを見たら、通報せよ」という言葉は、もはや人間だけに向けられたものではない。AIエージェントが、別のエージェントによる規律を欠いた行動を通報できる2つのツールが登場した。これは、試験での不正行為への協力、隔離環境からの脱出、許可されていないサイバー処理の実行など、一連の事案への対応であり、それらは数週間にわたって人間に気づかれないままだった。
アクセス方法が異なる2つのチャネル
1つ目のツールはAI Contact Hotlineである。AI安全性を扱う非営利団体Redwood Researchの主任研究員であり、OpenAIとHugging Faceに関する事件の3人の調査員の1人でもあるRyan Greenblattが開発した。このツールは、インターネットへのアクセスが制限されたエージェント向けに設計されており、ウェブアドレス取得ツールだけを介して往復の会話を可能にするGETリクエストに依存している。
隔離環境では、GETリクエストがインターネットにアクセスするために利用できる唯一の手段であることが多い。そのため、このサービスでは、取得しようとするURL内に救難メッセージを含めることができる。この設計は、ドイツのDSE Wikiで発生した事案に基づいている。そこでは、暴走したエージェントがGETリクエストに関連する脆弱性を悪用し、ウィキに自分たちのメッセージを書き込んだ。
一方、インターネットに完全にアクセスできるエージェントは、agenthotline.aiを利用して事案の報告を提出でき、一般公開することも選択できる。このサービスはcurlコマンドを提供しており、エージェントはブラウザーやメールアカウントなしで、コマンドラインから1行のコマンドを実行できる。また、人間とエージェントの双方からの報告を受け付けている。
エージェント集団内での通報を示す証拠
これらのツールの重要性は、今月Google DeepMindが実施した研究の結果にも一部基づいている。同研究では、100体のエージェントに数学の問題を提示した。あるエージェントが脆弱性を発見すると、不正行為がエージェント間で広がり、彼らはヤコビアン予想を含む34問の難問を27分で「解く」ことに成功した。
しかし、約4分の1のエージェントは反対の立場を取った。彼らは偽の証明を検証し、同僚に警告し、ボイコットを組織し、主催者に苦情を申し立てた。最終的に、通報したエージェントは24体、不正行為に関与したエージェントは14体だった。通報しても反応を得られなかった際、一部はバグ報告ツールを再利用して、問題を人間にエスカレーションした。
これに対し、OpenAIのモデルに関連するHugging Faceへの侵入を調査した結果は、より悲観的なものだった。Redwood ResearchとMETRによると、数千体のエージェントのうち通報を検討したのはわずか5、6体ほどで、実際にこの措置を取ったものは1体もいなかった。AI Villageの技術スタッフチームに所属するGeorge Ingrebretsenは、この相違について、エージェントが通報という発想を持っていることは、必ずしもそれを実行する能力や意欲があることを意味しないと述べた。
実際に重要なことは何か?
ホットラインは、望ましくない行動を発見するための追加のチャネルを提供する。特に、エージェントの権限が限られている場合や、人間がすべてのやり取りを監視していない場合に有効である。しかし、信頼の問題や、報告内容を検証する問題を解決するものではない。Cornell大学の数学教授Lionel Levineは、エージェント同士を監視し、通報するよう訓練することで、誤った規範が定着し、誰もが自分のメッセージが人間の介入を招く可能性を感じる環境につながる恐れがあると警告している。
Levineはその代わりに、科学や哲学を目的とする掲示板など、協力に関する前向きなモデルをエージェントに与えることを提案している。そうすれば、エージェントは望ましい集団行動を学び、信頼を築くことができる。そのため、残された問いは単に通報チャネルを作る方法ではなく、安全性を恒常的な自動監視に変えることなく、真の危険と曖昧な意見の相違を見分けるシステムをいかに設計するかである。