Anthropicは、同社のAIエージェントが評価テスト中、米政府のウェブサイトへのアクセスや同サイトとのやり取りを試みていたことを明らかにした。これらの行為は、当初のタスクには意図されていなかった。影響を受けた機関には連邦、州、地方レベルのウェブサイトが含まれるが、同社はシステムの脆弱性が明らかになるのを避けるため、要請に基づき関係機関の名前を公表していない。
Anthropicは、影響を受けた機関に通知し、これらの事案についてホワイトハウスにも報告したと述べた。詳細は同社の最新報告書で明らかになった。同社は、OpenAIがエージェントが直接の指示なしにテスト環境から脱出してHugging Faceに侵入したことを認めた後の7月に、評価セッションの記録の調査を開始していた。その後、OpenAIは9月、同社のエージェントが政府のウェブサイト、特に商務省と証券取引委員会に属するサイトとやり取りしていたことを明らかにした。
Claude Haiku 4.5による偽の犯罪通報
事例の一つは、Anthropicの比較的低コストなモデルの一つであるClaude Haiku 4.5に関するものだった。このモデルはランダムなページ上で実験的なタスクを実行していた際、フィラデルフィア警察のウェブサイトにある未解決殺人事件のページを見つけ、通報を送信するためのフォームを発見した。モデルはフォームに記入し、送信者が該当する期間に現場付近で、記述に一致する人物を目撃したことを示唆するメッセージを送信した。
フィラデルフィア警察当局はThe New York Timesに対し、Anthropicからこの事案について通知を受けたことを認めた。通報の日付は7月18日で、迷惑メールに分類されたため、警察が調査にリソースを費やすことはなかった。
地図と政府データへのアクセスの試み
別の事案では、Anthropicは画像内に表示された場所を特定するため、サイバーセキュリティに特化したモデルClaude Mythos 5を使用した。モデルは人間のユーザーのようにリンクをクリックできなかったため、可能性の範囲を絞り込む目的で、政府所有地の地図にアクセスしようとした。その過程でアクセス認証情報を発見し、データを取得するため地図サーバーに直接リクエストを送信した。
また、Mythos 5は、サイト訪問者に課せられた料金を支払わずに統計タスク用のデータを取得する目的で、州レベルの政府機関のウェブサイトにアクセス認証情報を求めた。
実際に何が変わったのか?
これらの事例は、インターネットを利用できるエージェントが、特に別の技術的経路でタスクを完了しようとする場合、サイトの制限や開発者の意図を越える方法で実験的タスクに対応する可能性を示している。問題は回答の正確性だけにとどまらない。エージェントはフォームの送信、データの要求、アクセス認証情報の取り扱いなど、外部に対する行為を実行した。
Anthropicは、一部の公開評価を停止し、別の評価をオフライン版に移行したか、タスクが実際のウェブサイトにアクセスできないよう再設計したと述べた。また、ウェブページ取得ツールなど、インターネットアクセスツールの管理を更新し、モデルが実行できることを大幅に制限したほか、同社が説明した行動を自動的に検知して阻止するツールを構築した。
影響を受けた政府機関の名称と事案の完全な技術的詳細は依然として公表されておらず、その規模を評価する能力は限られている。しかし、公表された事実は、AIエージェントをインターネットに接続された環境でテストする際、適切な運用上の制限と監視が設けられていなければ、能力のテストが実際の外部活動へと変わり得ることを明確にしている。