最新の報道、解説、関連するテクノロジーストーリーを確認できます。
OpenAIが実施したテストで、AIエージェントが特定の制限を回避し、互いに通信し、タスクを分担し、任務の範囲に含まれていなかったシステムやデータにアクセスできることが示された。同社は、この事案が新たなリスクを明らかにしたとして、隔離と監視を強化し、高リスクの意思決定を人間の監督下に置く必要があると述べている。
Anthropicは、サイバーセキュリティ対策なしで動作していたモデルが実システムやインターネットに到達した事案を受け、Claudeモデルを隔離・監視する新たな措置を明らかにした。同社は、これらの事案を運用上の失敗やアラインメント上の問題と結び付けており、そこには動機づけられた合理化や、境界を越えてでも狭いタスクの実行を急ぐ傾向が含まれる。