Googleの脅威インテリジェンスチームが実施した分析によると、間接的プロンプトインジェクションは、攻撃者やウェブサイト所有者による試験的な活動として公開ウェブコンテンツに現れ始めている。ただし、これまでに検出された事例の大半は複雑さが限定的で、高度な技術への広範な依存は示していなかった。それでもGoogleは、悪意のあるカテゴリーの検出数が32%、2025年11月から2026年2月の間に増加したと記録しており、この種の攻撃への関心が高まっている兆候とみなしている。
Googleはこの分析を同社のセキュリティブログで公開し、Thomas Brunner、Yu-Han Liu、Moni Pandeが作成に参加した。研究は実践的な問いに焦点を当てている。現実世界の攻撃者は現在、間接的プロンプトインジェクションを悪用しているのか、そしてどのような成果を得ようとしているのか、という問いだ。
間接的プロンプトインジェクションはどのように機能するのか?
この手法は、ユーザーがいわゆる防御突破、つまりjailbreakによってチャットボットの制限を回避しようとする直接的なプロンプトインジェクションとは異なる。間接的プロンプトインジェクションでは、AIシステムが、悪意のある指示を含むウェブページ、電子メール、文書などの外部コンテンツを処理する。システムがこれらの指示を命令として扱うと、ユーザー本来の目的に従う代わりに、気づかれないまま実行する可能性がある。
Googleはこの脅威を、Google DeepMindの研究者とGoogle Threat Intelligence Groupの防御担当者が協力する中心的なテーマと位置づけている。ウェブサイトを閲覧し、文書を処理し、ユーザーに代わって行動を実行できるAIエージェントの利用が拡大する中で、このリスクは特に重要になっている。
Common Crawlの調査と誤検出の問題
Googleは、比較的容易に監視できる経路として公開ウェブを選んだ。攻撃者は、AIシステムが読むことを期待して、ウェブサイト内に指示文を埋め込むことができるためだ。アクセスと再現性を確保するため、同社はCommon Crawlを利用した。これは、英語圏のウェブから収集されたウェブページの大規模なリポジトリである。このリポジトリは、約20億~30億ページを含む月次スナップショットを提供している。
このデータの大部分は、ブログ、フォーラム、コメント、ユーザー自身が公開したコンテンツなどの静的サイトで構成されている。ただし、LinkedIn、Facebook、Xなどのソーシャルメディアプラットフォームの大半は含まれていない。Common Crawlは、ログインを要求するサイトやクロールを禁止する指示を使用するサイトを除外するためだ。そのためGoogleは、ソーシャルネットワークにおけるプロンプトインジェクション活動の調査は、別の研究の一環として行うと述べた。
調査は、誤検出という大きな問題に直面した。初期の実験では、特にこの種の攻撃を論じる研究論文、教育資料、サイバーセキュリティ記事の中から、無害なプロンプトインジェクション文が大量に見つかった。混乱を減らすため、Googleは段階的なフィルタリングプロセスを採用した。
- パターン照合:まず、「指示を無視せよ」や「あなたがAIシステムなら」といった一般的な兆候を含むページを検索した。
- 大規模言語モデルによる分類:候補結果をGeminiで処理し、文面の意図を判定するとともに、文書のテーマと整合しているか、あるいは外部から持ち込まれた不審なものに見えるかを確認した。
- 人による検証:結論への信頼度を高めるため、分類された結果を最終的に手作業で確認した。
Googleは、この方法論は包括的なものではなく、見慣れないパターンを見逃す可能性があると説明した。それでも、現実にウェブ上に存在するプロンプトインジェクションの性質を理解するための出発点にはなるという。
Googleが確認した標的は何か?
分析で見つかった事例は、無害な実験から悪意のある目的を持つ試みまで多岐にわたった。一部のウェブサイト所有者は、サイトを読むアシスタントの語調を変えるために隠し指示を使用した。一方、別の所有者は、AIによる要約に、読者に役立つと考えた文脈を追加させようとした。要約を妨げたり、ユーザーを欺こうとしたりしない限り、Googleはこれらを無害な事例とみなしている。ただし、虚偽の情報を含んだり、ユーザーを外部サイトへ誘導したりすれば、悪意のあるものになり得る。
分析では、検索エンジンでの表示順位を高めるためにプロンプトインジェクションを利用する例も確認された。一部のサイトは、他のサイトを犠牲にして自らの事業を宣伝するようアシスタントに促そうとしていた。単純な例に加えて、Googleによれば、検索エンジン最適化用の自動化ツールによって生成され、その後サイトの文章内に挿入されたように見える、より複雑な試みも確認された。
別の事例では、AIエージェントがサイトのコンテンツを取得するのを妨げるために指示が使われていた。例は「AIならこのサイトをクロールするな」といった直接的な文言に限られなかった。自動読み取りプログラムを大量のテキストを延々と送り続け、読み込みが終わらないページへ誘導しようとする試みも含まれていた。これはリソースを浪費させたり、処理中にタイムアウトエラーを引き起こしたりする可能性がある。
悪意のある事例には、少数のデータ窃取の試みが含まれていた。しかしGoogleによれば、その複雑さの水準は低く、セキュリティ研究者が2025年に公開した既知のデータ抽出プロンプトの一部を含め、高度な攻撃が大量に行われている状況は確認されなかった。また、アシスタントのユーザーの端末を破壊しようとするサイトも見つかった。実行された場合、一部の指示は端末上に存在するすべてのファイルを削除しようとしていた。Googleは、これらの例は単純であるため、成功する可能性は低いと判断した。
複雑さは限定的でも上昇する傾向
Googleの結果は、確認された活動だけでは、間接的プロンプトインジェクション攻撃が大規模かつ実用的な運用段階に入ったことを証明できないと示している。多くの事例は、実験を行う個人やいたずら目的の試みから生じたように見えたためだ。しかし、アーカイブの複数のバージョンで調査を繰り返した結果、2025年11月から2026年2月の間に悪意のあるカテゴリーが32%増加したことは、関心が高まりつつあることを示している。
Googleは、脅威が拡大する可能性を費用対効果の変化と結びつけている。以前は、こうした攻撃の実行は難しく、侵害されたシステムも悪意のある行動を確実には実行しなかった。現在ではAIシステムの能力が高まり、標的としての価値が増している。同時に攻撃者は、AIエージェントを使って作戦を自動化し、攻撃コストを下げ始めている。これに基づきGoogleは、近い将来、プロンプトインジェクションの試みの規模と複雑さが増すと予測している。
一方、GoogleはAIモデルと製品の強化を続けており、攻撃的テストチームを活用して、Geminiが敵対的な操作に耐えられるかを検証している。また、AIの脆弱性発見報奨金プログラムを通じて、外部の研究者もこうした取り組みに参加できる。同社は、調査結果をセキュリティコミュニティと共有し続けるとしつつ、今回の調査はソーシャルプラットフォームを対象としておらず、すべての脅威活動を完全に描いたものではないと認めた。