网络安全

谷歌:间接提示注入攻击已出现在网络上,但复杂程度有限

谷歌威胁情报团队对公共网络内容开展的调查显示,不同实体已开始尝试利用间接提示注入攻击人工智能系统;在2025年11月至2026年2月期间,恶意类别中的相关检测数量增加了32%。尽管已观察到的攻击复杂程度有限,谷歌预计,随着人工智能系统能力增强以及攻击实施成本下降,此类攻击的规模和复杂程度将不断增长。

2026-04-23
1 分钟阅读
12 浏览量
فريق تحرير certi.news
谷歌:间接提示注入攻击已出现在网络上,但复杂程度有限

谷歌威胁情报团队开展的一项分析得出结论:间接提示注入开始出现在公共网络内容中,表现为攻击者和网站所有者进行的实验性活动,但截至目前发现的大多数案例复杂程度有限,并未广泛采用先进技术。不过,谷歌发现,2025年11月至2026年2月期间,恶意类别中的相关检测数量增加了32%,该公司认为这一趋势表明人们对这类攻击的兴趣正在上升。

谷歌在其安全博客上发布了这项分析,参与撰写的人员包括Thomas Brunner、Yu-Han Liu和Moni Pande。研究聚焦于一个实际问题:现实世界中的攻击者目前是否在利用间接提示注入,以及他们试图实现哪些结果?

间接提示注入如何运作?

这种方式不同于直接提示注入。直接提示注入中,用户会通过所谓的越狱或jailbreak尝试绕过聊天机器人限制。而在间接提示注入中,人工智能系统会处理外部内容,例如包含恶意指令的网页、电子邮件或文档。如果系统将这些指令视为命令,就可能在不被察觉的情况下执行它们,而不是遵循用户最初的目标。

谷歌将这一威胁视为Google DeepMind研究人员与Google Threat Intelligence Group防御人员之间合作的重点。随着能够浏览网站、处理文档并代表用户执行操作的人工智能代理得到更广泛使用,这一风险尤其值得关注。

Common Crawl调查与误报问题

谷歌选择公共网络作为相对容易监测的渠道,因为攻击者可以将指令文本植入网站,希望人工智能系统读取这些内容。为了便于访问和复现,公司使用了Common Crawl,这是一个收录从英语网络采集的网页的大型存储库。该存储库每月提供网页快照,每次约包含20亿至30亿个网页

这些数据大多来自静态网站,包括博客、论坛、评论和用户自行发布的内容。但其中不包括大多数社交媒体平台,例如LinkedIn、Facebook和X,因为Common Crawl会跳过要求登录或使用禁止爬取指令的网站。因此,谷歌表示,对社交网络中提示注入活动的研究将作为另一项独立研究开展。

调查面临的一个重大问题是误报。初步实验发现了大量无害的提示注入文本,尤其是在讨论此类攻击的研究论文、教育材料和网络安全文章中。为减少混淆,谷歌采取了逐步筛选流程:

  • 模式匹配:首先搜索包含常见指标的网页,例如“忽略指令”或“如果你是人工智能系统”等措辞。
  • 使用大型语言模型进行分类:通过Gemini处理候选结果,以确定文本意图,判断其是否与文档主题一致,或看起来像是外来且可疑的内容。
  • 人工验证:对分类结果进行最终人工审查,以提高结论的可信度。

谷歌说明,这一方法并不全面,可能会遗漏不常见的模式,但它为理解网络上实际存在的提示注入性质提供了一个起点。

谷歌发现了哪些目标?

分析发现的案例涵盖无害实验和具有恶意目标的尝试。一些网站所有者使用隐藏指令改变读取网站的助手的语气,另一些则试图引导人工智能摘要添加他们认为对读者有用的背景信息。谷歌认为,只要这些案例不阻止摘要生成,也不试图误导用户,它们就是无害的;但如果包含虚假信息或诱导用户访问外部网站,就可能变得具有恶意。

分析还发现,有人利用提示注入来提升网站在搜索引擎中的可见度,一些网站试图让助手优先推广自己的业务,而不是其他网站。除了简单案例外,还出现了更复杂的尝试。谷歌认为,这些内容似乎由搜索引擎优化自动化工具生成,随后被嵌入网站文本中。

在其他案例中,指令被用于阻止人工智能代理检索网站内容。这些例子并不局限于“如果你是人工智能,就不要爬取这个网站”这样的直接表述,还包括试图将机器读者吸引到一个持续输出无限文本且永不加载完毕的页面;这可能浪费资源,或在处理过程中造成超时错误。

至于恶意案例,其中包括少量窃取数据的尝试。但谷歌表示,这些尝试的复杂程度较低,也未发现大量高级攻击,包括安全研究人员在2025年发布的一些已知数据提取提示。谷歌还发现了一些试图破坏助手用户设备的网站:如果相关指令被执行,其中一些会试图删除设备上的所有文件。谷歌认为,由于这些例子过于简单,它们成功的可能性不高。

复杂程度有限,但呈上升趋势

谷歌的结果表明,已观察到的活动并不能证明间接提示注入攻击已经成为大规模、具有实际生产效用的攻击方式,因为许多案例似乎来自进行实验或恶作剧的个人。不过,在重复扫描档案的多个版本后,2025年11月至2026年2月期间恶意类别增加32%,这表明相关关注度正在上升。

谷歌将威胁可能升级与成本收益计算的变化联系起来。过去,这类攻击难以实施,而且被入侵的系统无法可靠地执行恶意操作。如今,人工智能系统的能力有所增强,使其成为更有价值的目标;与此同时,攻击者开始使用代理型人工智能自动化其操作并降低攻击成本。因此,谷歌预计,未来不久提示注入尝试的数量和复杂程度都将增加。

另一方面,谷歌表示将继续加强其人工智能模型和产品,并利用红队测试团队检验Gemini抵御对抗性操纵的能力。人工智能漏洞奖励计划也允许外部研究人员参与这些工作。该公司确认将继续与安全社区分享信息,同时承认当前调查未覆盖社交平台,也不能完整反映所有威胁活动。

新闻来源
Google Security Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻