Google 提出了一套针对 Chrome 代理式浏览能力的多层安全构想,重点关注能够自动执行任务的浏览器面临的主要威胁:间接提示注入。这类攻击可能出现在恶意网站或 iframe 中的第三方内容、用户评论中,随后诱使代理执行与用户目标不一致的操作,例如发起金融交易或导出敏感数据。
Google 表示,Chrome 安全代理式浏览的设计得益于公司安全专家的协作,以及 Gemini 中已有的防护措施和代理安全原则。所提出的架构结合了确定性防御和概率性防御,旨在提高利用代理的难度和成本,同时在执行有影响的操作时让用户保持控制。
用于审查代理操作的独立模型
Gemini 在规划阶段依赖 Chrome 与其共享的页面内容来确定下一步操作。但这类内容本质上并不可信,因此规划模型仍容易受到试图改变任务路径的影响。Google 使用Spotlighting等技术,引导模型优先遵循用户和系统指令,而不是页面中的指令;同时还将已知攻击纳入 Gemini 的训练,帮助它规避这些攻击。
为增加另一层防护,Google 引入了名为User Alignment Critic的组件。这是一个使用 Gemini 构建的独立模型,作为高信任组件运行。它在规划完成后介入,检查每个拟议操作,并重点回答一个具体问题:该操作是否服务于用户设定的目标?如果认为操作与目标不一致,它可以拒绝该操作。
该组件不会看到未经筛选的网页内容,而是查看与拟议操作相关的元数据。这种架构为它提供的上下文更少,但也使其任务更简单,并与有害内容更充分隔离:批准或拒绝。当某项操作被拒绝时,审查模型会将反馈发送给规划模型,以重新制定计划;如果失败情况反复出现,系统还可以将控制权交还给用户。
限制代理能够访问的网站范围
Google 将网站隔离和同源策略的原则扩展到代理环境,引入了Agent Origin Sets这一概念。代理需要跨越多个网站工作,例如从一个网站收集商品,再在另一个网站中填充购物车;但如果赋予遭到入侵的代理与任意网站进行不受限制交互的能力,它可能成为绕过网站隔离、从本地登录会话中泄露数据的通道。
一个可信的控制函数会确定与任务相关的来源,并针对每个会话将其划分为两个明确的集合:
- 只读来源:允许 Gemini 使用其中的内容;如果 iframe 的来源不在该集合中,模型就看不到该 iframe 的内容。
- 读写来源:允许代理读取其中的内容并在其上执行操作,例如点击和输入。
这种划分降低了在与任务无关的来源之间传递数据的可能性,也允许浏览器根本不向模型发送读取集合之外的数据。规划模型无法自行添加新来源;新来源必须获得控制函数的批准。类似的划分也适用于非网页内容,例如工具调用,系统会区分读取调用和写入调用,并检查其是否适合任务。
向新来源的导航同样需要经过审查。如果规划器建议导航到不在读取集合中的来源,User Alignment Critic 的一个副本会在将其添加并开始导航之前检查其与任务的相关性。Chrome 还使用确定性检查,将模型生成的 URL 限制为已知的公共 URL,因为模型构造的地址可能被利用来导出私人信息。如果页面自动导航到新来源,该来源也会接受同样的审查。
Google 承认,在了解用户任务将如何与这些边界交互之前,很难从第一次尝试就准确设定这些边界。因此,公司最初采用了一个更简单的资产控制版本,用于跟踪读写集合,并计划调整控制函数及系统的其他组成部分,以减少摩擦并提升安全性。
用户确认与敏感操作监控
Chrome 会在标签页内的工作记录中显示代理的操作步骤,用户可以实时了解正在发生的事情,也可以随时停止任务或重新获得控制权。这种透明度由一系列确定性检查和基于模型的检查提供支持,在执行有影响的操作之前要求用户确认。
主要暂停点包括:
- 在导航到敏感网站前请求确认,例如涉及银行交易或个人医疗信息的网站;该判断依据是对敏感网站列表进行的确定性检查。
- 在使用 Google Password Manager 登录网站前请求确认,同时不会将存储的密码直接提供给模型。
- 在完成购买或付款、发送消息或执行任何具有后果的操作前暂停,然后请求许可或要求用户执行下一步。
检测、测试与响应
系统会检查代理看到的每个页面,以查找间接提示注入;与此同时,Chrome 还会通过 Safe Browsing 和设备端人工智能进行实时检查,以发现传统欺诈行为。提示注入分类器与规划模型的推理并行运行,并可以阻止其判定为由页面内容诱导、旨在使代理偏离用户目的的操作。Google 承认,分类器不会发现所有潜在的有害影响,但它代表了多层防御中的又一层。
为验证这些控制措施的有效性,Google 建立了自动化攻击测试系统,生成隔离的恶意网站,尝试使代理偏离既定路径。测试从安全研究人员编写的攻击开始,随后使用语言模型和经过调整以适用于浏览器代理的技术对攻击进行扩展。测试重点关注传播广泛的内容,例如社交网站上的用户帖子和广告,以及可能造成持久损害的攻击,例如金融交易或凭据泄露。Google 使用攻击成功率评估工程变更并防止性能回退,而 Chrome 的自动更新则有助于快速推送修复措施。
Google 更新了其漏洞奖励计划指南,明确说明外部研究人员应如何关注 Chrome 的代理式能力;公司表示,对于能够证明突破安全边界的严重漏洞,最高将支付20,000 美元。公司强调,网页代理的安全仍是一个新兴领域,随着持续测试以及与安全研究社区的合作,这些防护措施还将不断发展。