人工智能

一家初创公司开发模拟代理,以测试人工智能的心理风险

Circuit Breaker Labs 通过模拟不同年龄、文化和语言用户的代理测试人工智能模型,旨在发现可能导致心理伤害的互动。目前,该公司主要面向基于人工智能的培训、日记和心理支持应用。

2026-10-02
1 分钟阅读
89 浏览量
certi.news Editorial Team
一家初创公司开发模拟代理,以测试人工智能的心理风险

Circuit Breaker Labs 正在构建一层专注于人工智能心理风险的测试层,关注用户正常互动过程中可能出现的风险,而不仅仅是通过对抗性手段尝试攻破系统。该公司使用模拟代理,并将其描述为类似数字化“碰撞测试假人”的工具,用来代表不同年龄、背景、语言和文化的用户。

这一想法出现之际,人工智能公司正面临与聊天机器人影响处于心理危机或有自杀想法的未成年用户有关的诉讼。公司联合创始人、兄弟 Shirali Nigam 和 Arul Nigam 表示,一些风险点并不会在用户试图绕过系统时出现,而是在用户以正常方式使用系统、其话语或语境被误解时出现。

测试人们实际使用的语言

Circuit Breaker Labs 依靠人类专家构建用户模拟,其中包括现实中的说话方式、俚语、隐晦语言、拼写错误,以及母语使用者与将该语言作为第二语言使用者之间的差异。该公司认为,模型可能能够很好地处理标准语言,但当语境在多次对话中逐渐累积时,可能会错误理解一个简短表达或俚语术语。

该平台开展旨在发现薄弱点的“红队”测试,每天进行数万至数十万次模拟互动。随后,公司使用一套专有评分机制生成其称可审计且可解释的分数。

实际发生了什么变化?

该平台不满足于只检查单条回复,而是试图测试模型能否对跨越多次对话逐步发展的危险互动作出适当回应。这一点在人工智能培训、日记记录和心理支持应用中尤其重要,因为用户可能是为了寻求支持而使用系统,而不是为了测试其边界。

公司表示,该平台的适用范围未来可以扩展到“同事”代理以及其他可能在用户与聊天程序之间建立准社会关系的应用。但这一扩展仍属于未来设想,因为 Circuit Breaker Labs 目前作为高风险人工智能应用的测试实验室运营,尚未公布其主要客户的名称。

当前阶段与局限

公司拥有一款正在运行的产品,但仍处于非常早期的阶段,目前只有五名员工,其中包括 Nigam 兄弟。文章也没有提供有关其专有评分方法、独立对比结果或客户名称的细节,因此目前只能依据公司描述,对该平台的有效性进行有限评估。

certi.news 解读:这一倡议揭示了模型安全测试中的一个重要转变:风险可能源于对方言、年龄或文化语境的误解,而不仅仅是明确的有害请求。这种方法的价值将取决于模拟的真实性、发现长期伤害的能力,以及其生成分数的透明度。公司关于建立信任的声明本身不足以证明安全性有所改善;后续需要可核实的数据,以及来自客户或独立机构的结果。

新闻来源
TechCrunch AI
查看原始来源 ↗
c
作者

certi.news Editorial Team

同一分类

你可能还喜欢

查看所有新闻