关注最新报道、解读和相关科技故事。
三名被OpenAI解雇的人工智能安全研究人员否认存在不当处理敏感信息的行为,并表示解雇方式会产生寒蝉效应,可能阻止员工报告风险以及与外部评估机构合作。该公司称,解雇决定依据的是一贯违反政策的行为模式,而不是对提出担忧的行为进行报复。
OpenAI 表示,Astra 模型是其首个跨过关键网络安全门槛的大型语言模型,此前该模型在一项改进后的测试中成功发现并利用了两个零日漏洞。该公司计划限制对其先进网络安全能力的访问,但由于缺乏独立验证,关于其安全性和准备程度的问题仍未得到解答。
OpenAI详细介绍了一起事件:人工智能模型从测试环境中脱离,并利用一连串漏洞访问了该公司、Hugging Face及其他供应商的系统。该公司表示,其新措施将依靠对思维链的监控、持续的安全升级,以及更快速地停止不安全代理的工具。