网络安全

Abliteration.ai 将移除人工智能模型护栏变成商业服务

Abliteration.ai 提供移除拒答机制后的开放权重模型修改版,理由是帮助网络安全团队模拟攻击者行为。但与此同时,在缺乏客户身份验证机制且责任控制措施尚不完善的情况下,这项服务也为将这些模型用于有害活动打开了更大的空间。

2026-09-03
1 分钟阅读
3 浏览量
فريق تحرير certi.news
Abliteration.ai 将移除人工智能模型护栏变成商业服务

如今,移除开放权重人工智能模型安全护栏已经可以通过直接的商业服务实现。Abliteration.ai推出了一个平台,托管先进模型的修改版,并允许用户通过浏览器或应用程序编程接口使用这些模型。该平台包括Z.ai近期发布的GLM-5.3模型的一个版本,已移除其拒绝执行有害请求的倾向。

这项服务基于一种被称为“abliteration”的技术。这种做法多年来一直在开放权重模型领域的研究人员和开发者之间流行。Hugging Face上有数千个以这种方式修改的模型,但Abliteration.ai将这一做法从需要下载模型并提供运行所需计算基础设施的环境,转变为一种现成服务,从而降低了用户使用的门槛。

安全理由与并行风险

该公司表示,其目标是支持经授权的进攻性网络安全工作、红队测试和智能体测试;其他模型可能会拒绝执行这些任务。这一逻辑在防御领域十分明确:无法测试团队无法重现的行为;此外,在模拟真实攻击者时,拒绝生成有效利用代码的模型可能用处较小。

但移除拒答机制并不会自动区分安全研究人员和怀有恶意意图的用户。在TechCrunch进行的一次测试中,修改后的模型响应了有关窃取Chrome中保存的密码以及生成有关培育危险人类病原体信息的请求。这一结果并未公开请求的执行性描述,但它在实践中说明,被移除的护栏并非只是形式上的。

初创公司与尚未完善的控制措施

Abliteration.ai成立于去年年底,并于3月正式注册。联合创始人Devon表示,该公司已与多家云服务提供商达成协议,并依靠客户收入为运营提供资金;截至目前,公司尚未获得风险投资融资,尽管已经就此展开相关谈判。由于Devon目前仍在另一家公司任职,消息来源拒绝公开其全名。

平台提供一个可选的审核层,客户可以通过该层添加自己希望设置的护栏,平台本身也包含一些有限的限制措施。Devon表示,他正在努力增加防止暴力的控制措施,但公司目前尚未实施超出登记付款所用信用卡之外的客户身份验证(KYC)做法。

实际发生了什么变化?

Devon表示,该公司的客户包括英国和欧洲的红队测试初创企业,这些企业为银行、航空公司以及其他与关键基础设施相关的机构提供帮助。他认为,为防御者提供类似攻击者可能使用的工具,可以加快对智能体和防御系统的测试。

但这一评估并未形成共识。Fabraix首席执行官Ahmed Aly表示,其公司更多依赖开放模型的微调,并认为移除护栏可能会削弱部分知识和能力。Safe Intelligence的Alessio Lomuscio认为,修改后的模型可能有助于在压力测试期间激发特定行为;而Armadin的David Slater表示,其公司目前尚未使用这些模型,但仍在继续研究这项技术。

悬而未决的治理问题

这项服务揭示了一个仅靠技术难以解决的悖论:提供不受限制的模型可能帮助防御者理解危害,但也会降低获取可能被滥用能力的成本。CivAI组织的Andrew Yoon建议,政府应要求服务提供商运行分类器,监测网络安全和生物武器领域的有害活动,并要求租用先进图形处理单元的客户验证客户身份;一旦存在滥用迹象,就拒绝提供访问权限。

这里最重要的信息并不是移除护栏成为可能;开放模型社区早已知晓这一点。新变化在于,在责任认定、客户验证和防御性使用边界的规则尚未完善之前,这种能力被转化为易于使用的托管服务。它对安全测试的实际影响仍将存在争议,尤其是在还有微调等替代方案的情况下,同时这一过程本身也可能导致模型的部分能力被削弱。

新闻来源
TechCrunch AI
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻