Anthropic呼吁各国政府更新政策,以跟上人工智能能力快速发展的步伐,具体提出两项建议,分别涵盖先进模型治理,以及为技术对劳动者和经济的影响做好准备。该公司认为,模型发展的速度意味着仅靠透明度已不足够,政府机构需要拥有更大的权力来应对可能带来灾难性风险的部署行动,同时应设置保障措施,防止这些权力遭到滥用。
第一项建议是先进人工智能框架,重点关注能力更强的模型及其可能产生的风险。第二项建议是经济框架,涉及如何让劳动者和经济为人工智能的影响做好准备,并确保其经济收益得到广泛分享。Anthropic表示,这两项框架处理的是同一项挑战的两个方面:随着技术进步,以负责任的方式引导技术发展,并为其将给社会带来的变化做好准备。
拟议规则的适用范围
先进框架建议将规则适用于使用超过1025次浮点运算进行训练的模型,以及人工智能相关收入超过5亿美元,或在该领域研发投入超过10亿美元的公司。Anthropic表示,这一范围针对的是前沿模型,而不是对所有人工智能系统施加相同要求。
该公司将这类监管的必要性与模型能力急剧上升的趋势联系起来。Anthropic称,几年前的模型几乎只能编写代码,而Claude Mythos Preview模型据Anthropic披露发现了数千个高风险软件漏洞,其中包括每个主要操作系统和浏览器中的漏洞。该公司由此得出结论,若这一趋势持续,灾难性危害的风险可能会增加。
四类风险
该框架重点关注四个主要风险领域:
- 生物风险:未经保护的系统可能使生物武器的开发变得更容易、成本更低,尽管相同的能力也可能加快药物发现。
- 网络风险:先进人工智能模型能够大规模发现关键漏洞,这可能有助于防御系统,但也会提高对医院和能源网络等关键基础设施的威胁程度。
- 失控风险:随着系统能力增强,控制那些在其开发者控制范围之外行动的系统可能会变得更加困难。
- 自动化研发:系统可以将人工智能研究与开发自动化,这可能会放大前三类风险。
先进模型开发者的要求
Anthropic建议,先进模型开发者应测试其系统并发布结果摘要,同时制定安全框架,说明如何评估灾难性风险,并发布系统卡片,解释模型的能力及其风险。该框架还呼吁定期发布总体风险状况报告,并定期开展独立评估。该公司指出,加利福尼亚州和纽约州的法律已经规定了一些透明度要求,但认为其提案在部分方面超越了这些要求。
根据该提案,每一家先进模型开发者都应至少聘请一名合格的独立评估员,由该评估员发布对公司评估及风险报告的审查结果。Anthropic还呼吁政府和科技行业通过制定评估员标准、提供资金,并为其提供充分的模型访问权限,来发展独立评估员体系。
该框架还包括保护模型权重和训练所用基础设施的安全要求,因为这些都是攻击者,包括资源雄厚的政府机构,眼中的有价值目标。该公司建议保护整个开发环境,使其免受外部和内部威胁;以较高层次向公众说明安全计划;在政府特定机构提出要求时提供详细信息;建立报告模型仿冒攻击的渠道;并定期测试防御措施。
受约束的政府权力
Anthropic认为,政府应拥有法律能力,阻止或遏制那些对造成灾难性危害构成重大风险的模型部署,并处以与全球年度收入挂钩、且在违规重复发生时逐步提高的民事处罚。但与此同时,该公司警告不要赋予政府过于宽泛或沉重的监管权力,并建议建立具体机制,以阻止危险部署,同时设置切实可行的保障措施,限制这项权力遭到滥用。
该框架主要面向美国联邦政府,但并不主张废除州法律,除非联邦通过的法律至少与该提案同等有力。Anthropic表示,废除州政府权力的范围应受到限制,使各州仍能监管儿童安全和消费者保护等问题,只要这些问题不属于联邦法律所涵盖的具体安全职能。
增强社会韧性
框架的第二部分提出了提高社会应对风险能力的措施。在生物领域,建议包括对基因合成进行筛查,通过早期预警系统监测新出现的疫情,并通过储备防护设备和减少空气传播的手段做好准备。
在网络领域,Anthropic呼吁加强互联网所依赖的软件,为关键基础设施运营商提供技术支持,并替换其中使用的老旧系统。该公司还建议设立专门的政府职能,跟踪先进模型的网络能力,并由政府与科技行业合作开发保护手段,使网络能力能够得到广泛共享。
该公司承认,针对失控风险和自动化研发风险的韧性议程仍不够成熟,需要整个行业进一步开展工作。其提到的发展方向包括:开发能够发现并应对在其开发者控制之外行动的系统的能力,以及建设用于遏制或停止这些系统的基础设施。
Anthropic预计其提案将引发广泛讨论,但敦促政策制定者立即参与这些问题,因为未来几个月人工智能能力仍将持续提升。该公司强调,技术治理应跟上这一发展,同时指出目前提出的建议仍处于讨论和评估之中。