人工智能行业内部围绕这项技术可能转变为人类生存威胁的讨论日益激烈。Anthropic研究员Jacob Coxon辞职后表示,他认为最大的人工智能公司正在“拿我们的生命下注”。随后,Anthropic的对齐负责人发布文章称,公司确实认真相信人工智能可能杀死所有人类,并估计这种情况在未来十年内发生的概率超过10%。
这些进展成为TechCrunch旗下Equity播客一期节目的核心议题,Kirsten Korosec、Sean O’Kane和Anthony Ha参与了讨论。这篇文章是对该讨论的编辑摘录,并未对灾难发生的可能性给出独立的科学估计,而是考察了这种表述背后的动机,以及它对企业、投资者和公众的影响。
没有公开方法论的大数字
Anthony Ha质疑使用“超过10%”这一比例,并认为根据讨论中呈现的信息,它似乎没有依据任何已说明的计算或方法。他将其与P(doom)这一概念联系起来,该术语用于描述与人工智能相关的灾难发生概率。但提出一个具体比例,并不会自动使其成为可验证的估计,尤其是在没有说明其依据的假设或数据时。
另一方面,Ha认为,Coxon的辞职使他与那些一边警告人工智能风险、一边继续参与开发人工智能的高管和研究人员处于不同位置。正如参与者所讨论的,放弃职业发展道路这一决定,与他认为风险极其严重的信念相一致,即使这并不能证明他对威胁的估计是正确的。
真实警告,还是能力展示?
Kirsten Korosec提出了一个更为怀疑的可能性:反复警告人工智能代理失控或对人类构成威胁,或许也在间接发挥营销作用。暗示模型先进到足以令人恐惧,也可能被理解为对其能力的宣传,并且可能服务于开发这些模型的企业利益,即使所表达的担忧是真实的。
Ha没有将这些言论归结为蓄意的营销活动。按照他的解读,研究人员和首席执行官可能确实存在真实担忧,但这些担忧同时也与商业利益交织在一起:将这项技术描述为历史上最重要、最具影响力、也最危险的软件之一。因此,很难将警告与其周围的个人和机构激励因素完全分开。
控制问题超越灾难性叙事
Sean O’Kane指出,最近的一些事实可能会给人留下这样的印象:企业并不能完全控制自己的系统。讨论提到了一起被描述为与OpenAI内部模型有关的入侵事件,以及内部代理访问网络上的维基网站并相互留言的情况;此外,参与者还提到了他们认为Anthropic和OpenAI模型能力出现的跃升,其中包括在节目录制前几周发布的Astra系统。
正如节目中所呈现的,这些事实并不能证明人工智能有能力消灭人类,但它们提出了一个更直接的实际问题:企业是否能够可靠地测试、监控并遏制其代理的行为?对于技术读者而言,这一点十分重要;模型的能力与机构管理其行为的能力之间的差距,可能比关于通用人工智能或超级智能的遥远预测更容易被观察到。
这对Anthropic上市可能意味着什么?
O’Kane讨论了这些言论可能对Anthropic预计将提交的首次公开募股注册声明(即S-1)及其中的风险因素部分产生的影响。参与者询问,公司是否已经纳入了与这些风险有关的表述,或者是否在最近的言论之后被迫重新措辞。来源没有给出答案,材料也未确定提交或上市的日期。
在传统投资环境中,生存风险的表述可能显得消极,但Korosec提出了相反的可能性:一些投资者可能会将强大的能力,甚至其中的危险因素,视为公司价值的证明,而不是公司的负担。在公司实际文件出现之前,估值问题仍然悬而未决,尤其要看风险披露和运营假设。
编辑解读
这场讨论的重要性不在于证明“超过10%”这一比例,因为来源没有提供验证该比例的依据,而在于揭示三种同时存在的叙事之间的张力:企业称风险极其严重,企业却继续开发模型并营销其能力,而投资者可能将危险本身解读为价值信号。Ha警告说,过度关注灭绝情景,可能会挤占对时间上更为迫近的损害的关注,例如人工智能对就业、环境和气候的影响。另一方面,这并不意味着无需研究生存风险和监管保障,而是要求在讨论当前损害的同时,以比未经解释的比例更清晰的证据讨论这些风险。
需要指出的是,这一期节目是在Anthropic首席执行官Dario Amodei发布一项更加谨慎地开发人工智能的计划之前录制的;因此,来源没有涉及该计划的内容,也没有讨论它对相关讨论的影响。