OpenAI在GitHub上发布了一个包含722篇数学研究的集合,这些研究由公司尚未向公众开放的内部人工智能模型生成。根据独立的数学与人工智能咨询组(Advisory Group on Mathematics and Artificial Intelligence,AGMAI)的评估,该集合涵盖372个结果家族,其中包括尝试解决一些长期悬而未决问题的成果。
但发布这些成果并不意味着它们已被认可为最终的数学成就。OpenAI说明,这些结果处于不同的验证阶段,一些非正式研究可能包含错误,所有研究都需要数学界审查,并通过通常的学术渠道加以确认。
从约4000个问题到722篇研究
在评估过程中,该模型测试了约4000个数学问题。OpenAI根据重要性水平筛选结果后,选出了此次发布的集合,其中包括372个家族和722篇研究。该公司表示,生成单项结果平均需要相当于ChatGPT Pro用户可用推理能力约三小时的计算能力。
为增强可审查性,OpenAI还发布了10个问题的额外数据,包括推理路径的简要摘要、所用计算能力的估算值,以及尝试解决的问题数量。这些示例分布在不同领域,包括π的无理性度量、Mahler猜想、关于直接有限性的Kaplansky猜想,以及三维相对论Vlasov-Maxwell系统。
使用Lean的验证并不全面
一部分重要的已发布证明接受了Lean审查。Lean是一种数学验证系统,允许计算机测试证明的逻辑一致性。不过,目前该集合中的所有研究都尚未通过Lean进行正式验证。
OpenAI计划在正式验证流程完成后更新GitHub存储库。该公司表示,大多数结果都是按照统一流程生成的,但也存在例外:其中一项与黎曼ζ函数零点无区域有关的研究通过不同方式获得,其文本还经过人工编辑,以提升可读性。
为什么这条消息重要?
该集合的核心价值不仅在于研究数量,还在于测试一种生成可供审查的数学结果的新方法。开放文件、计算成本数据、推理摘要以及部分自动验证,为研究人员评估模型究竟是在产生可复核的发现,还是仅仅生成看似可信的文本,提供了所需要素。
与此同时,限制仍然十分明显:验证尚未完成,人工和学术审查也尚未结束,而且模型的结果目前还不代表一个可供研究人员使用的系统或一款面向公众的产品。AGMAI呼吁人工智能公司通过学术渠道发布数学成果,披露所使用的模型、成本和方法,并避免将发现单纯转化为营销工具。
OpenAI还宣布,将资助研讨会、会议和专项项目,以理解人工智能生成的重要成果,同时继续努力以负责任的方式开放内部模型。因此,目前的集合代表了探索如何记录机器生成科学成果的一步,而不是对该模型数学能力的最终判断。