人工智能

为什么 Preferred Networks 从零开发 PLaMo 模型?主权与透明度优先于性能竞赛

Preferred Networks认为,从零开发人工智能模型能够让其更好地控制设计、数据和结果的可解释性,同时提高日语处理效率。另一方面,该公司也承认,这种方式成本更高,在某些情况下,使用开放模型或结合两种方式可能更为合适。

2026-08-17
1 分钟阅读
18 浏览量
certi.news
为什么 Preferred Networks 从零开发 PLaMo 模型?主权与透明度优先于性能竞赛

日本公司Preferred Networks(PFN)将从零开发其语言模型PLaMo视为一种掌控模型构建过程中关键决策的手段,而不仅仅是试图在性能指标上与美国和中国模型竞争。根据公司大型语言模型开发部门负责人田中大辅的说法,这种方法的重要性在于,PFN从一开始就直接参与确定设计、数据和处理机制。

上述内容来自对田中大辅以及大型语言模型规划部门负责人、PreferredAI负责人ムジビヤ・アディヤン的采访,采访围绕将人工智能模型称为“本地模型”的界限展开。这个术语没有统一定义;一些公司依赖由外部机构开发的开放模型,然后针对日语或特定领域进行追加训练,而PFN则选择按照“完全从零开发”(Full Scratch)的方式构建PLaMo。

控制数据可提高可解释性

PFN认为,自主开发与更清晰地向客户承担责任的能力有关。在许多开放模型中,能够获得的信息只有一部分,例如影响输出的参数,而训练数据和开发方法仍未完全公开。当开放模型使用额外数据重新训练后,要确定某种行为或输出问题的来源就会更加困难。

至于PLaMo,公司表示,它能够更大程度地选择训练所使用的数据集并了解其特征。对于处理知识产权、需要回答训练材料中是否可能包含侵犯版权的数据等问题的企业而言,这一点尤为重要。PFN还认为,掌握训练过程有助于调查错误原因,尽管生成式模型的某些方面仍然难以完全解释。

田中以幻觉为例:如果PLaMo给出了错误答案,公司可能能够将问题与数据集中的特定部分联系起来,并着手修正。相比之下,对于构建在开放模型之上的模型,原因并不总是能够确定。

面向日语的设计

PFN表示,从零开发的好处并不局限于透明度。公司在设计PLaMo时考虑了与日本文化和日本特征相关的知识,并开发了自己的语言分析器,即Tokenizer,用于将文本转换为模型可以处理的单元。

PFN称,与外部模型的分析器相比,该分析器处理日语时消耗的标记数量约少20%至30%。标记数量会影响处理效率和成本,因此公司认为,改善这一点能够为本地模型带来实际优势,即使它们面临着通用能力较高的模型的竞争。

拥有完整的训练流程还能够根据特定目标准备相关数据集。这有助于构建金融行业等领域的专业模型,因为确定需要何种数据来提升特定性能会更加容易。

主权优势与开发成本

PFN将PLaMo的开发置于更广泛的背景下,即地缘政治风险以及人工智能日益被视为基础设施所带来的影响。公司指出,美国政府的一项决定导致美国公司Anthropic的Fable 5和Mythos 5模型在6月暂时停止提供,并认为这类发展表明服务会在多大程度上受到国际决策的影响。

但完全从零开发并不是成本最低或速度最快的选择。与在开放模型上进行追加训练的方式相比,它需要更多时间和训练资源,也可能使模型在性能方面更难追上最新的开放模型。因此,PFN并不排除同时采用两种方式;在某些用途上,重新训练的开放模型可能已经足够,公司还提到医疗领域存在一项应用案例。

从PLaMo到本地基础设施

PFN通过应用程序编程接口(API)提供其模型,也支持在客户办公场所内部的本地环境(On-Premises)中运行,这适合优先管理自身数据的机构。公司希望通过将PLaMo与外部工具和计算机上的应用程序连接起来,进一步扩大其影响力,并提升其自主执行长期任务以及处理复杂日语指令的能力。

该系列包括PLaMo 3.0 Prime,公司重点关注在其中结合高水平的日语性能与低成本,此外还有专用于翻译的PLaMo翻訳。田中表示,目标是实现一种模型或服务,为日本用户提供更高的成本效益,而不是仅仅提高推理能力。

计算基础设施本身仍然是一项挑战。PFN使用日本国内和海外的计算资源,因为仅靠本地资源不足以满足当前训练需求的竞争要求。与此同时,公司正在开发专用人工智能芯片,并推进垂直整合,未来或可支持计算资源的本地化。

7月,PFN宣布与日本人工智能公司Noetra开展合作,该公司获得了日本大型企业的投资支持。PFN首席执行官大辅岡野原将负责模型开发,田中及多名工程师将被派往Noetra。该项目首先旨在构建能够自主运行机器人的物理人工智能模型,并使用本地运营商的计算基础设施。根据田中的估计,最早在2027年,可能会出现能够被称为“真正本地化”的模型。

PFN的经验所揭示的是,模型的“本地化”并不只是对性能作出的判断。这是在数据和设计控制权、错误解释能力以及语言效率,一方面,与训练成本和获得最新能力的速度,另一方面之间进行权衡。因此,公司的实际战略似乎更接近于针对每种使用场景选择适当的独立程度,而不是将从零开发视为唯一解决方案。

新闻来源
ITmedia AI Plus Japan
查看原始来源 ↗
c
作者

certi.news

同一分类

你可能还喜欢

查看所有新闻