人工智能

PrismML将推理模型压缩至5.9 GB,实现本地运行

PrismML推出Bonsai 2 27B模型,将Qwen3.8 27B模型压缩至5.9 GB,同时保留其98%的基准测试成绩,使在电脑、甚至高端手机上运行先进推理模型成为可能。该公司押注三值权重,以降低内存需求,同时避免性能大幅损失。

2026-09-17
1 分钟阅读
2 浏览量
فريق تحرير certi.news
PrismML将推理模型压缩至5.9 GB,实现本地运行

人工智能初创公司PrismML推出了Bonsai 2 27B模型,将阿里巴巴开源的Qwen3.8 27B模型压缩为仅5.9 GB的文件。该公司表示,压缩后的模型在基准测试中取得了原始模型综合得分的98%,同时将内存需求降低了约9至10倍。

这一新尺寸使得在个人电脑上运行该模型成为可能,或许也能在高端智能手机上运行,而不必完全依赖云服务器。但这并不意味着所有手机都能实际运行它,因为来源仅以可能性的方式提出了手机兼容性,而且实际性能取决于硬件以及围绕模型运行的软件。

压缩技术如何运作?

PrismML采用了其称为三值权重的技术。模型权重是存储模型在训练过程中学到的部分信息的数值,按照该公司的解释,通常每个权重需要16位。而这种新方法只用三种值中的一种表示每个权重:正一、负一或零。减少可能取值的数量,可以大幅降低存储模型所需的空间。

公司由Babak Hassibi领导,他是Caltech教授,也是压缩技术专家;Ion Stoica担任公司顾问。支持者包括Khosla Ventures、Cerberus Capital和Caltech。PrismML完成了一轮金额为2225万美元的种子融资。它并不是唯一一家致力于压缩大型语言模型的公司,消息来源还提到Multiverse Computing是该领域的竞争者。

表现优于上一版本

与Bonsai的首个版本相比,Bonsai 2有所改进。该公司于3月推出首个版本,据TechCrunch援引该公司报道,该版本取得了原始模型95%的得分。PrismML表示,首个版本的下载量超过1100万次,而其更小型的模型还额外获得了260万次下载。

但98%的比例并不意味着与原始模型完全一致,也不能单凭这一点证明剩余差异不会在实际使用中显现。Hassibi承认,压缩很可能会对性能产生一定影响;此外,基准测试无法反映所有现实任务,模型运行所在的软件环境也会影响其准确性。

这一进展为何重要?

如果PrismML能够继续缩小模型,同时保留其大部分能力,那么在本地运行推理模型可能会变得更具可行性。根据Stoica的说法,这可以让数据在用户设备上处理,而不是发送到云端,从而有助于保护隐私并减少对外部连接的依赖。但它尚未解决能耗、响应速度和设备兼容性等问题,也不能证明该模型在所有场景中都能提供相同水平的性能。

公司计划将压缩技术应用于大得多的模型,Hassibi表示,未来几个月内的后续版本可能会达到数千亿参数的范围。他认为,更大的模型可能为压缩过程提供更大空间,以保留其能力,但这一目标仍是未来计划,目前尚未成为可用成果。报道还提到有关与Apple进行谈判的传闻,但Hassibi拒绝置评,因此不能将其视为已宣布的合作或协议。

新闻来源
TechCrunch AI
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻