阿里巴巴于周五在 Hugging Face 平台发布了 Qwen3.8-27B,采用开放源代码的 Apache 2.0 许可证,使开发者能够下载其权重、检查、修改,并在云端模型接口之外运行。此次发布的重要性不仅在于其 270 亿参数,还在于它能够结合图像和视频理解、最高 262,144 个令牌的上下文、可调节推理,以及对编程任务和软件代理工作流的支持。
来源将该模型描述为 Qwen3.8 一代能力的紧凑且易于部署的版本。16 位精度版本需要约 56 GB 的 GPU 内存,而 FP8 版本需要约 28 GB。压缩至 4 位后,模型本身的大小降至约 17 GB,使其能够在高端消费级设备上运行,例如高性能游戏电脑或配置良好的笔记本电脑。
更小体积中的强大能力
性能与体积的结合,是开发者和高级人工智能用户广泛关注的主要原因之一。阿里巴巴在发布时给出了多项测试中的强劲数据:该模型在 SWE-bench Pro 中得分 61.7,在 LiveCodeBench v6 中得分 90.3,在 CoWorkBench 中得分 70.7,在 OSWorld-Verified 中得分 84.3。
在公司发布的对比表中,Qwen3.8-27B 在 SWE-bench Pro 和 LiveCodeBench 两项测试中超过了表中列出的 Claude Opus 4.6 Max 成绩,而 Claude 仍在 Terminal-Bench、GPQA Diamond 和 Humanity’s Last Exam 中领先。不过,这些结果不足以宣布一个全面的赢家;阿里巴巴的部分评估属于内部评估,而且不同模型所使用的测试工具和测量机制未必完全一致。
随后出现的独立结果进一步提升了该版本的热度。Artificial Analysis 给予它 52 分的 Intelligence Index,这是一项包含编程、科学、推理和专业任务九项评估的综合指标。这一分数与该指标目前在最高推理设置下赋予 OpenAI GPT-5.6 Luna 的成绩相同;后者是专有模型,只能通过云端使用。此外,Qwen3.8-27B 在 Agentic Index 中获得 51 分,超过了在最高推理强度下的 Claude Opus 4.8。
这些比较并不意味着各模型完全等价,但它们解释了开发者为何关注该模型。开源软件代理 Cline 称,这是本地模型首次表现出接近顶级模型的能力。Joshua “Xenova” Lochner 还测试了使用定制 WebGPU 内核运行该模型,显示其有可能被集成到不同的运行环境中。
本地运行在实践中能带来什么?
Simon Willison 在一台搭载 M5 Max 处理器的 MacBook Pro 和一台 Nvidia DGX Spark 上测试了一个约 17 GB 的 Q4_K_M 压缩版本。在他的测试中,该模型能够编写代码、理解图像,并通过 Pi agent 框架运行软件代理循环。它还在代码库中导航以解释身份验证机制,并编写和测试了一个 Python 工具,将 JSONL 格式的代理日志转换为 Markdown。
这些测试说明了只能通过 API 访问的模型与可以保存在工作站上的文件之间的实际差异。开发者可以运行和修改模型,并将其保留在自己的基础设施内,而不是将数据发送给外部提供商。这为隐私、信息安全、治理和部署控制带来了更多选择,但并不自动意味着该模型适合每项任务,也不意味着运行速度会很快。
用户量也体现了这种关注。据 Cybernews 报道,该模型在上线前三天内从 Hugging Face 下载超过 300 万次,同时很快出现了与本地推理工具兼容的压缩版本。Reddit 上的 LocalLLaMA 社区还创建了专门主题,用于汇总测试结果、压缩版本、设置指南和对比数据。
质量伴随着时间成本
Qwen3.8-27B 最明显的限制是倾向于过度思考。Artificial Analysis 表示,该模型在 Intelligence Index 测试期间生成了 1.6 亿个输出令牌,而类似开源权重模型的中位数为 4300 万个令牌。来源将其归因于默认的 xhigh 推理设置;在 Willison 的一次测试中,生成一幅骑自行车的天鹅 SVG 图耗时 21 分钟,并消耗了超过 22,000 个推理令牌。因此,他建议日常使用时从低推理强度或不启用推理开始。
Tomasz Tunguz 在一项与 DeepSeek V4 Flash 对比的九项任务小型测试中记录了类似的权衡。启用推理后,在他所使用的代理系统中,Qwen 的质量略高,但速度慢约 30 倍,成本高 4.5 倍;他同时提醒,九项任务不足以决定最终结果。
推理软件或许能够缩小这一差距。该模型包含 Multi-Token Prediction 技术。Willison 表示,在 DGX Spark 上通过 llama.cpp 启用该技术后,与 LM Studio 的默认设置相比,性能提升了约 72%。不过,他通过 LM Studio 进行的常规运行速度为每秒 15 至 30 个令牌,远低于许多托管模型的响应速度。
这对企业意味着什么?
对企业而言,更重要的比较并不是一个拥有 270 亿参数的模型是否在某一张表格中超过 Claude 或 GPT,而是它能否在本地完成足够多的编程、文档分析、视觉理解和代理任务,从而在实际业务类别中取代 API 调用。凭借 Apache 2.0 许可证,企业可以检查和修改权重,并在自身控制措施之后进行托管;阿里巴巴还记录了该模型与 vLLM、SGLang 和 TokenSpeed 框架的兼容性。
阿里巴巴表示,Qwen Cloud 的托管版本将在之后推出,并配备 100 万令牌的默认上下文和内置工具。但目前 Qwen3.8-27B 的价值在于,它提供了一个对云基础设施依赖较低的本地部署选项。其结果仍需要更多独立验证,而较慢的推理速度可能限制它在实时交互中的实用性。因此,此次发布并不能证明本地模型已经在总体上与领先模型实现平等,但它表明,最近还只能通过昂贵服务获得的能力,如今已经可以从一个更小的文件中运行,并使用用户拥有的硬件。