中国人工智能公司 Z.ai 揭示,上周以 Ox Alpha 名义出现在 OpenRouter 平台上的模型是该公司模型之一,并将其重新命名为 GLM-5.3-Flash 发布。该公司通过 Hugging Face 提供模型权重,使开发者能够按照 Z.ai 提供的形式访问并运行该模型,而不必让它继续作为第三方平台上的匿名服务存在。
Ox Alpha 此前以免费形式出现在 OpenRouter 上,但未披露开发方。不过,它在多项测试和排行榜中取得强劲成绩后迅速引发关注。由于开发方身份不明,外界展开了关于其背后实验室的讨论;在公司确认与该模型的关系之前,Z.ai 就是被提出的主要名称之一。
面向编程和代理任务的模型
Z.ai 将该模型定位为面向编程、长期代理任务以及生产环境工作负载的推理模型。根据已公布的信息,GLM-5.3-Flash 旨在处理持续时间较长的软件开发任务、复杂推理问题,以及结合文本和视觉上下文的工作流。
该模型采用 Mixture of Experts(MoE) 架构,共有3200 亿参数,但每次处理查询时仅约有180 亿参数处于激活状态。其上下文窗口最高可达100 万个 token,支持文本、图像和视频片段;生成响应的长度最高可达131072 个 token。
为长上下文设计的注意力架构
Z.ai 表示,该模型在所采用的注意力架构方面不同于此前的 GLM 版本。稀疏注意力(Sparse attention)侧重于输入中最相关的部分,而不是同时评估所有 token,旨在处理长输入时降低计算需求。
而线性注意力(Linear attention)方法旨在控制内存使用量随上下文扩展而增长的幅度。该公司称,模型训练使用了规模达30 万亿个 token的数据集,同时采用了名为 mHC 的方法来改进训练过程。
这对开发者意味着什么?
Z.ai 表示,运行 GLM-5.3-Flash 的成本比运行其上一代模型低十倍。如果这一差异反映在实际使用中,那么对于运行长期代理任务或需要处理大型上下文的团队来说可能具有重要意义;但本文没有提供测量条件、价格或硬件要求的详细信息,因此这一成本比较仍需独立验证。
在公司展示的测试中,该模型与 Claude Opus 4.8、GPT-5.6 Terra 和 Gemini 3.7 Flash 进行了比较。根据 Z.ai 的结果,GLM-5.3-Flash 在用于衡量知识密集型任务表现的 GDPval-AA v2 测试中取得最高分,并在衡量完成云应用内任务能力的 AutomationBench 中排名第二。
此次公告的重要性在于结合了三个要素:通过 Hugging Face 提供的模型权重、超长上下文,以及对代理和编程的明确侧重。但这本身并不能证明该模型优于竞争模型,因为上述结果由该公司自行发布,且本文没有提供测试方法或测试可复现性的详细信息。此次发布也是中国人工智能公司更广泛努力的一部分,即提供开放权重、运行成本更低的模型,作为 OpenAI 和 Anthropic 等公司提供的闭源模型的替代方案。