观点与分析

GLM-5.3-Flash检验人工智能模型运行的经济学

Parviz Syed Mohammed认为,Z.ai的GLM-5.3-Flash模型凭借低成本和开放权重,迫使人们重新思考人工智能负载的分配。他建议将任务分为三个支出层级,并在实际测试后,将约45%的任务量导向低成本模型。

2026-08-26
2 分钟阅读
17 浏览量
فريق تحرير certi.news
GLM-5.3-Flash检验人工智能模型运行的经济学

Parviz Syed Mohammed认为,揭示神秘模型Ox Alpha的身份,说明人工智能市场正在发生重要转变:模型之间的比较不再只围绕最高水平的智能展开,而是围绕企业每投入1美元能够获得多少智能。8月26日,Z.ai披露,在OpenRouter上出现的模型就是GLM-5.3-Flash,并且该模型在公布身份前,曾被有意置于公共流量环境中运行。

该模型最初以零成本提供了良好表现,因此吸引了业余爱好者和独立开发者的注意,进而每天处理数万亿个令牌;社区对一周内使用量的估算,从个位数万亿令牌到超过20万亿令牌不等。更重要的是,据文章称,这项服务完全依赖中国芯片和基础设施,而不是一些关注者在揭晓前六天中猜测的美国实验室。

价格重新排列比较结果

GLM-5.3-Flash公布的价格为:每百万个输入令牌15美分、每百万个输出令牌50美分。OpenRouter提供截至9月9日的50%折扣,折后每百万个输入令牌7.5美分、每百万个输出令牌25美分。此外,该模型的权重依据MIT许可证开放,而推理服务则由Z.ai、GMI Cloud、Cloudflare以及美国的其他供应商等提供。

根据Artificial Analysis的比较——该模型在同一天被纳入其中——GLM-5.3-Flash在智能指数上获得57分,每项任务的成本约为9美分。相比之下,GPT-5.6 Sol(max)得分约为59分,每项任务成本为67美分;Grok 4.6得分为61分,每项任务成本为94美分。作者计算认为,前两个模型之间仅有两分差距,却对应约7.4倍的价格差异;而约四分的差距,则需要近10倍的成本。

这些数字并不是对模型质量的普遍判断,也不能替代每家机构的专门测试,但它们阐明了文章的核心论点:当模型在性能指标上逐渐接近时,推理成本可能成为决定使用规模的关键因素,尤其是在编程、代理和重复性任务中。

预算压力先于放弃人工智能的决定

作者引用Uber来说明这一问题。The Information在4月报道称,Uber首席技术官Praveen Neppalli Naga表示,预计2026年的年度编程预算在四个月内就已用尽,而一次两小时的试用演示就让他个人花费了1,200美元。到6月,Uber为每个人、每种工具设定了1,500美元的上限。

这并不意味着这些工具毫无用处;文章区分了“效用”和“价值”。作者援引Uber首席运营官Andrew Macdonald的话称,他无法将仪表板与面向消费者的有用功能数量增加25%联系起来。文章还援引来源所列的McKinsey 2026年调查结果称,80%的受访者表示自己变快了,37%的公司看到了息税前利润方面的影响,另有32%以上的公司停止购买至少一种软件,因为它们能够利用编程代理在内部构建相应功能。

文章的编辑性解读是,企业正面临双重方程:它们希望降低账单,却又无法简单地停止人工智能投资。因此,讨论重点从“我们是否使用人工智能?”转向了一个更实际的问题:每个团队应使用哪种模型、用于哪类任务,以及采用什么成功衡量标准?

三层架构,而不是一个模型

Mohammed建议将编程和代理工作分为三个层级,并按任务量和令牌量而非财务支出占比来计算。在最高层,Fable和Opus模型用于不可逆的决策、战略分析和详细执行计划;作者估计,这类任务不超过工作总量的5%。

中间层包括Kimi K3、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6;据来源称,它们在智能指数上的得分都在60分左右。作者建议将约50%的任务量分配给这一层,尤其用于日常编程和常规工作。文章指出,Kimi在编程领域颇受欢迎,Grok 4.6紧随其后,但其较小的上下文规模仍构成限制。

按照作者的建议,剩余45%应分配给GLM-5.3-Flash,将其作为大规模工作的模型。不过,这一比例并非固定方案;实际分配应由运行模型所使用的工具、编程、内容和营销任务的组合,以及内部评估结果来决定。

在重建预算前应衡量什么?

文章总结认为,像Zhipu、Qwen和DeepSeek等中国开放权重模型,应明确纳入成本核算,而不应仅仅因为来源地而被排除。文章提到,6月初,中国模型在OpenRouter上的令牌份额超过了美国模型,而且榜单前列大部分仍由中国实验室占据。

在预计Google、xAI、Anthropic、OpenAI和DeepSeek将在9月推出新版本之前,作者建议统计令牌消耗,并将支出与明确指标挂钩,例如客户增长或收入,至少也应与开发速度和生产率挂钩。此外,作者呼吁为整个机构或每个团队制定人工智能预算,然后将模型策略定义为分层体系:高端模型用于战略决策,中端模型用于付费席位和日常编程,低端模型用于高密度、重复性任务。

作者的观点并不能证明GLM-5.3-Flash会成为每家机构的最佳选择,也不能证明通用比较指标能够反映所有场景下的表现。但它提供了一个实用的审查标准:不应让每个请求都获得可用的最昂贵模型,也不应在没有明确评估和价值指标的情况下采用最便宜的模型。文章留下的开放问题是:在新版本到来后,成本与性能曲线是否仍会保持这一趋势,以及能够降低推理成本的人工智能公司是否真的会占据大部分使用量。

新闻来源
VentureBeat Startups & Funding
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻