SpaceXAI于当地时间9月21日宣布推出人工智能模型Grok 4.7,并向企业和开发者介绍称,这是其面向编程和知识工作的最强模型。该模型的价格和速度与Grok 4.6相同,而公司表示,与同类模型相比,其速度快两倍,成本降低一半。
Grok 4.7有哪些变化?
该模型采用更大的基础模型,并通过更长时间的强化学习以及为处理可能需要数小时才能完成的问题而设计的复合任务进行训练。SpaceXAI表示,这提升了模型复核自身工作和处理长上下文的能力。模型还接受了对公司编程代理Grok Bot运行机制的原生理解训练,旨在提升其对话任务和通用知识工作的表现。
改进内容包括创建文档和演示文稿,以及执行模拟律师、护士和金融分析师工作的专业任务。在GDPval测试中,Grok 4.7取得1695的Elo分数,高于Grok 4.6的1605和GPT-6 Astra的1542,但仍落后于取得1735分的Fable 5.1。
部分测试取得领先,并非全部测试如此
在针对长期编程任务的CursorBench 4.0中,Grok 4.7的得分为46.3%,Grok 4.6为40.4%,GPT-5.6 Sol为41.7%,而Fable 5.1以51.8%的得分排名第一。在EEBench电气工程测试中,该模型以64.0%的得分在对比模型中取得最高成绩;在Harvey Legal Agent Benchmark法律任务测试中,也以19.6%的得分取得最高成绩。
但其优势并不全面:在针对长期终端任务的Terminal-Bench 4.0中,其得分为38.0%,而Fable 5.1为57.9%。在HealthBench Professional临床推理测试中,其得分为56.7%,低于GPT-5.6 Sol的60.5%和Fable 5.1的62.1%。这些结果意味着,模型的选择仍将取决于任务类型,而不是仅依据总体排名或价格。
价格和可用性
Grok API的价格从每百万输入令牌2美元和每百万输出令牌6美元起。相比之下,GPT-5.6 Sol的价格为每百万输入令牌4美元、每百万输出令牌20美元,而Fable 5.1的价格为每百万输入令牌10美元、每百万输出令牌50美元。SpaceXAI还提供速度为基础版本两倍的更快版本,同时价格也翻倍。
Grok 4.7于同日通过Cursor和编程工具Grok Build上线,此外还可通过Grok API、第三方编程工具、模型路由器和云计算平台使用。
安全性和测试工具访问权限
SpaceXAI表示,公司已完全重新设计安全机制,并提高了模型抵抗绕过限制的尝试以及拒绝危险请求的能力。该模型在生物学领域的LatchBio安全测试中取得62.4%的成绩,是公司进行比较的模型中最高的。在HackerBench v0.3中,该模型仅通过了3.3%的双重用途和网络安全风险请求;公司表示,它不会屏蔽大多数合法的安全任务。
SpaceXAI还开始向部分网络安全合作伙伴提供邀请制访问权限,以便使用红队功能开展防御性研究。这些说法仍与公司选择的测试及其方法相关,而且不同领域之间的结果差异,要求开发和业务团队根据实际使用场景评估模型。