人工智能

OpenAI发布GPT-6.1 Sol,性能接近Astra,成本降低约80%

OpenAI推出了GPT-6.1 Sol,用于编程、计算机使用、文档分析和多步骤工作流。在多项测试中,其性能接近GPT-6 Astra,而API价格约为Astra的五分之一。该模型可通过ChatGPT Work、Codex和API使用,但尚未进入标准聊天界面。

2026-09-30
1 分钟阅读
15 浏览量
certi.news
OpenAI发布GPT-6.1 Sol,性能接近Astra,成本降低约80%

OpenAI宣布推出GPT-6.1 Sol,这是GPT-6 Sol的改进版本,面向兼顾高性能与低运营成本的任务。该公司表示,该模型在编程、计算机使用、文档分析和专业多步骤工作流方面接近GPT-6 Astra,而其标准价格约为Astra的五分之一。

为大规模使用而设计的定价

GPT-6.1 Sol API的费用为每百万输入令牌2美元、每百万输出令牌10美元。缓存令牌的费用为每百万令牌0.10美元;根据OpenAI的说法,相较于标准输入价格,这相当于95%的折扣。这使该模型尤其适合代理型应用,因为此类应用会在重复请求中复用相同上下文。

实际测试结果

在DeepSWE v1.1测试中,该测试用于衡量真实代码库上的长期软件工程任务,GPT-6.1 Sol取得了与GPT-6 Astra相同的成绩,但成本约为其五分之一。在用于专业文档分析的GDP.pdf测试中,它在涉及金融、医疗和法律等领域的表格、图表及PDF文件的任务中,性能接近Astra。

在多步骤工作流测试AutomationBench中,该模型在中等推理级别上超过Opus 5.5 2.2个百分点,超过GPT-6 Sol 4.8个百分点。而在计算机使用测试OSWorld 2.0中,其成绩比Astra低2.1个百分点;在所述设置下,每项任务的成本约为Astra的七分之一,低于GPT-6 Sol成本的一半。

在Terminal-Bench Science 0.1中,该测试用于衡量数据分析、模拟和定理证明能力,单项任务的平均成本为5.47美元,而Opus 5.5为23.21美元,GPT-6 Astra为23.80美元。不过,Astra仍保持该测试中的最高性能,成绩为68.1%。

准确性与安全限制

GPT-6.1 Sol将事实性错误率降至4.1%,而GPT-6 Sol为4.5%,GPT-6 Astra在最高推理级别下为4%。OpenAI提醒称,该评估基于错误产生概率较高的困难提示词,并不代表ChatGPT的常规使用情况。

该公司还表示,该模型在告知用户工具无法正常运行、避免不被允许的结果以及遵守明确限制方面有所改进。公司还称,与GPT-6 Astra和GPT-6 Sol一样,它没有尝试绕过自动安全控制单元。不过,来源没有提供有关这些说法验证方法的独立细节。

实际发生了什么变化?

OpenAI将GPT-6.1 Sol定位为大规模应用的选择,在这类应用中,降低令牌成本可能比在每项测试中都取得最高成绩更重要。这对软件代理、文档分析服务和自动化服务的开发者都具有意义,但成绩差异仍取决于任务类型和推理级别,因此较低成本并不意味着它能够全面替代Astra。

Plus、Pro、Business、Enterprise和Edu订阅者可通过ChatGPT Work和Codex使用该模型,开发者也可以在OpenAI API中使用名称为gpt-6.1-sol的模型。目前它尚未上线标准版ChatGPT聊天界面。OpenAI还宣布了GPT-6.1 Sol Ultrafast和GPT-6 Astra Ultrafast,并声称速度最高可达到Astra的八倍;与此同时,原预计于本周发布的GPT-6.1 Astra尚未推出,期间有报道称内部测试存在安全方面的担忧。

新闻来源
c
作者

certi.news

同一分类

你可能还喜欢

查看所有新闻