OpenAI 已向开发者开放 Decisions API 接口的公开测试,并新增接收图像的能力,以便根据视觉内容快速做出决策。公开版本基于 GPT-6 Luna 模型运行,可将文本或图像转换为三种结构化输出:关于某一陈述是否正确的概率、从指定列表中进行选择,以及用于确定输入在某一范围内位置的数值分数。
OpenAI 对该接口的定价为每百万个输入令牌 0.10 美元,不收取输出令牌费用,也不收取缓存读写操作费用。这使该服务区别于通用推理模型;该接口侧重于快速给出明确决策,而不是生成冗长答案。
从游戏到机器人
在 OpenAI 展示的一项演示中,该接口分析一款视频游戏中的画面帧,画面中一辆汽车正在交通流中行驶,然后判断汽车是否应当变道或继续前进。公司表示,做出这些决策所需的时间,仅为推理模型执行相同任务可能需要时间的一部分。
公司还展示了将该接口用于分析来自 Hugging Face 可编程双足机器人 Microduck 的摄像头画面。通过将 Decisions API 与实时语音模型 GPT-Live 结合,系统能够确定图像中水果的位置,并根据“跟随苹果”等指令引导机器人朝其移动;它还可以处理“跟随水果”这类更加模糊的指令。其他示例包括在语音对话期间为动画角色选择表情。
托管模型与开放模型之间的竞争
OpenAI 的这一举措并非孤立发生。Perplexity 已在 Hugging Face 上推出采用 Apache 2.0 许可证的 pplx-decider-v1-27b 模型,该模型基于 Qwen3.8-27B 进行调优。根据模型卡片,该模型在 11 项基准测试中的综合成绩为 85.71%,而 TypeSafe 的 Jev 模型为 84.51%;不过,Jev 在 11 项基准中的 6 项上表现更好,其中包括 WinoGrande、BBH 和 TruthfulQA binary。
Amazon 推出了可下载的 Strands Decider 2B 模型,该模型基于 Qwen3.5-2B 构建。Amazon 表示,在 JevBench 公共数据集上,该模型在参数量约为 20 亿的公共模型中排名第二。Cloudflare 则推出了采用开放权重和 Apache 2.0 许可证的 Clef 与 Clef-flash 两个模型,同时也通过 Workers AI 提供 Clef。Clef 和 OpenAI 的接口支持图像,而 Jev 和 Strands Decider 仍专用于文本。
对开发者而言,这意味着什么?
最重要的变化不仅在于新增图像支持,还在于模型的部署方式。OpenAI 的接口以托管服务形式提供,而 Perplexity、Amazon 和 Cloudflare 则允许下载权重,并在开发者自己的基础设施上运行模型。因此,执行位置、数据控制权和运行成本等因素,将与准确性和速度一起影响决策模型的选择。
目前展示的结果仍与各方测试的基准有关,而且相关材料没有提供关于响应时间、运行成本或视觉性能的全面独立比较。根据现有信息,Decisions API 将决策模型的使用拓展到了视觉和交互式应用,但目前尚无法确定托管服务的易用性是否会胜过本地运行的灵活性。
新闻来源
The New Stack - Software Development
查看原始来源 ↗