人工智能

Microsoft 在 Foundry 推出基于 Qwen 而非 OpenAI 模型的决策模型

Microsoft 推出了用于应用、代理和工作流决策的 Microsoft-Decision-1 模型,该模型基于阿里巴巴的 Qwen3.5-9B 训练而成。模型目前的价格为每百万输入 token 0.042 美元,输出免费,但暂不支持图像,也未开放模型权重。

2026-10-10
2 分钟阅读
5 浏览量
certi.news Editorial Team
Microsoft 在 Foundry 推出基于 Qwen 而非 OpenAI 模型的决策模型

Microsoft 在 Foundry 平台中推出了 Microsoft-Decision-1 模型。就在三天前,OpenAI 才向开发者公开测试版的 Decisions API。尽管两家公司之间的这种接近关系可能会让人产生其他联想,但 Microsoft 的模型最初是在阿里巴巴的 Qwen3.5-9B 上训练的。该公司表示,未来计划在自有 MAI 模型以及 OpenAI 模型的基础上重新构建该模型。

该模型旨在为现有应用、代理和工作流增加决策能力,例如评估输出、选择合适的模型,或确定自动化流程中的下一步。Microsoft 在 Foundry 中以每百万输入 token 0.042 美元的价格提供该模型,输出 token 免费;这一价格与 TypeSafe 对 Jev 模型收取的价格相同。

Microsoft 的内部测试

Microsoft 表示,该模型的首个用户就是公司自身。Xbox Research 使用它对超过 1 万条玩家反馈进行排序;Copilot 团队使用它评估对话和代理响应;值班工程师则借助它在实时事故期间提取上下文。Microsoft Discovery 也使用该模型评估实验,然后再由代理重新规划任务。

根据该公司的数据,在一项与 Xbox 相关的测试中,Decision-1 的速度比 GPT-6 Sol 快 14 倍以上;在 Discovery 测试中,其一致性高出 46 倍。材料没有说明这些比较的具体方法,因此不能将这些数字视为模型在上述场景之外整体性能的普遍结论。

为什么这条消息很重要?

决策模型正逐渐成为应用与更大型生成模型之间的低成本控制层。当代理需要反复选择模型、工具或执行路径时,这一层尤其重要,因为每次决策的成本可能会随着伴随的生成请求流量不断累积。

Microsoft 还有额外的动机在内部开发此类模型,尤其是考虑到 GitHub Copilot 计划决定将部分任务在设备上执行,还是发送给云端模型。不过,该公司尚未确认 Decision-1 是否会实际参与 Copilot 的决策,也未披露哪些内容会被发送到云端。

兼容性和媒体限制

Foundry 列表显示,Decision-1 最多可接收 32,768 个文本 token,并以 JSON 格式返回结果,但不支持图像。这使其适用范围比 OpenAI 的 Decisions API 以及 Cloudflare 的 Clef 更窄,后者使用视觉编码器。

Microsoft 也没有宣布开放模型权重,而 Cloudflare 则以 Apache 2.0 许可证发布了 Clef 模型。AWS、Upstage 和 Ollama 采用名为 System One 的 TypeSafe 接口作为该领域的共同接口,但 Microsoft 尚未确认 Decision-1 是否完全兼容该接口,尽管其 Foundry 代码示例调用了名为 /systemone 的端点。

信任并不意味着能够抵御误导

Microsoft 表示,该模型的概率经过校准;也就是说,在具有代表性的案例中,一个带有 90% 概率的预测应当在大约十个案例中有九个正确。但该公司建议客户使用自己的数据验证校准情况。

JevOut 研究指出了这一保留意见的重要性:简短且措辞自然的添加内容,使 Jev 模型最初正确的 508 个决策中有 312 个发生逆转;在其中 229 个案例中,模型对错误答案给出了至少 70% 的概率。至于 Microsoft 对其模型进行的测试,则涵盖了八类变化,例如重新排列选项和改写描述,平均改变了 1.3% 的回答。不过,JevOut 研究并未测试 Decision-1,因此这一结果无法证明该模型将如何处理为误导而设计的输入。

新闻来源
The New Stack - Software Development
查看原始来源 ↗
c
作者

certi.news Editorial Team

同一分类

你可能还喜欢

查看所有新闻