据 The New Stack 报道,微软周五在其 Foundry 平台上推出了 Microsoft-Decision-1,这是一种用于快速、结构化决策的专用模型,并在阿里巴巴的开放权重 Qwen3.5-9B 上构建,而不是在其密切合作伙伴 OpenAI 的任何模型上构建。
此次发布是在 OpenAI 向所有开发者开放公测版决策 API 三天后发布的,同一天,约三周半前与 Jev 一起点燃决策模型类别的初创公司 TypeSafe 宣布了 8.7 亿美元的 A 轮融资,估值为 75 亿美元,由 a16z 领投。微软按照 Jev 的价格对 Decision-1 进行定价:每百万个输入代币 0.042 美元,并提供免费输出。有关加速人工智能更便宜、更快的竞赛的更多信息,请参阅我们正在进行的 人工智能行业报道。
定价与 Jev 相匹配,基于竞争对手的开放式重量
Decision-1是一个后训练模型:微软从阿里巴巴的Qwen3.5-9B开始,针对结构化决策任务而不是开放式生成进行了调整。该公司表示,计划在自己的 MAI 模型以及 OpenAI 模型的基础上重新构建该模型,但对于一家在 OpenAI 上投资数十亿美元的公司来说,最初选择中国开放权重基础是值得注意的。
微软也远非先行者。据 The New Stack 报道,自 Jev 推出以来的三个半星期内,OpenAI、Upstage、Perplexity、Cloudflare 和 AWS 都推出了自己的决策模型。微软选择的 Qwen3.5 基础已经成为行业默认:Cognition 的工程副总裁 Jared Palmer 花了大约 95 美元在 Modal H100 计算上将他的开源 Kev 模型移植到 Qwen3.5,而 Cloudflare 在相同的 Qwen3.5-9B 基础上构建了 Clef-flash 模型。
价格也在趋同。 Palmer 在 OpenRouter 上以每百万输入代币 0.042 美元的价格列出 Kev-4B,Perplexity 收费 0.02 美元,OpenAI 收费是 Jev 费率的两倍多。按照这些价格,来自单个决策调用的收入微乎其微,这表明微软更大的机会是保持代理流量,包括围绕每个决策的生成调用,通过 Foundry 运行。
微软是它自己的第一个客户
微软董事长兼首席执行官 Satya Nadella 于周五在 X 上宣布了该模型,并写道 Decision-1“在结构化决策任务上提供了顶级性能,在延迟和质量方面优于法学硕士和其他决策模型”,并补充说,“我们已经在整个 Microsoft 中对其进行了测试。”
据 The New Stack 报道,四个内部团队支持了这一点。 Xbox Research 使用 Decision-1 对 10,000 多条玩家反馈进行了排序。 Copilot 团队用它对聊天和座席响应进行评分。待命工程师使用它在现场事件期间提取上下文,Microsoft Discovery 使用它在代理重新计划之前对实验进行评分。
据报道,微软的内部数据称,该模型的速度是 GPT-6 Sol 的 14 倍以上,而 Xbox 工作负载成本仅为 Xbox 工作负载的一小部分,并且在 Discovery 中的一致性提高了 46 倍。微软首席技术官办公室软件工程副总裁 Achint Srivastava 介绍,Decision-1 是一种“在安全、可信的环境中”向现有应用程序、代理和工作流程添加决策的方法。
Decision-1 不能做什么
此次发布还显示了微软在哪些方面落后于竞争对手。 Decision-1 的 Foundry 列表显示,它接受最多 32,768 个文本标记并返回 JSON,但它不支持图像 - 与 OpenAI 的 Decisions API 和 Cloudflare 的 Clef 不同,后者使用视觉编码器。虽然 Cloudflare 在宽松的 Apache 2.0 许可证下发布了 Clef,但 Microsoft 尚未宣布 Decision-1 的开放权重。
还有一个兼容性问题。 AWS、Upstage 和 Ollama 已采用 TypeSafe 的 System One API,该 API 现在是整个类别的通用接口,但 Microsoft 尚未说明 Decision-1 是否完全兼容 - 尽管其 Foundry 示例代码调用 /systemone 端点。
校准声明也值得仔细审查。微软表示,Decision-1 的概率是经过校准的,这意味着在代表性案例中,90% 的预测应该是正确的,大约十分之九,并且该公司自己的文档建议客户验证其数据的校准。这种谨慎与 JevOut 的预印本相呼应,其中南加州大学计算机科学研究人员 Ziyang Xu 和合著者发现,对上下文的简短、听起来自然的添加翻转了 Jev 508 个最初正确的决策中的 312 个,并且在 229 个案例中,Jev 将至少 70% 的概率分配给了错误答案。其他三个评分系统在相同的测试方法下显示翻转率在 64.9% 到 73.2% 之间。微软表示,它使用八种扰动测试了 Decision-1,其中包括重新排序的选项和释义的描述。
Copilot、GitHub 和 Xbox 之间的路由决策
该模型未来可能还有更艰巨的任务。周三,微软表示 GitHub Copilot 将很快决定何时在设备上运行任务以及何时将其发送到云规模模型,但尚未透露 Copilot 发送到云端的内容。模型路由是 Microsoft 为 Decision-1 列出的用例之一,但该公司尚未确认该模型将进行这些调用。通过在 Copilot、GitHub 和 Xbox 之间做出路由决策,微软有动力在内部处理它们。
从 TypeSafe 的吸引力中可以看出竞争优势。 TypeSafe 首席执行官迪奥戈·阿尔梅达 (Diogo Almeida) 在 X 上发帖称,自 Jev 推出以来的三周内,“财富 500 强企业中的 29.4% 出现了”,该模型“意外地每天服务了数万亿个代币”,并且考虑到他团队的工作量,“我们现在已经三周了,想睡觉了。”这些企业正是微软向其出售 Azure 的企业,这使得 Decision-1 的到来与其说是对新市场的押注,不如说是对现有市场的防御。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →

