Microsoft Decision-1 在 2026 年 10 月 9 日由微软正式发布,它不写长文、不陪聊天,只做一件事:在给定选项里快速打分判断。模型已上架 Microsoft Foundry,之后还会经 OpenRouter 提供;定价是输入每百万 token 0.042 美元、输出免费。微软称,在其 36 项、近 15 万道题的盲测对比里,它准确率最高,P50 延迟约为 GPT-6 Sol 的三十五分之一。
它和聊天大模型不是同一种工具
聊天大模型输出的是文字,程序拿到后还要再解析;Decision-1 输出的是每个选项的校准概率,支持是非、多选、量表评分,还能按评分标准给其他模型的回答和智能体的动作打分。它由 Qwen3.5-9B 后训练而来,微软说后续会换到自家 MAI 和 OpenAI 的底座上重做。适合它的位置是流程里的判断节点:请求该路由给哪个模型、内容要不要拦、工单先处理哪一张,而不是最终面向用户的那一层。
快和稳,微软给了两组数
速度上,它比对比中第二快的 Quyet-1.0-Large 快约 4.5 倍;微软的理由是判断会串在流程里,20 步每步多等 100 毫秒就是 2 秒。稳定性上,同一请求被改写、换序、加格式噪声等八种扰动后,它的判断平均只翻转 1.3%。这些都是微软自家口径、题目对其训练保持盲测,真实业务里选项设计和自家数据分布不同,上线前仍要用自己的样本复测,不能直接把 35 倍当成承诺。
微软内部先用在哪
公开的内部例子包括:Xbox 团队拿它给一万多条玩家反馈归类,Copilot 团队用它做回答质检,应急工程师用它在日志和工单里检索处置知识,科研平台 Microsoft Discovery 用它给实验方案按标准打分、驱动改计划。共同点是判断量大、标准相对固定、错了还有后续环节兜底。反过来,选项本身定不清、需要开放推理的任务不适合硬塞给它;先把选项和评分标准写清楚,往往比换模型更重要。