AI导航

Microsoft Decision-1 发布:专做判断的模型比大模型快约 35 倍

AI资讯
2 min read
0 次阅读

Microsoft Decision-1 在 2026 年 10 月 9 日由微软正式发布,它不写长文、不陪聊天,只做一件事:在给定选项里快速打分判断。模型已上架 Microsoft Foundry,之后还会经 OpenRouter 提供;定价是输入每百万 token 0.042 美元、输出免费。微软称,在其 36 项、近 15 万道题的盲测对比里,它准确率最高,P50 延迟约为 GPT-6 Sol 的三十五分之一。

它和聊天大模型不是同一种工具

聊天大模型输出的是文字,程序拿到后还要再解析;Decision-1 输出的是每个选项的校准概率,支持是非、多选、量表评分,还能按评分标准给其他模型的回答和智能体的动作打分。它由 Qwen3.5-9B 后训练而来,微软说后续会换到自家 MAI 和 OpenAI 的底座上重做。适合它的位置是流程里的判断节点:请求该路由给哪个模型、内容要不要拦、工单先处理哪一张,而不是最终面向用户的那一层。

快和稳,微软给了两组数

速度上,它比对比中第二快的 Quyet-1.0-Large 快约 4.5 倍;微软的理由是判断会串在流程里,20 步每步多等 100 毫秒就是 2 秒。稳定性上,同一请求被改写、换序、加格式噪声等八种扰动后,它的判断平均只翻转 1.3%。这些都是微软自家口径、题目对其训练保持盲测,真实业务里选项设计和自家数据分布不同,上线前仍要用自己的样本复测,不能直接把 35 倍当成承诺。

微软内部先用在哪

公开的内部例子包括:Xbox 团队拿它给一万多条玩家反馈归类,Copilot 团队用它做回答质检,应急工程师用它在日志和工单里检索处置知识,科研平台 Microsoft Discovery 用它给实验方案按标准打分、驱动改计划。共同点是判断量大、标准相对固定、错了还有后续环节兜底。反过来,选项本身定不清、需要开放推理的任务不适合硬塞给它;先把选项和评分标准写清楚,往往比换模型更重要。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。