微软 ThinkingBox 在 2026 年 10 月 4 日正式上线 Hugging Face:微软与 Hugging Face 在官方博客联合发布这套智能体沙箱与基准 ThinkingBox-Bench,判分只看一件事——智能体在数据库里留下的最终状态和副作用对不对,不看它最后说了什么。首批结果里,单次成功率最高的 Claude Opus 5.5 也只做对了 67.16% 的任务;同一个任务连续做对 20 次的比例还要低得多。
它测什么:终态、副作用和重复 20 次
ThinkingBox-Bench 包含 507 个有状态业务工作流,覆盖零售、汽车保险、旅行、新式银行和咨询。每个任务都预设起始后台状态、用户目标、可用的 MCP 工具、领域规则和可执行检查;模拟用户握着预订号、偏好这类私有信息,智能体不问,它就不给。每次尝试都从一份干净的隔离会话开始,同一任务跑 20 次。官方举的例子很说明问题:一位客户标价 745 美元的厨房电器被快递异常卡住、超期 15 天,智能体做了 9 次格式全对的工具调用,退款政策也读对了,最后却把工单关成「已解决」——承运商的异常还开着,要求的终态本应是「挂起待处理」,客户真正问的问题它也没答。只看工具调用和最终回复挑不出毛病,看数据库立刻翻转。507 个任务里 477 个纯按状态判分,其余 30 个再加一条窄口径的回复评分。
单次成功不等于靠得住
这套基准同时报三个数:pass@1 是全部尝试的成功率,pass@20 是 20 次里至少成功一次的任务占比,第三个是实测 20 次全对的任务数。Claude Opus 5.5 以 67.16% 的 pass@1 居首,Opus 5 是 66.50%,GPT-5.4 是 65.36%。开源权重里最强的 Kimi-K3 为 57.37%,至少成功过一次的任务高达 93.89%(476 个),覆盖面全场最广,20 次全对却只有 68 个,占 13.41%;Opus 5 覆盖面只有 79.09%,全对任务却有 241 个,占 47.53%,而 Opus 5.5 的单次率和覆盖面都更高,全对数同为 241 个——官方的说法是,头条精度涨了半个点,可靠性一点没买到。失败的形态更值得警惕:一组 121,680 次尝试的对照实验里,79,853 次没通过可执行检查,其中 67.24% 是「干净收尾」的失败——正常结束、调用了改状态的工具、没有报任何工具错误;检查器查出的具体问题里,字段值写错占 77.61%,多做了不该做的副作用占 43.30%,漏掉必需效果占 25.36%,三者有重叠。
失败多半坏在工具环节,成本也要按靠得住来算
官方给失败轨迹打的标签里,工具使用问题占 79.9%,状态更新错误占 10.3%,给用户的处理不完整占 7.0%,压根没执行改状态动作占 2.9%。多数翻车发生在工具报错、前提条件不满足或查询返回空结果之后不会恢复,是重试和纠错设计的问题,先于模型本身的问题。领域差异同样悬殊:零售场景平均 pass@1 有 59.52%,汽车保险只有 33.83%。成本算法也跟着变:按单次成功算,GPT-5.6 Sol 每次只要 0.127 美元,最便宜;按 20 次全对的「可靠任务」算,它每个要 9.76 美元,最低的反而是 GPT-5.4,6.80 美元一个(128 个任务达标),GPT-6 Astra 是 7.45 美元、231 个任务,Opus 5.5 是 7.80 美元、241 个任务。便宜地答对一次,和稳定地把事办成,是两本账。
谁能用,企业落地先看什么
ThinkingBox 的运行框架和数据集现已放在 Hugging Face 上,通过 OpenEnv 接口接入,每个回合返回通过或不通过的二值结果;本地复现需要 Linux 或 WSL、Python 3.11 以上、uv 和 Docker,基准数据要用官方固定的 v1.0 版本,代码为 MIT 许可。它由微软 Copilot Studio 团队与 Toloka 合作完成,合作者包括匹兹堡大学、西北大学、哥伦比亚大学和加州大学欧文分校的研究人员;官方同时提醒,公开任务都是按真实企业模式重构的合成场景,客户不是真人,成绩不能直接等同于自家业务表现。对正在把智能体接进工单、退款、预订系统的团队,官方给的检查顺序可以直接借用:提交前先核对终态,而不是相信模型的总结;把工具和系统错误分类,让重试只打在可恢复的错误上;工具面收窄到工作流真正需要的范围;不可逆的改动留人工批准。下一步值得盯的是官方预告的强化学习训练仓库,以及其他主流基准会不会跟进「重复多次、全对才算数」的口径。