Ataraxos 是第一个在军棋(Stratego)上大比分战胜人类世界冠军的 AI 系统。2026 年 9 月 30 日,麻省理工学院通过 MIT News 公布了这项研究:由 MIT、卡内基梅隆大学、纽约大学和斯坦福大学联合团队开发的 Ataraxos,以 15 胜 1 平 4 负的创纪录分差击败军棋世界排名第一的选手,又在世界锦标赛上面对顶尖人类棋手打出 39 胜 2 负;相关论文同日发表于《自然》(Nature)。真正让行业侧目的是效率——它达到这一水平所用的训练样本不到 DeepMind 此前系统 DeepNash 的百分之一。
军棋为什么这么难:对手的底牌你永远看不见
军棋是一种双人“不完全信息”棋盘战争游戏:双方各布 40 枚棋子,棋子身份在碰撞之前完全保密,只有相撞时级别低的一方被吃。可能的开局配置超过 10 的 66 次方——复杂度比象棋、围棋高出数个数量级。
难的不只是算力。项目负责人、MIT 电气工程与计算机科学系助理教授 Gabriele Farina 指出,为扑克这类游戏开发的 AI 技术在这套规则下根本扩展不开:你越虚张声势,对手就越预期你会虚张声势,每一次诈唬的价值都在缩水。在完全信息的象棋里,最好的棋永远是那步最好的棋;但在军棋里,“你走什么”和“对手以为你会走什么”纠缠在一起,算清一步的代价是指数级膨胀。
此前的纪录保持者是 DeepMind 的 DeepNash:训练成本高达数百万美元,依然赢不了顶尖人类棋手。
两步走:先练出“蓝图”,再临场“读心”
Ataraxos(名字取自希腊语,意为“不受纷扰、泰然自若”)的技术路线分成两步。
第一步是自我对弈强化学习:让模型和自己下足够多的棋,练出一套扎实的“蓝图策略”,用来开局布阵和确立基本打法。团队专门设计了高效算法,让模型学得更快,也不会卡在“把每一种可能都算一遍”的死胡同里。
第二步是临场决策规划,这是整套系统真正的创新。落子之前,Ataraxos 会先用一个生成模型估算对手隐藏棋子最可能的身份,“把视线聚焦到眼前的这盘棋和这个对手身上”(Farina),再评估后续走法、选出最优的一手。它不是在瞎猜,而是在做概率化的“读心”。
效率数字很直观:达到严格更强的棋力,Ataraxos 只用了不到百分之一的训练样本、不到三十分之一的自我对弈局数。
不只会下棋:斗地主和 Hanabi 照样赢
研究团队还把同一套方法搬到了规则完全不同的游戏上:快节奏少棋子的变体 Barrage Stratego、多人合作纸牌 Hanabi,以及两人联手对抗第三家的斗地主——全部达到超人类水平。这说明 Ataraxos 不是为军棋定制的“偏科生”,而是一套通用的不完全信息决策方法。
现实映射很直接:军事机动、商业谈判、网络安全,本质上都是“对手藏着底牌”的决策问题。MIT 在新闻稿里明确点出了这个方向——这类算法未来可能帮助人类决策者在复杂对抗场景里选出更优策略。
下一步:先让人类看懂它在想什么
团队的下一步是可解释性:让 Ataraxos 能用人类听得懂的方式解释自己的决策。Farina 的原话是:“人类必须在是否采纳建议上拥有最终决定权,所以在落地之前,我们需要一种审计模型决策的方法。”算法可以先赢世界冠军,但要进真实世界,得先过“可审计”这一关。