AI导航

Ataraxos 击败军棋世界冠军:MIT 新 AI 登 Nature,训练量不到 DeepNash 百分之一

AI资讯
3 min read
0 次阅读

Ataraxos 是第一个在军棋(Stratego)上大比分战胜人类世界冠军的 AI 系统。2026 年 9 月 30 日,麻省理工学院通过 MIT News 公布了这项研究:由 MIT、卡内基梅隆大学、纽约大学和斯坦福大学联合团队开发的 Ataraxos,以 15 胜 1 平 4 负的创纪录分差击败军棋世界排名第一的选手,又在世界锦标赛上面对顶尖人类棋手打出 39 胜 2 负;相关论文同日发表于《自然》(Nature)。真正让行业侧目的是效率——它达到这一水平所用的训练样本不到 DeepMind 此前系统 DeepNash 的百分之一。

军棋为什么这么难:对手的底牌你永远看不见

军棋是一种双人“不完全信息”棋盘战争游戏:双方各布 40 枚棋子,棋子身份在碰撞之前完全保密,只有相撞时级别低的一方被吃。可能的开局配置超过 10 的 66 次方——复杂度比象棋、围棋高出数个数量级。

难的不只是算力。项目负责人、MIT 电气工程与计算机科学系助理教授 Gabriele Farina 指出,为扑克这类游戏开发的 AI 技术在这套规则下根本扩展不开:你越虚张声势,对手就越预期你会虚张声势,每一次诈唬的价值都在缩水。在完全信息的象棋里,最好的棋永远是那步最好的棋;但在军棋里,“你走什么”和“对手以为你会走什么”纠缠在一起,算清一步的代价是指数级膨胀。

此前的纪录保持者是 DeepMind 的 DeepNash:训练成本高达数百万美元,依然赢不了顶尖人类棋手。

两步走:先练出“蓝图”,再临场“读心”

Ataraxos(名字取自希腊语,意为“不受纷扰、泰然自若”)的技术路线分成两步。

第一步是自我对弈强化学习:让模型和自己下足够多的棋,练出一套扎实的“蓝图策略”,用来开局布阵和确立基本打法。团队专门设计了高效算法,让模型学得更快,也不会卡在“把每一种可能都算一遍”的死胡同里。

第二步是临场决策规划,这是整套系统真正的创新。落子之前,Ataraxos 会先用一个生成模型估算对手隐藏棋子最可能的身份,“把视线聚焦到眼前的这盘棋和这个对手身上”(Farina),再评估后续走法、选出最优的一手。它不是在瞎猜,而是在做概率化的“读心”。

效率数字很直观:达到严格更强的棋力,Ataraxos 只用了不到百分之一的训练样本、不到三十分之一的自我对弈局数。

不只会下棋:斗地主和 Hanabi 照样赢

研究团队还把同一套方法搬到了规则完全不同的游戏上:快节奏少棋子的变体 Barrage Stratego、多人合作纸牌 Hanabi,以及两人联手对抗第三家的斗地主——全部达到超人类水平。这说明 Ataraxos 不是为军棋定制的“偏科生”,而是一套通用的不完全信息决策方法。

现实映射很直接:军事机动、商业谈判、网络安全,本质上都是“对手藏着底牌”的决策问题。MIT 在新闻稿里明确点出了这个方向——这类算法未来可能帮助人类决策者在复杂对抗场景里选出更优策略。

下一步:先让人类看懂它在想什么

团队的下一步是可解释性:让 Ataraxos 能用人类听得懂的方式解释自己的决策。Farina 的原话是:“人类必须在是否采纳建议上拥有最终决定权,所以在落地之前,我们需要一种审计模型决策的方法。”算法可以先赢世界冠军,但要进真实世界,得先过“可审计”这一关。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。