AI终于攻克军棋

AI 在《Stratego》中首次大幅击败顶尖人类玩家。研究团队发现,真正的突破不是把搜索树做得更大,而是让模型学会推断对手隐藏棋子的身份,并据此进行风险可控的决策。
AI终于攻克 Stratego:隐藏信息推理成为突破口
AI 终于在《Stratego》(西洋陆军棋)上跨过了长期卡住它的门槛:由麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学研究者共同开发的新系统,击败了顶尖人类玩家,而且领先幅度很大。
这件事的重要性不在于又多了一个会下棋的程序,而在于 Stratego 恰好暴露了当下 AI 最难处理的一类问题:信息不完整、结果有随机性、对手会欺骗,而且每一步都可能改变未来的信息结构。研究团队的核心做法,是给决策模型增加一个专门推测隐藏棋子身份的神经网络。这个看似简单的模块,成为性能跃升的关键。

这不是又一次围棋式胜利
Stratego 是一款双方各有 40 枚棋子的双人战争棋盘游戏,通常在 10×10 的棋盘上进行。玩家可以看到对方棋子的位置,却看不到棋子的具体等级;只有发生攻击后,双方才能知道交战棋子的身份和结果。
Stratego 是一种带有隐藏信息的双人策略游戏,玩家必须在不知道对手完整状态的情况下做出决策。它和国际象棋、围棋最大的区别,是棋盘上并不存在一份所有人都能读取的确定状态。
在围棋里,模型可以完整看到棋盘;在 Stratego 里,一个看起来毫无威胁的棋子可能是最低等级的侦察兵,也可能是能直接改变战局的高等级棋子。玩家面对的不是单纯的“下一步走哪里”,而是三个连续问题:
- 对手手里可能有什么?
- 对手认为我手里有什么?
- 我现在的动作,会让对手对我的棋子产生什么新判断?
这让 Stratego 同时具备了围棋的长期规划、扑克的虚张声势和战场推演中的不确定性。DeepMind 此前曾把 Stratego 称为比国际象棋和围棋更复杂、比扑克更狡猾的游戏,原因就在于它把隐藏信息和大规模状态空间叠加到了一起。
传统的博弈树搜索在这类游戏上很快失去效率。国际象棋程序可以枚举一部分未来局面,围棋程序也能依靠价值网络评估落子质量;但 Stratego 的问题是,模型连当前局面的完整状态都不知道。它需要同时搜索实际局面、可能局面以及对手可能采取的策略,搜索空间会迅速膨胀。
关键突破:先猜棋子,再决定行动
这项新研究最值得关注的技术变化,是把“隐藏信息推理”从决策过程里单独拆了出来。
此前不少系统倾向于直接学习一个动作策略:看到当前棋盘后,预测下一步该移动哪枚棋子。新系统则额外训练了一个神经网络,用来估计对手每枚隐藏棋子的身份。换句话说,它不只是回答“我该走哪一步”,还会先回答“对面这枚棋子最可能是什么”。
这个身份预测网络并不需要百分之百正确。它的作用更像一名参谋:持续维护一张关于对手棋力分布的概率地图。某个隐藏棋子可能有 60% 的概率是中等级单位、25% 的概率是高等级单位、15% 的概率是诱饵,决策模型再根据这些概率判断是否值得发动攻击。
这种设计的价值在于,模型终于可以把“猜测”转化为“行动”。如果一次攻击只在对手棋子是低等级单位时有利,而对手拥有高等级单位的概率已经升高,模型就会选择等待、试探或调动其他棋子,而不是机械地追求眼前收益。
| 对比维度 | 传统完美信息博弈 | Stratego 新系统的处理方式 | |---|---|---| | 棋盘状态 | 双方都能完整看到 | 对手棋子身份被隐藏 | | 核心推理 | 预测未来落子 | 估计隐藏状态并预测未来行动 | | 搜索对象 | 可能的走法和局面 | 可能的棋子身份、策略和走法 | | 错误代价 | 一步坏棋通常可立即评估 | 错误判断可能在数十步后暴露 | | 关键能力 | 局面评估和长期规划 | 状态推断、试探、欺骗和风险控制 |
研究结果显示,单纯扩大训练量并不是解决 Stratego 的有效路径。模型需要一个明确的内部机制,去表示那些尚未被观察到的信息。隐藏棋子预测网络承担的,正是这部分工作。
AI 学会的不是“看穿”,而是管理不确定性
把这项成果描述为 AI “看穿”了隐藏棋子并不准确。更准确的说法是,AI 学会了在不确定性下管理概率。
人类高手也不会把某枚棋子直接认定为某个等级,而是通过位置、移动频率、是否主动交换以及对手此前的战术,逐步缩小判断范围。一个长期不动的棋子,可能是重要单位,也可能是在故意制造假象。对手的一次冒险进攻,可能是在展示实力,也可能是在诱导你暴露关键棋子。
新系统要做的事情与此类似,但它能在大量自我对弈中统计哪些行为值得相信,哪些行为更可能是诱饵。它可以记住一类动作带来的长期结果,而不必依赖人类把“ bluff”“试探”或“牺牲”这些概念手工写进规则。
这也是 Stratego 和扑克的一个重要区别。扑克主要围绕私有牌面和下注信号展开,Stratego 则要求模型同时处理空间位置、棋子能力、交战结果和隐藏信息。一个棋子是否危险,不只取决于它是什么,还取决于它在棋盘上的位置,以及它是否正在被迫承担某种任务。
例如,一枚低等级棋子主动攻击并不一定是在送死。它可能是在迫使对手暴露某个强力单位,也可能是在测试一条通道是否安全。相反,一枚高等级棋子过早移动,也可能泄露自己的身份,让它在后续行动中失去威慑力。
为什么这次结果比 DeepNash 更值得关注
DeepNash 是 2022 年 Stratego 研究史上的重要系统。它由 DeepMind 开发,通过自我对弈和专门的博弈论方法,达到了人类专家水平。公开资料显示,DeepNash 在与其他 AI 机器人进行的大量对局中胜率达到 97%,与人类专家对战时胜率达到 84%。
DeepNash 的突破证明了 AI 可以在没有人工棋谱的情况下,从零开始学习隐藏信息博弈。但这次新研究的重点有所不同:它不仅追求更强的对弈成绩,还强调训练效率、计算成本和跨游戏泛化能力。
| 系统或方法 | 主要特点 | 公开结果或定位 | |---|---|---| | 传统 Stratego 程序 | 依赖规则、局部搜索或浅层策略 | 多数停留在业余水平 | | DeepNash | 自我对弈、博弈论训练、无需人工棋谱 | 达到人类专家水平;对人类专家胜率曾报告为 84% | | 本次新系统 | 决策网络结合隐藏棋子身份预测网络 | 大幅击败顶尖人类玩家,训练成本和计算需求更低 | | 完美信息博弈模型 | 可直接观察完整棋盘状态 | 不适合直接处理 Stratego 的隐藏状态 |
这意味着,Stratego 的突破可能不再只是某一个超大规模实验的结果。研究团队称,新系统在性能更高的同时,训练所需的计算资源更少,且在规则不同、设计不同的其他策略游戏中也表现出泛化能力。
这点很关键。一个只能在固定棋盘上赢棋的系统,更多是专用程序;一个可以把隐藏状态建模方法迁移到其他规则环境的系统,才更接近通用决策组件。前者证明“这款游戏能被攻克”,后者则开始回答“这套方法能不能处理现实问题”。
便宜训练,比单纯堆算力更有价值
这项成果还反驳了一个正在变得普遍的直觉:只要增加模型规模和训练算力,复杂推理问题就会自然解决。
Stratego 的难点并不是模型不知道足够多的知识,而是模型缺少对隐藏状态的结构化表示。让一个没有这种表示能力的模型进行更长时间自我对弈,可能只会让它更熟练地重复错误判断。新系统采用额外的身份预测网络,相当于给训练过程增加了一个可学习的中间目标。
这个中间目标有两个作用。第一,它让模型能够把对手棋子的隐藏身份作为独立变量进行估计,而不是把所有信息压缩进一个难以解释的动作预测器。第二,它能为决策网络提供更稳定的训练信号,让模型知道自己为什么做出某个风险判断。
从机器学习的角度看,这是一种将状态估计和策略学习结合起来的思路。状态估计负责回答“世界可能是什么样”,策略网络负责回答“在这些可能性下应该做什么”。两者分工之后,模型更容易在信息逐步揭示的环境里保持稳定。
现实世界中的很多决策也遵循同样的结构。网络安全系统无法直接看到攻击者下一步动作,谈判系统无法知道对方的底线,企业经营者也无法完整掌握竞争对手的库存、预算和产品计划。它们面对的不是一道有唯一答案的题,而是一组不断更新的可能性。
对 AI 应用的启发:推理模型需要“信念状态”
这项研究给大模型和智能体开发者的启发,是下一代推理系统不能只保存事实,还需要维护对未知状态的判断。
“信念状态”是智能体对环境中不可直接观察变量的概率化表示。它不是一句确定答案,而是对多种可能情况及其可信度的持续记录。
当前许多 AI 智能体在网页操作、自动编程和多步骤任务中,仍然倾向于把观察到的文本直接转换成下一步动作。遇到权限不明、页面状态变化或外部系统反馈延迟时,模型很容易把猜测当成事实,随后在错误前提上连续执行。
Stratego 的做法提供了一个更稳妥的方向:
- 把已观察到的事实和模型推断分开保存;
- 为关键未知变量维护多个候选解释;
- 根据新证据更新这些解释的概率;
- 在行动前计算错误判断的潜在代价;
- 必要时优先采取信息获取动作,而不是直接追求任务收益。
在网络安全场景中,这可能对应对攻击来源、权限范围和恶意行为意图的概率判断。在商业谈判中,它可能对应对方真实预算、时间压力和底线的估计。在自动驾驶或机器人系统中,它则对应对遮挡区域、行人意图和其他车辆行为的预测。
当然,棋盘游戏与现实世界之间仍有明显距离。Stratego 的规则固定、状态有限、反馈最终可验证;现实环境往往开放、噪声更大,而且错误决策可能带来不可逆损失。不能因为 AI 赢了 Stratego,就直接宣布它已经具备可靠的商业谈判或网络防御能力。
但这项研究至少说明了一件事:处理未知信息不一定需要把所有可能情况暴力搜索一遍。更现实的路径,是让模型学习如何压缩不确定性、更新判断,并在信息不完整时控制风险。
真正的竞争点从“会不会推理”转向“如何表示未知”
过去几年,AI 游戏研究的主线往往是扩大搜索深度、提升价值估计,或通过自我对弈获得更强策略。Stratego 的新结果把注意力推向了另一个问题:模型是否拥有表示未知信息的合适结构。
如果模型无法区分“我知道”和“我猜测”,它就很难在隐藏信息环境中稳定行动。如果模型只能给出单一判断,而不能保留多个可能世界,它也很难处理对手的欺骗和策略变化。
因此,这次突破的价值不只是一场胜负。它把 AI 的决策能力从“在完整信息下找到最优动作”,推进到“在信息不完整时维护判断并选择风险可控的动作”。这类能力对智能体、机器人、网络安全和复杂商业决策的意义,可能比又一个棋类冠军更大。
截至 2026 年 10 月 1 日,研究团队公开的信息还没有给出新系统所有训练细节、完整模型规模和每项基准的具体胜率,因此不宜把它包装成已经解决了现实世界不确定性推理。但可以确定的是,Stratego 这道困扰 AI 多年的题,已经出现了比单纯堆算力更清晰的解法:让模型专门学习隐藏状态,再让决策系统基于这些概率做选择。
AI 终于赢下 Stratego,真正被攻克的也许不是这块 10×10 的棋盘,而是一个更普遍的问题:当关键事实藏在视野之外时,机器能不能知道自己不知道什么,并据此行动。



