GoBench:LLM离棋力还很远

最新 GoBench 用 9×9 围棋测试大模型推理能力,结果与 ARC-AGI 2 得分高度相关,但前沿模型最高仅 2500 Elo,仍明显落后于达到 4400 Elo 的 KataGo。
GoBench:LLM离棋力还很远
截至 2026 年 9 月 16 日,GoBench 正在用一项看起来“像游戏、其实更像压力测试”的方法重新衡量大语言模型推理能力:让模型直接下 9×9 围棋,并与从随机玩家到超人级别的 KataGo 对手进行梯度对战。
GoBench 是一个通过围棋对局评估大语言模型通用推理能力的基准测试。它目前披露的结果显示,模型在 GoBench 上的表现与 ARC-AGI 2 得分高度相关,相关系数达到 r=0.83;但即使是最新前沿模型,棋力依然明显落后于专门训练的围棋程序。
目前公开结果中,GPT-6 Astra 的最高成绩约为 2500 Elo,而 GoBench 使用的顶级 KataGo 对手达到约 4400 Elo。如果允许模型使用编码工具,并在正式评测前准备两个小时,Codex 搭配 Astra 的成绩可以提升到 3560 Elo。这说明工具和搜索能够显著补足模型的短板,但也说明“会写代码”和“具备稳定、深层的状态推理能力”并不是一回事。

一项把“会解释”变成“必须下对”的测试
围棋棋盘是一个高分支、高耦合的决策空间。模型不能只给出一段听起来合理的分析,而必须在有限候选点中落下一手,并承担这一步对后续局面的真实影响。
GoBench 的核心设计,是让模型与一组不同强度的 KataGo 对手比赛,而不是只用一个固定难度的程序判断输赢。KataGo 是开源围棋引擎和棋力评估系统,能够通过蒙特卡洛树搜索、神经网络评估和自我对弈,在棋盘上进行远超人类直觉速度的局面搜索。
这组梯度对手可以理解为一把“可调节的尺子”:随机级别用于确认模型是否理解最基本的落子规则,较低强度的 KataGo 用于区分模型是否掌握吃子、连接、逃跑等局部战术,更高强度的对手则会考验模型对厚势、先手、劫争、攻防转换和全局价值的理解。
传统语言模型基准经常把任务压缩成选择题、短答案或代码补全。GoBench 则要求模型持续维护一个不断变化的棋盘状态。每一手棋都可能改变几十个交互位置的价值,模型必须记住过去的落子、判断当前的局部战斗,并预测若干手之后的结果。
这也是围棋比很多“看起来复杂”的问答题更难的一点:答案不是一句话,而是一条需要连续执行的决策链。模型可以在解释中说出“这里应该保持主动权”,但如果它随后在错误的位置落子,棋局会直接给出负反馈。
关键结果:与 ARC-AGI 2 高相关,但仍未饱和
GoBench 与 ARC-AGI 2 的成绩相关系数达到 0.83,这意味着两项测试在当前参与评测的模型之间呈现出很强的同向变化关系。
ARC-AGI 2 是面向抽象推理和新规则迁移能力的基准测试,重点不在记忆训练数据,而在于模型能否从少量示例中归纳规则,并将规则应用到陌生问题上。GoBench 与它表现出高相关,说明围棋对战结果可能不只是反映棋类知识,更可能捕捉到模型的状态跟踪、规则归纳、长期规划和错误修正能力。
不过,相关性不等于两项测试测量的是同一件事。ARC-AGI 2 通常以离散图形任务考查模型能否发现隐藏规律;GoBench 则把推理放进连续对抗环境中。前者更像“从几道例题中找出考试规则”,后者更像“在规则固定但局面不断变化的比赛里,持续做出不能反悔的决定”。
GoBench 目前仍处于高度未饱和状态。所谓“未饱和”,是指最强模型距离测试上限仍然很远,模型之间的差距没有被满分或天花板压扁。一个基准如果所有前沿模型都接近满分,就很难继续区分下一代系统;而 GoBench 的 2500 Elo 对比 4400 Elo,留下了非常明显的性能空间。
这点相当重要。过去几年,一些问答和知识型榜单在模型更新后很快失去区分度,模型只需依靠更大的训练规模或更强的检索就能获得高分。GoBench 的结果则表明,至少在持续规划和棋局状态维护上,语言模型还没有接近专用系统的能力边界。
公开结果对比
| 参评系统 | 评测条件 | GoBench 最高公开成绩 | 与 KataGo 顶级水平的差距 | |---|---|---:|---:| | GPT-6 Astra | 直接进行对局 | 约 2500 Elo | 约 1900 Elo | | Codex + Astra | 使用编码工具,评测前准备 2 小时 | 约 3560 Elo | 约 840 Elo | | KataGo 梯度对手 | 专用围棋引擎 | 最高约 4400 Elo | 作为参照上限 |
需要注意的是,Elo 是相对等级分,而不是可以跨所有评测体系直接换算的绝对智力分数。GoBench 中的 Elo 主要用于表示模型在这套 KataGo 对手梯度中的相对棋力,因此不能简单地把 2500 Elo 等同于某个现实世界棋手等级,也不能据此断言模型具备与人类职业棋手完全相同的棋力结构。
但差距本身依旧有解释价值:在同一套棋盘、规则、对手和计分体系下,GPT-6 Astra 与顶级 KataGo 之间相差约 1900 Elo,说明通用语言模型距离专门优化的搜索型系统仍有显著距离。
两小时准备带来 1060 Elo 提升,工具到底补了什么
Codex 搭配 Astra,在允许编码工具并提前准备两个小时后达到约 3560 Elo,相比 Astra 直接对局的 2500 Elo 提升约 1060 Elo,相对分数差约 42.4%。这个结果是 GoBench 目前最值得关注的部分之一。
它说明模型的失败并不完全来自“不会围棋”。更准确地说,语言模型本体在直接回答时缺少几个关键组件:
- 可靠的棋盘状态表示:模型需要精确知道每个交叉点的颜色、气和连接关系,不能依赖容易出错的自然语言记忆。
- 合法性检查:自杀、重复局面、提子后的棋形变化,都需要程序级规则判断。
- 候选着法搜索:只凭一次直觉生成往往会错过局部强制手,代码可以批量枚举和比较候选点。
- 局面评估:模型可以调用工具统计连通块、气、地盘和局部交换结果,再把结果带回推理过程。
- 长程记忆:棋局持续几十甚至上百手时,外部棋盘和日志比上下文中的自然语言描述更稳定。
换句话说,工具把“凭感觉下一手”改造成了“先维护状态,再枚举候选,最后选择动作”。这与软件工程中的调试、规划和搜索流程非常接近。
但 3560 Elo 仍低于 KataGo 的 4400 Elo。工具可以给模型装上棋盘、规则检查器和搜索脚手架,却没有自动把模型变成高效的围棋评估器。它仍然可能在候选手排序、全局取舍和复杂劫争中做出不稳定判断。
这对 Agent 评测有直接启发:如果只测模型一次性输出,可能低估了“模型加工具”的系统能力;如果只测工具搜索,又可能把真正的推理工作转移给外部程序。更有价值的评测,应当分别报告裸模型、工具增强模型以及专用搜索程序的表现。
为什么围棋适合检验大模型推理
围棋是一个同时具备明确规则、巨大状态空间和长期反馈的推理环境。棋盘规则简单到可以形式化,但局面价值高度复杂,模型无法只靠背诵规则获得高分。
在 9×9 棋盘上,状态空间已经足够制造大量分支,同时又比 19×19 更容易控制评测成本和对局长度。对于基准设计者而言,9×9 版本可以在更短时间内完成大量对局,也便于持续更新排行榜;对于模型而言,小棋盘并不等于简单,因为每一手棋的相对影响更集中,局部失误更容易迅速转化为全局劣势。
围棋还具有一个适合评测的特性:结果是可验证的。模型可以解释自己为什么选择某一步,但最终胜负由对局决定。研究者不必依赖人工判断“这段思维链是否听起来合理”,而是可以通过对手强度、胜率和等级分观察模型是否真的做对了决策。
当然,围棋并不是通用推理的完整代理。它有固定规则、离散动作和明确胜负,无法覆盖现实任务中的语言理解、社会常识、开放式创造和不完整信息决策。因此,GoBench 更适合作为通用推理评测组合中的一项,而不是取代所有基准。
对模型评测的意义:从答题分数转向行为能力
GoBench 的价值,不在于证明“会下围棋的模型更聪明”,而在于提供了一种可执行、可复现的行为测试。
第一,它把模型的长期一致性暴露出来。很多模型在单轮问题上能够给出漂亮分析,但在连续任务中会遗忘状态、重复犯错或前后矛盾。围棋对局会把这些问题累积成真实损失。
第二,它能区分模型本体与系统工程的贡献。GPT-6 Astra 直接对局约 2500 Elo,而 Codex 加工具达到约 3560 Elo,差距说明“模型能力”和“模型如何被编排”需要分开记录。未来的智能体产品,最终竞争的可能不是裸模型榜单,而是状态管理、搜索、工具调用和反馈机制的整体质量。
第三,它为推理时间扩展提供了更具体的观察窗口。让模型思考更久、调用更多工具、生成更多候选,并不保证每次都更强;如果额外搜索没有稳定转化为更高胜率,说明瓶颈可能在价值评估,而不是计算预算。
第四,GoBench 的排行榜具有持续更新空间。只要对手梯度、时间限制和评测协议保持稳定,研究者就可以观察新模型是否缩小与 KataGo 的差距,而不是只看某个版本在静态题库上的一次性分数。
目前仍需关注的评测细节
GoBench 的公开结果很有冲击力,但在解读之前,仍应关注几个技术变量。
- 对局数量与置信区间:Elo 需要足够多的对局才能稳定。如果不同模型的对局数不一致,或缺少胜率置信区间,细小排名差异不宜过度解读。
- 时间和计算预算:模型每步可用的响应时间、上下文长度、工具调用次数,都会影响最终棋力。没有统一预算时,模型分数更像系统成绩,而不是纯模型成绩。
- 提示词和棋盘编码:棋盘如何序列化、模型是否能看到历史落子、是否允许重新检查局面,都会显著改变结果。
- 随机性与重复测试:同一个模型在采样温度、搜索策略和工具失败时的表现可能不同,排行榜最好提供多次运行结果。
- 对手分布:如果模型只与某一类 KataGo 配置比赛,可能出现针对性适应。随机、低强度、中强度和超人级对手的组合更能减少这种风险。
这些问题并不会削弱 GoBench 的主要结论,但会决定它能否从一个有趣的实验,成长为长期可比较的标准基准。
OpenAI Hub 判断:真正的差距不在“会不会下棋”
我们的判断是,GoBench 最有价值的地方,不是把大模型拉到围棋赛场上与 KataGo 比输赢,而是揭示了当前模型在“持续维护一个可计算世界”方面仍然不够可靠。
GPT-6 Astra 直接达到 2500 Elo,已经说明前沿模型能够理解基本规则、识别部分棋形并进行一定程度的局部规划;但距离 KataGo 的 4400 Elo 仍有约 1900 Elo 差距,说明语言流畅、知识丰富和稳定搜索之间依旧存在断层。
Codex 加 Astra 在两小时准备后达到 3560 Elo,则展示了另一条更现实的路线:未来更强的智能体未必只靠扩大语言模型参数,而可能依赖模型、外部状态、代码工具、搜索算法和验证器的组合。问题在于,这种组合能否在围棋之外迁移到软件工程、科学研究和复杂业务流程中。
GoBench 现在还没有被前沿模型“刷满”,因此值得继续跟踪。接下来真正值得看的,不只是排行榜第一名是谁,而是模型能否在不针对特定棋盘格式调优的情况下,稳定缩小与 KataGo 的差距;以及这些能力是否会同步反映在 ARC-AGI 2、代码代理和现实世界长任务中。
至少截至今天,答案仍然是否定的:大模型可以解释围棋,可以借助工具下得更好,但距离像 KataGo 那样稳定、深度、可验证地规划棋局,还有很长一段路。


