Nonobench开源,49个模型数织大考
Nonobench 开源了一套面向大语言模型的数织推理基准,测试 49 个模型在无工具、单次作答条件下还原完整网格的能力。结果显示,模型在 15×15 规模上的平均解题率已降至 20%,复杂约束下多数模型直接失效。
Nonobench开源:一次测评49个大语言模型的数织推理能力
大语言模型正在被拉到数织(Nonogram)面前,接受一次更接近“约束满足问题”的推理测试。
近日,Nonobench 开源了一套专门评测大语言模型数织能力的基准。数织是一类根据行、列提示数字推断黑白网格填法的逻辑谜题,也被称为 Picross 或 Pic-a-Pix;模型必须同时满足所有行约束和列约束,才能还原唯一图案。
这项测试的设计很简单:给模型一组行提示和列提示,让它直接返回完整网格。过程中不允许调用工具,每道题只有一次作答机会。真正让测试有价值的地方在于,它没有停留在“模型能不能看懂题目”,而是把模型推到了计数、状态跟踪、回溯和全局一致性这些更容易出错的环节。

15×15之后,模型的推理能力开始明显失速
Nonobench 的核心结果显示,数织尺寸从 5×5 增加到 15×15 后,模型的最佳解题率从 85% 下降到 20%。
这个下降幅度比普通问答基准中的分数变化更值得关注。题目尺寸只增加了几倍,模型面对的候选状态空间却会快速膨胀。5×5 网格通常可以依靠局部提示和少量排除完成;到了 15×15,模型必须在几十甚至上百个局部判断之间保持一致,任何一次漏数、错位或误填,都会让最终网格整体失效。
| 网格规模 | 模型最佳努力水平下的解题率 | 主要考验 | |---|---:|---| | 5×5 | 85% | 基础计数、直接填充 | | 10×10 | 46% | 行列交叉约束、状态跟踪 | | 15×15 | 20% | 全局一致性、回溯与长链推理 |
这里的“解题率”指模型返回的完整网格是否与标准答案完全一致,而不是局部填对了多少格。对数织而言,局部正确并不等于解题成功:一个黑格放错位置,就可能导致某一行的连续块数量错误,并进一步破坏多列约束。
这也是 Nonobench 与一些只统计最终选项的推理测评之间的区别。模型不能靠选择一个看起来最合理的答案过关,它必须输出一个结构完整、尺寸正确、每一行每一列都满足条件的结果。
测试覆盖49个模型,130个模型配置
Nonobench 共评测了 49 个大语言模型,并进一步覆盖 130 个不同变体。变体主要来自不同的推理努力等级、模型设置和调用渠道,测试尽量固定到各模型实验室自己的服务端点,以减少第三方封装带来的干扰。
这种设置让排行榜不再只是“模型名称对模型名称”的比较。一个模型在低推理强度下可能更快,但在复杂数织上容易漏掉约束;提高推理强度后,准确率可能上升,同时成本和耗时也会明显增加。因此,同一个模型的结果必须结合配置一起看。
补充结果中,多个模型在标准题上的最高解题率达到 76.7%,包括 Muse Spark 1.3xhigh、Gemini 3.1 Pro Preview high、GPT-5.4xhigh、Kimi K3max 和 Claude Fable 5.1xhigh。Qwen3.8 Flash on 与 GPT-5.2 high 达到 66.7%,Claude Opus 4.5 high 和 Gemini 3 Pro Preview high 为 60.0%。
这些数字不能简单理解成模型的通用智力排名。Nonobench 测量的是一种非常具体的结构化推理能力,而且样本规模有限,部分模型之间的差距可能落在统计误差范围内。比如 30 道标准题中,76.7%意味着答对约 23 道;66.7%意味着答对约 20 道,三道题的差距足以改变名次。
| 模型变体 | 标准题解题率 | 评测成本 | 评测耗时 | |---|---:|---:|---:| | Muse Spark 1.3xhigh | 76.7% | 3.40 美元 | 49分53秒 | | Kimi K3max | 76.7% | 14.52 美元 | 6小时56分 | | GPT-5.2 high | 66.7% | 10.86 美元 | 4小时12分 | | Qwen3.8 Flash on | 66.7% | 0.73 美元 | 6小时16分 | | Claude Opus 4.5 high | 60.0% | 23.08 美元 | 4小时45分 | | Qwen3.8 Max minimal | 60.0% | 4.82 美元 | 5小时05分 |
成本与速度的差异说明,准确率并不是部署决策的唯一变量。Qwen3.8 Flash on 的标准题成绩与 GPT-5.2 high 相差一个档位,但测评成本只有 0.73 美元;Kimi K3max 与 Muse Spark 1.3xhigh 同为 76.7%,成本却相差约 4.3 倍,耗时也相差数小时。
对开发者来说,这类结果比一个孤立的最高分更有参考价值。需要批量处理结构化任务时,模型是否能在较低成本下稳定保持格式,往往比偶尔解出一道最难题更重要。
GPT-6 Astra拿下标准题全通,Claude Opus 5.5在困难模式领先
GPT-6 Astra 在 Nonobench 的 30 道标准题中全部答对,是标准模式中表现最突出的模型。标准模式包含 5×5 到 15×15 的 30 道题,题目来自 Moyà-Alcover 的 Nonograms 数据集,并采用 CC BY 4.0 授权。
不过,标准模式的满分并不代表模型已经解决了数织推理问题。它更像是一个分水岭:模型可以在常规尺寸和较强推理设置下,完成一批规模逐步增加的题目,但当题目进一步扩大、结构变得更紧时,稳定性仍然会迅速下降。
困难模式包含 10 道随机生成的 20×20 数织,每道题都经过检查,确保只有一个解。其中 5 道题无法只依靠逐行、逐列的简单逻辑完成,需要模型进行更复杂的候选假设、冲突检测和回溯。
困难模式是 Nonobench 最有区分度的部分。Claude Opus 5.5 解出 10 道中的 8 道,而参与测试的 15 个模型中,有 11 个模型一道都没有解出。这个结果很残酷:模型在较小网格上的高分,并不能自然外推到 20×20 的复杂约束问题。
“线逻辑”是指只根据当前行或列中已经确定的连续块,逐步推出必填和必空位置的解题方法;当线逻辑无法继续时,模型需要对候选格进行假设,并检查假设是否会造成后续矛盾。困难模式刻意加入无法仅靠线逻辑完成的题目,就是为了观察模型是否具备这种回溯能力。
输出格式本身,也成了模型的障碍
Nonobench 发现,很多模型还没有走到最复杂的逻辑阶段,就已经在输出格式上出错。
在把整个 20×20 网格压缩成一个包含约 400 个字符的长字符串时,不少模型会出现行数错误、字符数量错误、标记丢失或位置偏移。模型可能在解释中正确描述了几行逻辑,但最终答案少输出一行,或者把一个黑格和一个空格混在一起,导致整题判错。
因此,困难模式要求模型返回由 20 个行字符串组成的数组。每个数组元素对应一行,评测系统可以直接检查行数、列数和每一个格子的状态。这一改动看起来只是格式调整,实际却把“长序列记忆”和“逻辑求解”两个问题拆开了。
这对开发者有一个直接启示:结构化输出并不只是产品层面的体验优化,它会影响模型能否完成任务。让模型一次生成一段 400 字符的连续结果,等于额外增加了计数和定位负担;拆成 20 行以后,模型仍然需要解题,但更少被纯粹的格式错误拖垮。
不过,结构化输出也不能掩盖模型的逻辑缺陷。如果模型把某一行填错,数组格式再规整也没有意义。Nonobench 的价值就在于,它同时暴露了两类问题:模型是否推得出来,以及模型能否把推理结果可靠地写出来。
这不是“模型不会数织”,而是长链状态管理仍然脆弱
数织测试暴露的核心问题,是大语言模型在长链状态管理上的脆弱性。
语言模型擅长根据上下文预测下一个 token,但数织要求它持续维护一个离散状态表:哪些格子已经确定为黑,哪些格子确定为空,哪些格子仍有候选;每一次新判断都必须同时满足行约束和列约束。这个过程更接近一个小型约束求解器,而不是普通的自然语言推断。
模型能够“说出”一个解题步骤,不代表它真的在内部维护了完整棋盘。它可能先正确处理第 1 行,又在第 7 行重新计算时忘记第 3 列已经被占用;也可能在长思考过程中改变早先的假设,却没有同步修正已经输出的网格。
这也是为什么工具增强通常会改变这类任务的结果。如果允许模型调用程序,它可以把网格交给专门的约束求解器、SAT 求解器或回溯搜索程序处理,语言模型只负责解析提示和展示结果。但 Nonobench 的测试条件明确禁止工具,测量的是模型本身在无外部状态管理时的能力。
对于 AI Agent 和代码代理来说,这个差异非常现实。一个模型在聊天窗口里解数织的成功率,不能直接代表它在真实软件工程任务中的可靠性;但它揭示了一个共同风险:当任务需要维护大量离散中间状态时,仅靠模型生成文本可能不够稳定。
成本、推理强度和准确率之间没有免费午餐
Nonobench 的成本数据表明,提高推理强度通常要付出时间和费用代价,但更高配置也不一定让所有模型都获得同样幅度的提升。
例如,Muse Spark 1.3xhigh 达到 76.7%,评测成本为 3.40 美元,耗时约 50 分钟;Kimi K3max 同样达到 76.7%,成本为 14.52 美元,耗时接近 7 小时。两者的准确率相同,但资源消耗完全不同。
Qwen3.8 Flash on 的标准题解题率为 66.7%,成本仅 0.73 美元,但总耗时达到 6 小时 16 分钟。这个组合说明“便宜”和“快”并不是一回事:模型单次调用价格低,不代表整套评测就能快速完成,排队、输出长度和推理过程都会影响总时长。
实际选型时,开发者需要先确定任务约束。如果任务允许异步运行,低成本模型可能更合适;如果需要尽快得到高置信度结果,则应关注端到端延迟;如果错误代价很高,则还要加入独立校验器,而不能只看排行榜上的最高准确率。
评测值得关注,但不能被一个分数牵着走
Nonobench 的最大贡献,是把“结构化推理的可靠性”从抽象讨论变成了可复现的公开测试。
它的题目规则清楚,输出判定明确,同时提供标准模式和困难模式,能够区分模型在小规模局部推理、较大规模全局约束和复杂回溯上的不同表现。对于模型开发者,这类基准可以帮助定位问题究竟来自推理能力、状态记忆还是输出格式;对于使用者,它也提供了一个观察模型稳定性的窗口。
但这套基准仍有明确限制。每道题只有一次作答,无法衡量模型通过自我检查、重试或多候选投票提升准确率的能力;测试规模也不大,30 道标准题和 10 道困难题不足以支撑非常精细的模型排名;不同模型的推理强度、输出长度和服务端设置也可能影响成本与耗时的可比性。
此外,数织是高度离散的逻辑任务,结果不能直接推导出模型在数学、代码、事实问答或现实世界规划中的综合能力。一个模型可能在数织上失分,却在软件工程中依靠工具调用和执行反馈取得更好结果;也可能在语言表达上非常流畅,却无法稳定维护一个 20×20 的状态矩阵。
更合理的用法,是把 Nonobench 当成模型能力画像中的一块拼图。它特别适合回答一个具体问题:当模型不能调用外部工具,必须长时间维护结构化约束时,它能否把每一步判断保持一致,并最终生成一个完全正确的结果?
从目前结果看,答案仍然是“只有少数模型在特定配置下可以”。GPT-6 Astra 在标准模式全通,Claude Opus 5.5 在困难模式解出 8/10,说明前沿模型已经能够处理一部分复杂数织;但 15 个模型中有 11 个在困难模式零解,也说明长链回溯和全局状态管理依旧是大语言模型的硬问题。
如果未来版本继续扩大困难题数量,引入多次作答、自我验证、工具辅助和执行反馈等条件,Nonobench 可能会从一次趣味性较强的逻辑测评,发展成观察模型“能否可靠完成结构化任务”的长期基准。对今天的开发者而言,最值得记住的结论只有一个:模型会解释推理过程,和模型能把每个格子都填对,仍然是两回事。
参考来源
- Nonobench:49个大语言模型数织评测介绍:包含评测方法、标准模式与困难模式设置,以及主要结果。
- Moyà-Alcover Nonograms 数据集:原帖中说明标准题使用该数据集,数据采用 CC BY 4.0 授权。



