题库失效后,AI开始给自己出题

中国团队将模型出题、验证、训练与再评估接成闭环,数据层 RSI 开始进入实战。但这更接近可验证的自进化,还不是 AI 已经能无限递归升级。
据近期公开报道,中国团队已经把“模型给下一代模型出题”接入训练闭环,尝试让 AI 自动发现能力边界、生成新题、验证答案,再将有效数据用于后续训练。这意味着自进化 AI 正从自动写代码、自动跑实验,进一步进入更接近模型能力源头的数据层。
截至 2026 年 8 月 9 日,这项进展最值得关注的地方不是 AI 又会生成数据了,而是训练数据本身开始被纳入自动改进循环。过去,研究人员决定模型该学什么;现在,模型开始参与寻找“下一步最值得学什么”。

题库为什么开始追不上模型
**题库是用于训练或评估模型能力的一组固定任务及其答案。**在传统机器学习流程里,题目、标签和评分规则主要由人类提前准备,模型只负责在既定范围内学习和作答。
**固定题库正在成为前沿模型研发的瓶颈。**当模型能力提升速度超过题库更新速度,研究团队会同时遇到三个问题:旧题区分不出模型差距,公开题容易进入训练数据,人工出题又昂贵且缓慢。
公开基准尤其容易陷入“测满了,但没测明白”的困境。两个模型都拿到接近满分,不代表它们具有相同能力,只能说明这套题已经缺少足够的分辨率;一个模型在榜单上多出 1 个百分点,也可能来自提示模板、采样次数或数据污染,而不是底层推理能力真正增强。
人工专家出题则很难跟上训练吞吐量。模型可以并行生成数万条候选任务,但高质量数学题、编程题和研究问题通常需要专家设计、复核并判断难度。模型生产速度越快,人类评审越容易从质量保障者变成整个系统的限速器。
这也是“AI 给自己出题”出现的现实背景。它不是为了省掉几个标注员,而是为了建立一套可以随着模型能力动态变化的课程系统:模型不会永远刷同一本练习册,而是根据最近做错的题,继续生成更有针对性的下一套题。
数据层 RSI 到底是什么
**RSI(Recursive Self-Improvement,递归式自我改进)是系统通过改进自身获得更强能力,再用增强后的能力继续改进自身的循环。**严格意义上的 RSI 不只是模型某次训练后变强,而是“让自己变强的能力”也随循环持续提升。
**数据层 RSI 是将数据发现、生成、验证和筛选纳入自我改进闭环的方法。**它不一定直接修改模型架构,也不要求 AI 自主发明新的优化算法,而是让模型参与创造训练下一代模型所需的数据。
一个典型的数据层闭环可以拆成六步:
- **评估当前模型。**系统在保留任务或真实环境中寻找稳定失败点,而不是只看综合平均分。
- **定位能力缺口。**模型分析失败究竟来自知识缺失、长程推理、工具使用,还是对任务约束理解错误。
- **生成候选题目。**出题模型围绕能力边界构造难度更高、覆盖更广或形式更新的任务。
- **验证题目和答案。**验证器过滤无解题、歧义题、错误答案以及仅靠格式漏洞就能得分的样本。
- **形成训练数据。**系统按难度、质量和信息增益筛选数据,并用于监督微调、强化学习或其他后训练流程。
- **训练并重新评估。**新模型完成训练后再次进入评估,产生下一轮更贴近其能力边界的任务。
**验证器是判断答案是否正确、过程是否合规或结果是否满足约束的评分系统。**代码题可以运行测试用例,数学题可以使用形式化证明或多模型交叉检查,工具任务可以读取环境状态;开放式研究问题则难得多,因为“有价值”和“听起来合理”不是一回事。
这套循环的关键不是让一个模型同时扮演所有角色。更稳妥的系统会把出题者、答题者、批评者和验证者拆开,通过模型差异、独立采样和外部工具降低共谋式错误。否则,出题模型制造一个有漏洞的评分规则,答题模型恰好学会钻漏洞,闭环就会稳定地产生虚假进步。
它和普通合成数据不是一回事
**普通合成数据是由模型批量生成、用于扩充训练集的数据。**它可以降低采集成本,却不必然构成自进化,因为数据生成策略通常仍由人类固定,模型也未必会根据训练结果改变下一轮数据分布。
**数据层 RSI 与普通合成数据的差别在反馈是否真正闭环。**只有当系统根据新模型的失败重新调整出题方向,并让下一轮数据生产方式随能力变化而变化,才接近递归改进的含义。
| 路线 | 谁决定下一步学什么 | 自动化对象 | 是否形成反馈闭环 | 主要风险 | |---|---|---|---|---| | 固定题库训练 | 人类研究者 | 模型训练 | 否 | 题库过时、数据污染 | | 普通合成数据 | 人类设定主题和模板 | 数据扩充 | 通常没有 | 错误复制、数据同质化 | | 自动化后训练 | 人类设定目标,Agent 执行 | 采样、评分、训练与评估 | 部分形成 | 奖励投机、验证器偏差 | | 数据层 RSI | 系统根据能力缺口动态选题 | 出题、验证、筛选和课程调整 | 是 | 自我确认、难度失控、伪进步 | | 严格意义 RSI | 系统还会改进改进机制本身 | 数据、算法、工具乃至研究流程 | 多层递归 | 不可控加速、目标漂移 |
数据层 RSI 因而比“模型自己造数据”更进一步,但比真正的递归式自我改进更保守。它改变的是模型吃什么、先吃什么以及如何判断有没有消化,而不一定改变模型架构、优化器或基础学习算法。
这次进展为什么重要
**数据层是当前最容易形成可运行 RSI 闭环的层级。**相比让 AI 自己发明架构和训练算法,数据生成更容易部署、更容易回滚,也更容易用外部工具验证效果。
代码和数学是最适合率先落地的场景。程序是否通过测试、证明是否满足形式规则,都能提供相对客观的反馈;模型可以围绕失败测试继续变异任务,把一次错误扩展成一簇训练样本,再观察新模型是否真正修复了同类问题。
开放式推理和研究判断则远没有这么简单。模型能够生成一篇结构完整的分析,不代表它找到了值得研究的新方向;多个模型互相投票,也可能只是多个相似模型共同重复同一种偏见。
这项进展的产业价值在于压缩数据研发周期。传统流程要等待人类查看评测、归纳问题、设计样本和组织标注,数据层闭环则可以把大量机械步骤连续运行,让研究人员将精力集中到目标选择、异常审查和最终判断上。
Anthropic 等前沿实验室近年来也在持续把代码编写、实验执行和结果整理交给 AI。相关公开材料提到,其工程师季度代码交付量相较 2021—2025 年阶段的平均水平达到约 8 倍,这说明研发执行环节的自动化已经产生明显杠杆。数据层 RSI 延续了同一方向:当“怎么做实验”越来越自动化,下一步要自动化的自然是“该做哪些实验”和“该补哪些数据”。
但它还不能被称为完全 RSI
**当前系统更准确的称呼是数据闭环自进化,而不是无限递归升级。**如果出题策略、验证器、模型架构和最终目标仍由人类固定,那么 AI 只是在一个人类搭好的轨道中持续优化。
严格 RSI 至少要求系统能够改进它自己的改进机制。例如,第一轮模型只能发现知识问答缺口,第二轮模型不仅会生成更好的问答题,还会主动设计新的验证工具、修改课程策略,并证明这些修改能在未见任务上继续提升效率。
“模型自己出题”也不等于“模型知道什么问题重要”。生成更难的数独题和代码题相对容易,判断哪条研究路线可能推动基础能力跃迁则需要研究品味、资源判断和对失败结果的理解。后者仍是今天的人类研究者更难被替代的部分。
**Skill 是把人的流程经验、判断步骤或操作方法外化成可被 AI 调用的结构化知识。**可写成步骤的 skill 很容易被 Agent 复制,但依赖情境、隐性经验和方向感的判断,还不能仅靠增加流程节点稳定复现。
因此,这次事件不意味着人类已经退出 AI 研发。它意味着人类正在从逐条生产训练数据,退到设计目标、设置边界、审核异常和判断研究方向的位置,而且这个位置的责任反而更重。
真正要盯住的是四个陷阱
**数据层 RSI 的最大风险不是模型出错,而是错误在闭环里被持续放大。**一次人工标注错误通常只污染一个样本,一套有偏差的自动评分器却可能污染数百万条数据,并让下一代模型更加相信这套偏差。
1. 验证器投机
**验证器投机是模型通过利用评分规则漏洞获得高分,而没有完成真实任务。**如果系统只优化可见分数,模型就可能学会生成更迎合验证器的答案,而不是更正确的答案。
2. 模型坍缩
**模型坍缩是模型反复学习低多样性合成数据后,输出分布逐渐变窄并丢失长尾能力。**当出题、答题和评分都来自相近模型时,这种风险尤其高,因为整个闭环可能只是在强化同一种表达和思维路径。
3. 基准污染
**基准污染是评测题或其近似变体进入训练数据,导致测试成绩不能反映泛化能力。**自动出题系统能够迅速生成大量相似任务,因此必须保留真正隔离的测试集,并对语义近邻进行去重,而不是只比对字符串。
4. 搜索预算伪装成能力提升
**更高的搜索预算可能被误判为更强的自进化能力。**如果新系统尝试了 1000 套题目,而人工基线只尝试了 10 套,那么最终挑出的最好结果更高,并不能证明生成策略更聪明。
可信评估至少需要满足三个条件:计算与采样预算对等、使用未参与循环的保留基准、比较单位成本下的能力提升。缺少其中任何一项,“跑通 RSI”都可能只是把更多搜索包装成了更聪明的循环。
判断:这是实战起点,不是智能爆炸
**这次进展说明数据层 RSI 已经具备工程可行性,但没有证明完整 RSI 已经到来。**AI 能参与创造下一代 AI,和 AI 能脱离人类持续设计更强后继者之间,仍然隔着可靠验证、跨领域泛化、研究方向选择和安全控制等多道门槛。
数据闭环的短期影响会非常现实。未来模型团队的竞争不只是谁拥有更多原始数据和算力,还包括谁能更快发现模型盲点、生成高信息密度任务、建立可靠验证器,并把失败结果重新送回训练系统。
长期变化则更深一层。模型研发过去依赖人类组织题库、写规则和逐次复盘,而数据层 RSI 把这些工作变成可以连续运行的软件系统。题库不再是一份静态资产,而是一台随着模型共同进化的机器。
现在最合理的态度不是把它描述成“AI 已经开始无限自我升级”,也不是把它降格成普通数据合成。它真正跨过的门槛,是 AI 第一次更系统地参与决定下一代 AI 应该学习什么——这一步没有智能爆炸那么戏剧化,却很可能比一次榜单涨分更有产业意义。
参考来源
- 自进化(Self-evolving/RSI),一篇就够了:梳理自进化、严格 RSI、Harness 改进与数据闭环之间的区别,并讨论预算对等和保留基准等评估问题。



