AI科研能力终于能裸考了

十余家机构联合提出 ASI-Bench,通过逐级撤掉人类提示评估 AI 自主科研能力。结果显示,AI 最大短板不是知识,而是把研究方法变成可执行方案。
AI 科研能力终于能裸考了
AI 科研评测正在从“会不会答题”转向“能不能独立做完项目”。 8 月 24 日,来自清华大学、麻省理工学院、哈佛大学、卡内基梅隆大学、微软研究院等十余家机构的 40 余位专家,公布了自主科研能力评测框架 ASI-Bench,并以论文《ASI-Bench: At the Dawn of Artificial Superintelligence》介绍其设计和首轮测试结果。
ASI-Bench 是一个通过逐步减少人类指导,测量 AI 自主完成科研项目能力的基准。 它没有继续堆叠更难的选择题,也不是让模型照着论文复现代码,而是把同一项研究任务分别改写成 B1、B2、B3、B4 四个版本,只改变人类提供的信息量,以此判断 AI 究竟是在执行方案,还是能够自己提出并推进方案。
这个设计看似只是“少写几句提示词”,实际触及了 AI for Science 评测中长期被混淆的问题:一个系统做出了正确结果,不代表它具备独立研究能力,也可能只是人类研究员已经把最难的部分写进了提示词。

四场考试,只有提示量不同
ASI-Bench 的核心变量不是题目难度,而是人类指导程度。 四个版本使用完全相同的研究目标、输入数据、输出要求和评分标准,区别只在于 AI 能看到多少方法与实现信息。
| 条件 | 人类提供的信息 | AI 需要自主完成的部分 | 主要测量能力 | |---|---|---|---| | B1 | 研究方法、公式、实现步骤及部分参数 | 正确实现并运行既定方案 | 执行、编程与调试 | | B2 | 研究目标和方法级提示,不给实现步骤 | 将方法转化为可运行流程 | 方案落地与实验规划 | | B3 | 只给目标、数据、约束和提交要求 | 自主选方法、实现、验证和迭代 | 端到端自主科研 | | B4 | 与 B3 相同,但加入正确却无关的信息 | 识别干扰并完成端到端研究 | 抗干扰与目标保持 |
B1 是最接近“研究说明书”的条件。 模型已经知道该用什么公式、走什么技术路线,甚至能获得部分参数建议,主要工作是把方案写成代码、运行实验并交付结果。
B2 撤掉了最具体的实现步骤。 人类仍然告诉 AI 应该采用哪类方法,但如何组织代码、怎样设置实验、何时检查中间结果,以及失败后如何修正,都要由系统自己决定。
B3 才是真正意义上的科研裸考。 系统只获得问题、数据、约束和输出标准,既要选择方法,也要完成实现、验证与迭代,相当于只给一名研究人员课题,不再附赠实验路线图。
B4 用无关但真实的信息测试系统是否容易跑偏。 这种干扰比明显错误的信息更棘手,因为模型不能简单依靠事实核验将其排除,而要判断它是否与当前研究目标有关。
这套分级设计的价值,是把“自主性”变成了可观测变量。过去不同团队都宣称自己的 Agent 可以做研究,但有的系统拿到了详细步骤,有的只拿到问题,两者最终分数并不具备可比性。ASI-Bench 至少给出了一个相对统一的坐标系:在人类撤掉多少帮助后,系统还能完成多少工作。
60 个任务背后,是 3.1 万个人工小时
ASI-Bench 的任务单位不是一道题,而是一个需要多轮执行的微型科研项目。 每项任务都可能要求系统经历问题理解、方法选择、代码实现、沙盒运行、错误排查、结果分析和再次迭代,而不是生成一段看起来合理的文字答案。
研究团队最初收集了 1300 多个候选科研问题,经过 5 轮、超过 1100 次人工评审和 2000 多次修订,最终留下 60 项完整任务。任务覆盖数学、物理、化学、生物、天文、材料、地球科学、医学与生物统计、计算机、机器人、电子工程,共 11 个基础及工程学科。
项目级任务比知识问答更难评,也更难防止模型走捷径。 团队为此进行了超过 1500 次沙盒运行,用于确认参考结果能否复现、自动评分是否稳定、任务中是否存在信息泄漏,以及系统能否绕开正常研究过程直接猜到结果。
整个基准的构建和验证累计投入超过 3.1 万个人工小时。这个成本说明,真正困难的并不是再找几十道“高难题”,而是把科研过程拆成可运行、可复现、可评分,又不至于把方法提前泄露给模型的任务。
最大断层不在选方法,而在把方法做出来
首轮结果揭示了一个反直觉结论:AI 最明显的能力断层发生在 B1 到 B2,而不是 B2 到 B3。 在禁用外部工具的主要评测中,研究团队测试了 18 种模型与 harness 组合,涉及 Codex、Claude Code、Kimi Code、MiMo Code、OpenHands 等执行框架,以及 GPT、Claude、Kimi、DeepSeek、GLM、MiniMax、MiMo 等模型系列。
Harness 是连接模型与科研环境的执行框架。 它负责管理上下文、文件读写、代码运行、错误反馈和任务循环,因此 ASI-Bench 测到的并非单一模型智力,而是“模型加执行框架”组成的完整研究系统。
| 指导条件 | 平均得分 | 相对上一档变化 | 结果含义 | |---|---:|---:|---| | B1 | 50.91 | — | 路线和步骤明确时,系统已有一定执行能力 | | B2 | 29.10 | 下降约 21.82 分 | 撤掉实现步骤后出现最大性能断层 | | B3 | 26.62 | 下降 2.48 分 | 再撤掉方法提示,额外损失反而较小 | | B4 | 26.99 | 上升 0.37 分 | 无关真实信息未造成可见的整体下降 |
从 B1 到 B2,平均成绩由 50.91 降至 29.10,绝对降幅约 21.82 分,相对降幅约 42.9%。 这一阶段研究目标和方法都没有改变,唯一被撤掉的是具体实现步骤。
从 B2 到 B3,模型连方法提示也失去了,但平均成绩只再下降 2.48 分。 这不意味着 AI 已经擅长提出研究方法,而可能意味着多数系统在更早的“方案工程化”阶段就已经失败,以至于是否提供方法对最终分数的边际影响变小。
换句话说,当前科研智能体最缺的未必是再背更多论文,而是把一句“使用某种统计方法分析数据”展开成完整实验:该清洗哪些字段、采用什么指标、怎样切分数据、先跑哪组基线、结果异常时检查哪里,以及在预算耗尽前如何调整方向。
B4 的平均得分为 26.99,比 B3 高 0.37 分,也值得谨慎解读。 至少在当前 60 项任务和总体均值上,加入事实正确但无关的信息没有形成明显惩罚;但 0.37 分不足以证明系统已经具备稳定的抗干扰能力,还需要结合任务级方差、失败类型和统计显著性判断。

它比 GPQA 和 FrontierScience 多测了一层
ASI-Bench 并不是第一个科学能力基准,但它把评测对象从答案推进到了研究过程。 GPQA、FrontierScience、ADeLe 与 ASI-Bench 分别回答不同问题,不能简单用总分横向替代。
| 基准或框架 | 主要评测对象 | 任务形态 | 是否操纵人类指导量 | 更适合回答的问题 | |---|---|---|---|---| | GPQA | 研究生级科学知识与推理 | 防搜索的高难问答 | 否 | 模型是否能答对专家级科学题 | | FrontierScience | 专家级科学推理与研究问题 | Olympiad、Research 两类任务 | 否 | 模型在高难科学推理和开放研究题上达到什么水平 | | ADeLe | 通用能力需求与模型画像 | 18 个能力量表、0—5 级需求标注 | 否 | 某个任务为什么难,模型在哪个能力层级失败 | | ASI-Bench | 端到端自主科研能力 | 60 个项目级任务、B1—B4 四档指导 | 是 | 撤掉人类方案后,系统还能独立完成多少研究 |
传统科学基准正在快速饱和。 OpenAI 公布的数据中,GPT-4 在 2023 年 11 月发布的 GPQA 上得分为 39%,低于 70% 的专家基线;到 2025 年底,GPT-5.2 的得分已达到 92%。当模型在静态问答上超过专家基线时,这类成绩越来越难区分“记得多、推理强”和“真正会做研究”。
FrontierScience 已经开始把重点放到专家级研究问题上。 GPT-5.2 在其 Olympiad 方向获得 77%,在 Research 方向只有 25%,说明模型在结构清晰的高难推理与开放式研究之间仍有明显落差。
ADeLe 则试图解决评测分数缺乏解释力的问题。 该框架使用 18 个人类可理解的能力量表,对 20 个基准、63 项下游任务中的约 1.6 万个实例进行 0—5 级需求标注,让研究者能判断失败源自知识、推理、学习、抽象能力,还是外部干扰。
ASI-Bench 的增量在于,它不只给任务贴能力标签,而是主动撤掉人类帮助,观察性能曲线如何变化。对于科研智能体来说,这种曲线往往比单一总分更有价值:B1 高、B3 低的系统适合做研究助理,却不适合独立立项;B1 和 B3 差距较小的系统,才更接近真正的自主研究代理。
“统一标准”仍然要打一个引号
ASI-Bench 提供的是一套有希望成为公共坐标系的框架,而不是已经完成统一的行业标准。 它覆盖 11 个学科,但总任务量只有 60 项;每个学科能够容纳的实验范式有限,也很难完整代表需要湿实验、长期观测、大型仪器或多人协作的真实科学研究。
禁用外部工具让模型比较更干净,却削弱了对真实科研工作流的还原。 现实中的研究人员会搜索论文、查阅数据库、调用专业软件、复用代码仓库并向同行求证。一个系统在封闭沙盒中得分不高,不代表它接入检索、专业工具和长期记忆后仍然无效。
模型与 harness 的耦合也会让排行榜变得复杂。 同一个模型放进不同执行框架,可能因为上下文管理、重试机制、文件操作和错误反馈方式不同而得到明显不同的结果。因此,榜首系统不能直接等同于“最强模型”,它更像是在特定预算、框架和环境下表现最好的整套工程方案。
项目评分仍然无法完全替代科学价值判断。 基准可以判断结果是否复现、指标是否达标,却很难自动衡量一个假设是否新颖、一个负结果是否有启发、某种方法是否值得投入半年继续追踪。真正的科研能力不仅是完成任务,也包括提出值得研究的问题。
因此,围绕某家公司或某个系统“拿下双榜第一”的宣传需要克制。排行榜能证明系统在这 60 个任务和既定运行配置下领先,却不能直接推出它已经具备通用自主科研能力,更不能把一次评测排名等同于真实科学发现能力。
真正有用的不是榜单,而是研发方向变清楚了
ASI-Bench 最有价值的产出不是第一名是谁,而是暴露了科研 Agent 的工程瓶颈。 B1 到 B2 的断层意味着,下一阶段只继续扩大模型、增加知识或延长思考时间,未必能换来同等幅度的自主科研提升。
科研智能体接下来更需要补足四类能力:
- 层级化任务规划。 系统要能把研究目标拆成数据检查、基线实验、参数探索、结果验证等可执行子任务,并根据中间结果重新排序。
- 实验反馈利用。 运行报错、指标异常和图表趋势不能只是被塞回上下文,而要转化为下一步动作和假设修正。
- 长期状态管理。 科研任务往往跨越数十次乃至数百次工具调用,系统必须记住已经验证和排除过什么,避免反复走同一条死路。
- 成本与停止策略。 一个会无限重试的 Agent 不等于会研究,系统还要判断何时继续、何时换方法,以及何时承认现有证据不足。
对于模型公司,B1—B4 的差值会比单一总分更有产品意义。 B1 高说明代码实现和执行能力可用;B2 明显下降说明规划层薄弱;B3 继续大跌说明方法选择能力不足;B4 下滑则说明目标保持和信息筛选存在问题。这种诊断比“平均分又提高 3 分”更能指导训练数据、Agent 架构和后训练策略。
对于科研机构,ASI-Bench 也提供了一种更现实的采购和部署方式。 如果系统只能在 B1 条件下稳定工作,它适合被放在专家密切监督的实验流水线中;如果在 B2 条件下仍能保持表现,它可以承担更多工程化任务;只有当 B3 的成功率足够稳定,机构才有理由尝试让它自主探索研究路线。
AI 离自主科学家还远,但评测终于问对了问题
当前 AI 已经能够执行路径明确的科研任务,但还无法稳定承担开放式研究。 50.91 分的 B1 均值说明,即使人类给出方法、步骤和部分参数,现有系统也远没有达到可靠交付;B3 的 26.62 分则进一步表明,端到端自主科研仍处在早期阶段。
这项工作的真正意义,是把“AI 会不会科研”改写成了一个可拆解的问题。 研究者现在可以分别观察系统会不会执行、会不会规划、会不会选方法、会不会抵抗干扰,而不是把所有能力压缩成一个模糊的排行榜数字。
所谓 AI 科研统一标准,目前仍谈不上尘埃落定。但 ASI-Bench 至少迈出了关键一步:未来评价科研智能体,不应只看它答对多少题、复现多少论文,而要看在人类逐步松手之后,它究竟还能独立完成多少真实工作。
参考来源
- Hugging Face Papers:可按论文标题检索 ASI-Bench 的公开论文条目及相关讨论。
- GitHub 仓库检索:用于跟踪 ASI-Bench 可能公开的数据集、评测代码及社区复现项目。



