AI 快讯开源版 Claude Science 来了
行业快讯

开源版 Claude Science 来了

2026-08-04T16:05:23.975Z
开源版 Claude Science 来了

北京大学与元空 AI Agent 联合实验室发布开源科研 Agent,以零依赖、MIT 协议和 30 多项科研 Skills,尝试复刻 Claude Science 的核心工作流。

开源版 Claude Science 来了:零依赖不是重点,科研流程开源才是

北京大学与元空 AI Agent 联合实验室近日发布了一套被称为“开源版 Claude Science”的科研 Agent,项目采用 MIT 协议,强调零依赖运行,并预置 30 多项覆盖文献、数据分析与科研写作的 Skills。

开源版 Claude Science 是一套面向科研任务的开放式智能体框架,它试图让大模型自动规划并执行文献检索、数据处理、结果审查和报告生成等多步骤工作。

这套项目最值得关注的地方,并不是又多了一个套着聊天界面的 AI 工具,而是有人开始把 Anthropic Claude Science 所代表的“科研工作台”思路拆开,变成开发者能够检查、修改和自行部署的工程组件。

开源版 Claude Science 的多智能体科研流程示意图,包括任务规划、Skills 调用、数据分析、审查与报告生成

它不是 Anthropic 官方产品的免费复刻

开源版 Claude Science 是独立开源项目,并不是 Anthropic 官方 Claude Science 的开源版本。

Anthropic 在 2026 年 6 月底推出的 Claude Science,是一个面向科学家的 AI 工作台。它把 Claude 模型、专业数据库、科研软件、远程计算资源和可审计的任务记录集中在同一环境中,首批重点落在生命科学和生物医药领域。

官方 Claude Science 预配置了 60 多种专业 Skills 和连接器,覆盖基因组学、单细胞 RNA 测序、蛋白质组学、结构生物学和化学信息学。它还能够连接 NVIDIA BioNeMo 生态中的 Evo 2、Boltz-2 和 OpenFold3,并通过 SSH 或高性能计算集群运行任务。

这次发布的开源项目则选择了更轻的路线:不复刻 Anthropic 的模型服务和商业基础设施,而是把科研 Agent 的核心流程——任务分解、技能选择、工具调用、产物管理与结果审查——做成开放框架。

两者的差异可以概括为:Claude Science 卖的是一套已经接好科研生态的工作台,开源版交付的则是一套可以继续改造的 Agent 骨架。

| 对比项 | 开源版 Claude Science | Anthropic Claude Science | |---|---|---| | 项目性质 | 独立开源科研 Agent | Anthropic 官方商业科研工作台 | | 开放程度 | 核心代码开放,MIT 协议 | 产品本身闭源 | | 内置能力 | 30 多项科研 Skills | 60 多种预配置 Skills 与连接器 | | 部署方式 | 强调本地化、自托管和零依赖启动 | macOS、Linux、SSH 与 HPC 环境 | | 模型选择 | 取决于部署者配置,框架层更灵活 | 以 Claude 模型为核心 | | 计算资源 | 由用户自行提供 | 可连接外部云计算与科研算力平台 | | 生态集成 | 需要社区继续补充 | 已对接多类生命科学模型、数据库和工具 | | 审计能力 | 依赖开源框架记录与技能实现 | 官方强调完整制作历史和审查 Agent | | 主要成本 | 模型推理、数据库、存储及外部算力 | 产品订阅、模型使用与计算资源成本 | | 适合人群 | 开发者、实验室工程团队、Agent 研究者 | 需要开箱即用科研工作台的研究人员 |

30 多项 Skills,解决的是“模型知道但不会做”

Skills 是一组可被 Agent 按需加载的任务说明、工具规范和领域知识,用于告诉模型某类科研工作应该按照什么步骤执行。

普通聊天模型面对“分析这批单细胞测序数据”时,通常能给出一份看起来合理的流程:质控、归一化、降维、聚类、细胞类型注释,再做差异表达分析。但真正执行时,它还需要知道输入文件是什么格式、阈值如何设置、应该调用哪些软件包、每一步输出什么文件,以及异常结果如何回滚。

Skills 的作用,就是把这些隐含在研究人员经验里的步骤显式化。它既不像传统插件那样只是暴露一个函数,也不等同于一段静态提示词,而是更接近给 Agent 准备的“标准操作程序”。

这次内置的 30 多项 Skills,价值主要集中在高频科研流程,而不是追求覆盖所有学科。

从公开信息看,其能力范围包括以下几类:

  • 文献研究:检索论文、整理证据、追踪引用关系、生成结构化综述;
  • 生物信息学:处理基因组、转录组、蛋白质和单细胞分析任务;
  • 结构与分子研究:衔接蛋白质结构、分子分析及相关计算流程;
  • 科研数据处理:读取表格和实验数据,完成统计分析、可视化与结果归档;
  • 论文与图表生产:生成报告、图表说明、方法章节和面向发表的研究材料;
  • 远程计算:把耗时任务交给服务器或集群环境,并回收结果;
  • 任务审查:核对引文、数据来源、计算过程和最终结论是否一致。

Skills 机制真正解决的问题,是“模型知道一个概念”与“模型能把事情做完”之间的落差。对科研 Agent 来说,模型智力只是上限,技能说明、数据接口和执行环境决定了下限。

“零依赖”降低的是安装门槛,不是科研成本

零依赖是指核心 Agent 尽量不要求用户预先安装庞大的第三方软件栈,而不是整套科研流程完全不需要外部工具。

这个表述很容易引起误解。一个能够做蛋白质结构预测、单细胞分析或地理空间计算的 Agent,不可能凭借几份脚本完成所有计算;对应任务仍然可能需要 Python、R、专业软件包、数据库、GPU 或远程集群。

零依赖更准确的含义,是把 Agent 的控制层做得足够轻。用户不需要先处理复杂的包版本冲突、数据库初始化和插件编译,就能启动框架、载入 Skills,并把任务交给已经存在的工具环境。

零依赖对实验室最实际的价值,是减少“Agent 还没跑,环境先坏了”的工程损耗。

科研软件的依赖问题往往比普通应用更严重。一套分析流程可能同时要求特定版本的 Python、R、CUDA、系统动态库和领域软件,升级其中任意一项都有可能破坏复现环境。Agent 框架如果再引入几十个强制依赖,只会成为新的故障源。

不过,零依赖不能被理解为零配置、零成本或零运维。模型推理仍要消耗算力,联网检索仍受数据库授权和访问策略约束,大型科学计算仍需要 GPU 或 HPC,涉及患者、基因及未发表实验的数据还要满足机构安全要求。

MIT 协议让它更适合进入实验室内部系统

MIT 协议是一种宽松开源许可证,允许个人和企业使用、修改、分发及商业化代码,但需要保留原始版权和许可声明。

对于科研 Agent,许可证并不是无关紧要的附录。实验室和生物医药企业通常要把智能体接进内部数据库、仪器平台、样本管理系统或专有分析管线,限制较少的许可证能够显著降低二次开发和内部部署的合规阻力。

MIT 协议开放的是项目代码,而不是所有模型、数据库和第三方工具的使用权。

如果某项 Skill 调用了受限数据库、商业模型或有独立许可证的科研软件,使用者仍然需要遵守对应条款。项目主仓库采用 MIT,也不意味着所有附带数据、模型权重和外部组件自动变成 MIT。

开发者在用于生产或发表前,至少应该检查三处内容:根目录许可证、各 Skills 目录中的独立声明,以及外部数据和工具的授权条件。对于从其他项目移植的技能,还应确认是否保留 NOTICE、署名和修改记录。

多智能体审查,比“多跑几个 Agent”更重要

多智能体科研系统是由多个承担不同角色的 Agent 协同完成任务,而不是让多个模型同时生成答案再进行投票。

Claude Science 官方方案中一个值得借鉴的设计,是 actor-critic 工作流:执行 Agent 负责生成内容,审查 Agent 则独立检查准确性、引文忠实度和计算过程。开源科研 Agent 如果要真正进入研究流程,也必须把审查角色提升到与执行角色同等重要的位置。

科研任务最危险的错误,通常不是程序直接崩溃,而是程序正常运行、图表顺利生成,但输入数据选错、统计假设不成立或引用并不支持结论。这种“看起来很完整”的错误,比普通幻觉更难发现。

一个合格的科研 Agent 至少需要保留四类审计信息。

  1. 输入来源:使用了哪些论文、数据库版本和实验文件;
  2. 执行过程:调用了哪些 Skills、工具、参数和计算环境;
  3. 中间产物:数据如何清洗、筛选和转换,哪些记录被排除;
  4. 结论映射:报告中的每个关键结论由哪些数据和文献支持。

只有保留这些信息,研究人员才能复查错误并复现实验。单纯输出一份语言流畅的报告,不足以称为科研工作台。

它比通用 Agent 更实用,但离“自动科学家”还很远

这套开源项目的短期价值,是把科研人员从重复性数字劳动中解放出来,而不是替代科学判断。

文献去重、表格转换、批量绘图、格式检查、引文核对和初步数据探索,都是高度耗时但又适合自动化的工作。一个配置合理的 Agent 可以连续完成这些步骤,并把研究人员从 PubMed、Jupyter、R、终端和文档工具之间的频繁切换中拉回来。

它对实验室工程团队尤其有用。团队可以把已经验证过的内部分析管线封装为 Skills,让不同成员通过相同入口调用,从而减少“同一批数据由不同人分析得到不同结果”的流程漂移。

这套项目目前最大的短板,是缺少足够透明、可复现的科研任务基准。

30 多项 Skills 只能说明覆盖范围,不能直接证明结果质量。科研 Agent 更需要回答以下问题:

  • 文献引用准确率是多少,是否存在引用与结论不匹配;
  • 相同输入重复运行时,关键统计结果能否保持一致;
  • 工具调用失败后,Agent 能否识别错误而不是继续编造;
  • 在单细胞分析、蛋白质结构或化学信息学任务上,与专家流程差距多大;
  • 审查 Agent 能发现多少执行 Agent 主动植入的错误;
  • 一次完整任务的推理成本、运行时长和人工复核时间分别是多少。

在这些指标公开之前,把它称为“开源科研 Agent 框架”是准确的,把它称为“自动科学家”则明显过头。

不要把 Skills 数量当成模型跑分

Skills 数量是能力目录的统计指标,不等于科研任务成功率。

近期围绕 Claude Science 的介绍中,出现过 32 项、60 多项甚至更高的数字。这些数字往往统计口径不同:有的只计算独立技能包,有的把连接器、工具、示例和细分工作流全部算入其中。

一个维护良好的蛋白质分析 Skill,可能比十个只能生成模板的技能更有价值。对开发者而言,更应该关注每项 Skill 是否定义输入输出、是否固定工具版本、是否包含错误处理、是否记录来源,以及能否由审查 Agent 独立验证。

Anthropic 已在 GitHub 公开部分 Skills 规范与示例,开发者可以通过其官方 Skills 仓库观察这类能力包的组织方式。开源版 Claude Science 的长期竞争力,也取决于它能否形成类似的软件工程标准,而不只是继续增加技能数量。

真正的机会,是把实验室隐性经验变成可复用资产

科研 Agent 最有价值的资产不是对话记录,而是经过验证、可以重复执行的研究流程。

许多实验室的关键经验仍然存在于研究人员的个人脚本、聊天记录和口头说明中。学生毕业或成员离开后,参数选择、异常处理和数据清洗逻辑也随之丢失。Skills 提供了一种新的封装形式:把工具、步骤、判断条件和审计要求放进同一个可版本化单元。

这会让科研 Agent 从“帮我写一段分析代码”升级为“按照实验室认可的流程处理这批数据”。前者依赖模型临场发挥,后者依赖可维护的工程资产。

北京大学与元空 AI Agent 联合实验室此次发布的意义,是把 Claude Science 的产品方向转化成了一个可以由社区继续实验的开源问题。

它现阶段很难在连接器数量、算力服务和生命科学合作伙伴生态上追平 Anthropic,但开放部署、MIT 协议和轻量控制层,给高校实验室、开发者和小型研究团队提供了更低成本的入口。

最终决定这套项目能否留下来的,不是“开源版 Claude Science”这个足够吸睛的标签,而是三个更朴素的指标:Skills 是否可靠,执行过程是否可追溯,研究结果是否经得起复核。

如果这三点能够持续完善,它就不只是 Claude Science 的开源替代思路,而可能成为实验室构建自有科研 Agent 的基础设施。

参考来源

相关推荐

查看全部