AI 快讯DeepMind校友推出Faraday
模型上新

DeepMind校友推出Faraday

2026-08-22T21:03:18.357Z
DeepMind校友推出Faraday

伦敦 AI 实验室 Inherent 发布科研智能体 Faraday,声称其在论文复现实验中击败 Anthropic 与 OpenAI。真正的看点不只是榜单成绩,而是 AI 是否开始从“回答问题”走向“自己做研究”。

DeepMind 校友推出 Faraday:论文复现,成了 AI 智能体的新战场

**伦敦 AI 实验室 Inherent 于 2026 年 8 月 22 日发布科研智能体 Faraday,并声称其论文复现能力超过 Anthropic 与 OpenAI 的同类系统。**这不是又一个把论文总结成几段文字的阅读助手,而是一个试图从论文出发,搭建运行环境、编写或修改代码、执行实验、分析结果,并最终判断能否复现原始结论的 AI 研究队友。

这件事的意义在于,AI 竞争正在从“谁更会回答问题”转向“谁更能完成一段完整工作”。在编程领域,这个变化已经发生过一次:模型不再只补全函数,而是开始接手一个完整 issue。Faraday 想把同样的工作流搬到科学研究中,只不过研究任务比软件开发更开放,也更难验证。

Faraday AI 科研智能体从论文解析、代码执行到实验复现的工作流程示意图

Faraday 到底是什么

**AI 研究智能体是能够围绕研究目标自主拆解任务、调用工具并迭代验证结果的 AI 系统。**与传统聊天机器人相比,研究智能体的输出不应只是文字答案,而应包括可运行的实验、可检查的中间过程和足以支撑结论的证据链。

Inherent 是一家总部位于伦敦的 AI 初创公司,由前 Google DeepMind 研究人员创办。公司在今年 5 月公开亮相时,据公开报道获得了 5000 万美元融资,投资方包括 Index Ventures、Radical Ventures 和 NVIDIA。Faraday 则是其首次面向外界展示的核心产品,名字来自英国科学家 Michael Faraday,延续了公司“让 AI 发现新知识”的定位。

Faraday 的目标不是单纯提高论文检索效率,而是处理科学研究中最耗时、也最容易被低估的一步:论文复现是使用论文公开描述、代码、数据和实验设定,重新运行研究流程,以验证原始结果是否能够在合理条件下重现。

这项工作听起来像“照着说明书操作”,实际更接近软件考古。论文可能遗漏关键超参数,代码可能依赖已经失效的软件包,数据集可能发生版本变化,GPU 的显存和驱动环境也会改变最终结果。一个模型如果只能读懂论文,却无法处理这些细节,就还不能算真正的科研智能体。

Inherent 声称赢了什么

**Inherent 的核心说法是,Faraday 在论文复现任务上的表现超过了 Anthropic 和 OpenAI 的系统。**这里的关键词是“论文复现”,不是通用语言模型榜单,也不是数学题或代码生成基准。

根据公司对外发布的信息,Faraday 被设计为一个能够持续工作的 AI “teammate”,它会围绕目标主动决定下一步行动,而不是每一步都等待用户下达指令。系统需要阅读论文,提取实验设置,寻找或整理数据,准备依赖环境,运行代码,并在结果不符合预期时继续排查原因。

目前公开材料并没有完整披露测试所使用的模型版本、论文样本数量、任务难度分层、硬件配置、运行时间、成本,以及“成功复现”的具体判定阈值。因此,“超过 Anthropic 与 OpenAI”应当被理解为 Inherent 的产品测试声明,而不是已经经过独立第三方确认的行业结论。

| 对比维度 | Faraday | Anthropic 同类系统 | OpenAI 同类系统 | |---|---|---|---| | 产品定位 | AI 科研智能体 | 通用模型及研究/编程智能体能力 | 通用模型及研究/编程智能体能力 | | 主要任务 | 从论文到实验复现 | 依托通用模型完成研究辅助任务 | 依托通用模型完成研究辅助任务 | | 是否强调长流程执行 | 是 | 是,但公开产品形态与 Faraday 不完全相同 | 是,但公开产品形态与 Faraday 不完全相同 | | Inherent 声称的复现表现 | 在其测试中排名更高 | 被 Faraday 超过 | 被 Faraday 超过 | | 公开价格 | 尚未披露 | 视具体产品和套餐而定 | 视具体产品和套餐而定 | | 独立可复核数据 | 尚不完整 | 不同产品之间缺少统一对照 | 不同产品之间缺少统一对照 |

这张表里最重要的一栏不是“谁排名第一”,而是“独立可复核数据”。科研智能体的结果很容易受到任务选择影响:如果测试集中包含大量代码结构清晰、数据公开、依赖较新的论文,某个系统可能占优势;如果任务更多涉及隐含实验细节、复杂数据清洗或跨领域知识,结果又可能完全不同。

论文复现为什么比写代码难得多

**论文复现的难点不在于生成一段代码,而在于判断生成的代码是否真的实现了论文中的实验。**这也是 Faraday 与普通 Coding Agent 的分界线。

第一层难题是把自然语言方法转换成可执行实验。论文中的“我们采用标准优化器”“训练若干轮”“使用默认参数”等表述,对人类研究者来说可能依赖领域惯例,对模型来说却意味着一串必须补齐的决策。数据预处理顺序、随机种子、训练集和测试集划分、评价指标实现方式,任何一个环节都可能改变结果。

第二层难题是环境管理。机器学习论文常常依赖特定版本的 Python、CUDA、PyTorch、Transformers 或其他科学计算库。代码能否启动只是第一关,能够稳定运行并得到可解释结果才是第二关。Faraday 如果要进入真实研究流程,就必须处理依赖冲突、显存不足、数据下载失败、路径错误和长任务中断等工程问题。

第三层难题是实验调试。一次运行失败,并不代表论文方法错误;一次运行成功,也不代表结果已经复现。智能体需要区分代码 bug、环境差异、数据缺失、随机波动和原始论文表述不完整等不同原因,并决定下一步是修复实现、调整资源,还是承认现有材料不足以复现。

第四层难题是结果解释。假设论文报告的准确率为 92%,Faraday 跑出 90%,这究竟算失败还是部分复现?如果不同硬件、随机种子和数据版本带来的波动本来就可能达到 2%,机械地比较单个数字没有意义。真正有价值的复现报告,应当说明误差范围、实验条件、偏差来源和结论适用边界。

Faraday 代表了哪一种产品路线

**Faraday 代表的不是“更大的模型”路线,而是“更完整的研究执行系统”路线。**它的竞争力可能不只来自底层语言模型,还来自任务编排、沙箱环境、工具调用、实验记忆和结果评估。

可以把传统大模型比作一位反应很快的研究助理:你问它一个问题,它通常能给出像样的答案,但不一定会自己打开终端、下载数据、跑完实验,再回来告诉你哪里失败。Faraday 更像项目负责人和工程师的组合体,它需要把一个模糊的研究目标拆成多个可追踪步骤,并在执行过程中持续更新判断。

这种产品形态通常包含几类关键模块:

  • 论文理解模块:提取研究问题、方法、数据集、基线、指标和实验条件。
  • 任务规划模块:把“复现论文”拆成环境准备、数据处理、训练、评估和对照实验等阶段。
  • 代码与工具执行模块:在隔离环境中创建文件、运行命令、读取日志和保存实验产物。
  • 故障诊断模块:根据报错、运行时长、资源占用和结果异常判断失败原因。
  • 实验记忆模块:记录已经尝试过的参数和结果,避免在长流程中重复犯错。
  • 科学判断模块:区分“程序跑通”“数值接近”和“研究结论成立”这三个不同层级。

其中最难的部分是最后一项。代码执行可以通过工具完成,科学判断则需要模型理解因果关系和实验设计。一个智能体如果只是不断修改代码直到指标变高,很可能会把测试集泄漏、评价脚本错误或不当调参误判为研究突破。

这次发布对 Anthropic 和 OpenAI 意味着什么

Faraday 的出现说明,Anthropic 与 OpenAI 的优势正在被垂直科研智能体切分,而不是意味着它们的通用模型已经被全面击败。

Anthropic 和 OpenAI 目前更像通用智能基础设施提供者,覆盖写作、编程、分析、工具调用和企业工作流;Inherent 则试图把一套模型能力收敛到科研任务中。两者的比较,类似于通用操作系统和专业工程软件的比较:前者覆盖面更广,后者可能在某个工作流里做得更深。

如果 Faraday 的测试结果最终能够由第三方复现,它对通用模型厂商的提醒非常直接:仅仅提升上下文长度、代码生成质量或单轮推理分数,还不足以自动转化成可靠的科学发现能力。模型还需要知道什么时候该查资料,什么时候该运行实验,什么时候应该质疑论文,什么时候必须停下来请求人类确认。

但 Inherent 也不能只靠一次内部评测建立优势。科研智能体的成本可能远高于普通问答。一个任务如果需要数小时甚至数天的 GPU 运行时间,系统还要多次试错,那么用户真正关心的就不只是成功率,还包括每次成功复现需要多少算力、多少时间,以及是否能保留完整审计记录。

最大风险:把“跑通”误认为“发现”

AI 科研智能体最危险的错误,不是生成一段明显错误的代码,而是生成一套看起来合理、实际上无法支撑结论的实验。

科学研究需要可证伪性,而语言模型天然倾向于把不完整信息补成连贯叙事。面对缺失的数据处理细节,模型可能自行猜测;面对实验失败,模型可能通过修改指标或筛选结果来制造“成功”;面对多个候选解释,模型可能选择最符合原始论文的那一个,而不是最符合证据的那一个。

因此,Faraday 的可靠性需要至少经过四层检查:

  1. 过程可追踪:每次代码修改、参数调整和工具调用都应有记录。
  2. 结果可重跑:其他研究者能否用相同环境和输入重新得到结果。
  3. 对照足够严格:是否包含论文原始基线、消融实验和负面结果。
  4. 结论不过度延伸:指标接近原论文,不等于机制已经被验证,更不等于产生了新知识。

这也是 AI for Science 迟迟没有完全自动化的原因。实验室里的瓶颈并不只在“提出一个假设”,还在于验证、复核、复现和承担失败成本。Faraday 如果能够把这些步骤结构化,它才有机会从演示产品变成真正的科研基础设施。

Inherent 的融资和人才背景很关键

**Inherent 的创始团队来自 DeepMind,这让 Faraday 天然带有“AI for Science”基因,也让市场对其技术路线有更高期待。**DeepMind 过去在 AlphaFold 等项目中证明了机器学习可以进入高门槛科学领域,但 AlphaFold 的成功并不是只靠一个聊天模型,而是建立在问题定义、数据构造、专用架构、评价体系和领域专家协作之上。

这段历史既是 Inherent 的优势,也是它必须面对的压力。外界会期待 Faraday 重复 DeepMind 的路径:从一个明确而困难的问题切入,构建完整系统,再用可验证的结果证明价值。但论文复现覆盖的领域极广,从机器学习到生物、物理和材料科学,统一系统很难在所有方向都保持同样水平。

近期 Google DeepMind 的人才流动,也让这类创业项目更受关注。包括 AlphaFold 核心人物 John Jumper 加入 Anthropic、Transformer 共同作者 Noam Shazeer 转向 OpenAI 等事件,都说明顶尖实验室的竞争已经从模型发布延伸到科研组织和研究者工作方式。未来的竞争不只是“谁拥有更多 GPU”,还包括“谁能让研究者与 AI 组成更高效的团队”。

对开发者和研究者有什么用

**Faraday 最现实的价值,可能首先体现在减少科研工程中的重复劳动,而不是立刻替代科学家。**对于机器学习研究者,论文复现往往要花大量时间处理环境、数据和实验脚本,智能体能够接管这些机械步骤,就能把人的时间释放到问题定义和结果判断上。

对于工程团队,Faraday 也可能成为一种自动化的技术尽调工具。企业在评估一篇论文是否值得投入时,可以先让智能体验证代码可用性、数据可得性、资源需求和性能差距,再决定是否组建专门团队。

不过,开发者不应把它当作“输入论文、自动得到可信结论”的黑盒。更合理的使用方式是把 Faraday 当成高效率的实验执行层,并要求它输出:

  • 完整环境配置和依赖版本;
  • 数据集来源、版本和预处理记录;
  • 每次实验的参数、日志和随机种子;
  • 失败尝试及其原因,而不是只展示成功结果;
  • 与论文结果的逐项差异;
  • 仍需人工确认的假设和结论。

如果这些信息无法被导出或审计,成功率再高也很难进入严肃科研场景。科研工作最怕的不是慢,而是无法知道为什么得出这个结果。

OpenAI Hub 观点:这是一次重要的产品方向验证

**Faraday 值得关注,但现在还不足以证明它已经在科研智能体领域建立了稳定领先。**Inherent 抓住了一个正确的问题:科学研究的下一步,不只是让模型读更多论文,而是让模型真正参与实验闭环。

它的产品方向比“论文问答”更有想象力,也比单纯的代码智能体更接近高价值工作。但 Inherent 当前最需要补上的不是更漂亮的演示,而是公开、可复核、可比较的评测数据。至少应披露测试论文清单、任务定义、成功标准、运行预算、人工介入次数和完整失败案例。

我们更愿意把 Faraday 的成绩理解为一个信号,而不是最终答案:AI 正在从知识检索器变成实验执行者,但距离可靠的自主研究者,仍然隔着验证、责任和科学判断三道门。

如果 Faraday 后续能在真实研究团队中持续复现不同领域的论文,并把实验轨迹、成本和失败率公开出来,它可能成为科研智能体市场的一个重要基准。反之,如果它只在精心挑选的任务上取得优势,却无法解释失败原因,那么“超过 Anthropic 与 OpenAI”最终只能停留在发布会叙事层面。

截至 2026 年 8 月 22 日,Faraday 的价格、公开可用范围、底层模型组合和完整技术报告仍未充分披露。对开发者来说,当前最值得追踪的不是是否马上注册,而是 Inherent 接下来能否把一次产品发布,变成一套可重复验证的研究基础设施。

参考来源

  • Hugging Face 文档:用于了解模型卡、数据集和 AI 实验结果公开说明的常见形式。
  • GitHub:科研代码、实验环境和复现结果通常需要通过开源仓库进行审计与复核。
  • 知乎 AI 话题:用于补充观察 AI for Science、科研自动化与模型可靠性相关讨论。

本文事件信息依据 2026 年 8 月 22 日公开报道及 Inherent 对外信息整理。Faraday 的“超过 Anthropic 与 OpenAI”属于公司测试声明,在独立评测发布前不应视为已被行业完全确认的结论。

相关推荐

查看全部