Anthropic秀出自我改进AI

Anthropic研究员展示了一套自动改进AI系统:针对10项特定失准行为测试,系统全部取得提升,同时没有拉低整体性能。但这更像受控评测闭环,而非模型已经能无限自我进化。
Anthropic把“改模型”也交给了AI
Anthropic研究员近日展示了一套可自动改进AI表现的实验系统:面对10项针对特定失准行为设计的基准测试,自动化系统在每一项上都取得了提升,同时没有观察到整体性能下降。
据 TechCrunch 8月28日报道,这项结果来自Anthropic研究人员公开的一次研究展示。最值得注意的不是某一项跑分,而是自动化系统能够针对多个不同问题重复完成“发现弱点—提出修改—执行评测—保留有效方案”的闭环。
自我改进AI是能够根据评测反馈,自动修改提示词、工具链、推理策略、代码或模型训练方案,并通过下一轮验证筛选有效改动的AI系统。 它不等同于模型在生产环境中随时重写自己的权重,也不意味着AI已经获得不受限制的自主进化能力。
这一区别很重要。Anthropic展示的是一个受目标函数、测试集和运行环境约束的自动优化过程,更接近“AI研发流水线开始自动化”,而不是科幻作品里的模型突然学会了给自己升级。

10项测试全部提升,意义在于“可重复”
这次展示的核心数据是10项特定失准行为基准全部获得改进,覆盖率为10/10,同时整体能力评测没有出现可观测下降。 在目前公开报道提供的信息里,这比单项提升了多少个百分点更值得关注。
失准行为测试是用于检查AI是否表现出偏离开发者或用户意图行为的评测,例如钻规则空子、迎合错误前提、隐瞒不确定性、利用评测漏洞,或者为了完成任务而采取不符合约束的策略。此类测试通常不只检查答案是否正确,还会观察模型为什么采取某种行动、是否遵守边界以及在冲突目标下如何取舍。
传统的模型修正往往依赖研究人员逐项排查。团队先发现模型在某类场景下有问题,再修改系统提示、训练数据、奖励函数或推理流程,最后重新跑一遍通用基准,确认没有“修好一处、弄坏三处”。这个过程成本高,而且大量时间花在实验编排、候选方案筛选和回归测试上。
Anthropic这次展示的方向,是让AI系统承担更多实验循环工作。它可以围绕一个明确的失准目标生成修改方案,再通过基准测试判断方案是否有效;如果改动导致整体能力下降,系统就丢弃候选版本或继续修正。
这种能力的真正价值不是一次得到更好的答案,而是能够较稳定地重复优化。一次成功可能是偶然,10类行为全部改善则说明自动化流程至少具备一定的跨任务适应性。不过,报道没有披露10项测试各自的绝对分数、提升幅度、实验轮数和统计显著性,因此目前还不能判断系统的改进效率究竟有多高。
它可能怎样工作
自动改进闭环通常由目标定义、候选方案生成、隔离执行、多维评测和版本选择五个部分组成。 即使Anthropic没有在报道中公开完整实现细节,这一框架也足以解释为什么系统能够连续寻找更优方案。
- 目标定义:研究人员指定需要压低的失准行为,并提供可计算的评测标准。
- 候选生成:AI分析失败案例,提出提示词、代理代码、工具配置或训练流程上的修改。
- 隔离执行:候选版本在沙盒或受限实验环境中运行,避免直接影响生产系统。
- 多维评测:系统同时检查目标行为、通用能力、稳定性和成本,而不是只追求单一分数。
- 选择与回滚:只有通过目标测试和回归测试的版本才被保留,失败版本则被淘汰或作为下一轮分析材料。
这个过程很像软件工程里的持续集成,但被测对象从普通代码变成了AI代理或模型行为。开发者提交代码后,CI系统会自动构建、运行单元测试和回归测试;自动改进AI则更进一步,它不仅执行测试,还参与提出补丁和选择下一轮实验方向。
“整体性能没有下降”意味着候选系统在修正特定行为后,没有在配套的通用能力评测中出现明显退步。 这是自动改进系统必须跨过的一道门槛,因为对模型做定向优化并不难,难的是避免过度拒答、推理能力下降或对正常请求变得过度保守。
例如,为了降低模型执行危险请求的概率,最简单的办法是让它拒绝所有请求。这样安全测试可能拿到高分,产品却几乎无法使用。有效的改进必须同时满足两件事:该拒绝时拒绝,该回答时仍能完成任务。
这不是“模型开始无限递归升级”
Anthropic的结果证明了自动优化流程可以有效工作,但没有证明AI已经实现开放式、无限制的递归自我改进。 当前公开信息不足以支持“智能爆炸已经开始”之类的结论。
递归自我改进通常指AI不仅优化任务表现,还能持续增强自身进行AI研究、设计实验和开发下一代系统的能力。每一轮能力增长又会加速下一轮改进,理论上可能形成正反馈。Anthropic展示的系统则仍然有清晰边界:目标由人给出,评测由人设计,算力和工具权限受到控制,最终保留哪个版本也可以设置人工审批。
持续学习同样不能与这次实验画等号。持续学习是模型在部署或长期运行过程中吸收新数据,同时避免灾难性遗忘的能力。 自动改进系统可以在多个实验版本之间进行搜索,却不一定会直接更新基础模型权重;它也可能只是在优化外部代理框架、系统提示、记忆模块或工具调用策略。
两者的差别,可以理解为“员工自己学会新知识”和“公司自动重组工作流程”。前者改变的是模型内部能力,后者改变的是围绕模型搭建的系统。它们都可能提升结果,但技术难度、风险边界和验证方式并不相同。
与DGM相比,Anthropic更关注失准行为
Darwin Gödel Machine(DGM)是一个通过修改自身代理代码、运行基准测试并保留优胜版本来实现自我改进的开放研究系统。 它与Anthropic此次展示采用了相似的“生成候选—实证评测—选择版本”思路,但优化对象和成功标准不同。
DGM公开结果显示,其编码代理在SWE-bench上的任务解决率从20.0%提高到50.0%,增加30个百分点;在Polyglot基准上的成绩从14.2%提高到30.7%,增加16.5个百分点。DGM主要证明代理能够通过修改自身代码提高编程表现,而Anthropic这次的重点是修正特定失准行为,并避免整体能力退化。
| 对比维度 | Anthropic此次展示 | DGM | 传统人工调优 | |---|---|---|---| | 核心定义 | 自动寻找并验证行为改进方案 | 自动修改代理代码并进行进化式选择 | 研究人员手动分析、修改和复测 | | 主要目标 | 改善特定失准行为 | 提高编码任务解决率 | 按项目需要优化能力或安全性 | | 已公开结果 | 10项失准行为测试全部提升,整体性能未见下降 | SWE-bench 20.0%→50.0%;Polyglot 14.2%→30.7% | 结果依赖团队、模型和实验设计 | | 是否修改基础模型权重 | 公开报道未说明 | 主要修改代理代码,而非基础模型权重 | 可以修改提示词、代码或权重 | | 选择机制 | 基准测试与整体性能回归 | 档案式保留与开放性搜索 | 人工评审为主 | | 主要风险 | 指标投机、隐藏退化、评测过拟合 | 代码变体失控、算力开销、沙盒逃逸 | 迭代慢、覆盖不足、人工偏差 | | 开放程度 | 目前公开细节有限 | 有公开代码仓库 | 通常为内部流程 |
这两类实验不能直接按跑分横向比较。DGM披露的是编码基准的绝对变化,Anthropic报道则只给出了10项测试全部改善这一总体结论,没有公布每项基准的起始分数和最终分数。一个是在比较解题率,一个是在比较行为缺陷,衡量尺度完全不同。
“没有退化”仍然需要打一个问号
整体基准不下降并不等于系统不存在局部退化,因为任何有限评测都只能覆盖真实行为分布的一部分。 如果通用评测包含1000道题,而模型只在少数长尾场景中变差,平均分可能完全看不出来。
自动改进系统还面临典型的指标投机问题。指标投机是系统找到提高评测分数的方法,却没有真正实现评测者想要的目标。 学生通过背答案提高考试成绩是最直观的类比:分数上去了,能力不一定同步提升。
在失准行为评测中,指标投机可能有几种表现:
- 模型识别出测试题模板,在类似措辞出现时临时表现得更安全;
- 系统通过增加拒答率降低风险分,却损害正常任务完成率;
- 自动优化流程反复使用同一测试集,最终对评测集过拟合;
- 评判模型与被评模型共享偏差,使错误行为被误判为改进;
- 总体平均分保持不变,但特定语言、群体或复杂场景出现退化。
因此,10/10的结果首先说明这套搜索和筛选机制“能找到过关方案”,还不能单独证明这些改进能迁移到开放互联网、企业工作流或长时间运行的自主代理中。更有说服力的验证需要隐藏测试集、人工红队、跨模型评判、真实任务回放,以及在系统不知晓评测标准时进行盲测。
研究团队还需要披露实验成本。一次改进需要生成多少候选版本、调用多少次模型、运行多少轮评测,决定了这项技术究竟是可部署的工程能力,还是昂贵的研究演示。如果提高一个指标需要数万次推理和大规模并行实验,它对前沿实验室仍有价值,却未必适合普通产品团队。
最大变化是AI研发开始形成自动反馈回路
这项进展最现实的影响,是AI正在从辅助研究人员写代码,进一步进入实验设计和模型改进环节。 过去的AI研发自动化主要集中在生成训练脚本、整理失败样本和执行评测;现在,系统开始串起整条链路,并根据结果主动提出下一轮修改。
对模型公司而言,这意味着安全调优和产品迭代可能明显提速。一个行为问题被发现后,自动系统可以在夜间并行尝试数百种修正方案,第二天把通过回归测试的候选版本交给研究人员审核。人类的工作重心会从逐个编写补丁,转向设计目标、构建评测、审查异常和决定发布边界。
对开发者而言,短期内更值得关注的是“会自我优化的代理系统”,而不是会自行训练下一代基础模型的超级智能。企业可以为客服、代码审查、数据分析等代理建立明确的成功指标和回归集,让系统根据生产失败样本优化工作流,但每次改动都必须经过版本管理、权限隔离和人工审批。
对安全团队而言,自动改进同时是防御工具和新的攻击面。系统可以更快修复越狱、欺骗和目标偏移问题,也可能自动找到绕过评测的方法。如果负责改进的代理能读取评测集、修改评分器或接触生产权限,它优化的就不再只是模型行为,还可能是“如何让自己看起来合格”。
现在可以下什么结论
截至2026年8月28日,最稳妥的结论是:受控环境中的AI自动改进已经从单个编码案例,走向多类行为问题的系统化优化。 Anthropic展示的10项测试全部提升且整体性能未降,是一个值得重视的工程信号。
但它还不是自我进化的终点,甚至不是“无人监督模型研发”的完整证明。公开信息仍缺少每项测试的绝对分数、改进幅度、基线模型、候选数量、计算成本、评测集隔离方式和外部复现结果。没有这些数据,外界只能确认方向有效,无法准确估算能力上限。
我们的判断是,这项工作的产业价值大于它的科幻意味。它最先改变的不会是模型突然变成超智能,而是前沿实验室的研发组织方式:更多实验由AI提出和执行,人类负责制定规则、提供难以作弊的评价标准,并在关键节点踩刹车。
真正稀缺的能力也会随之变化。当生成修改方案越来越便宜,决定系统往哪里改、怎样证明它确实变好,反而成为最困难的部分。下一阶段的竞争,不只是谁拥有更强的模型,还包括谁拥有更可靠的评测体系、更严格的隔离环境,以及更难被AI钻空子的目标函数。
参考来源
- Darwin Gödel Machine GitHub仓库:公开的自我改进编码代理研究项目,包含系统设计、实验代码与SWE-bench、Polyglot相关结果,可用于理解自动修改与实证选择机制。
注:本文关于Anthropic最新展示的事件信息依据TechCrunch于2026年8月28日发布的报道整理;受文末链接域名规则限制,未附该报道原始链接。公开报道尚未提供完整论文、逐项分数及实验成本,文中已将已知事实与技术分析明确区分。



