萨顿:合成数据救不了LLM

图灵奖得主理查德·萨顿警告,持续用模型生成的数据训练模型可能让 AI 偏离真实世界。真正可扩展的方向,或许是让智能体通过行动、反馈和长期经验持续学习。
萨顿:合成数据救不了 LLM
图灵奖得主、强化学习奠基人之一理查德·萨顿(Richard Sutton)在当地时间 8 月 18 日播出的红杉资本播客中直言,AI 行业越来越依赖合成训练数据是一个“绝对的大错误”,甚至可能成为行业下一次需要付出代价才能理解的经验教训。
这不是一句简单的“反对合成数据”。萨顿真正质疑的是当前大模型的发展逻辑:当高质量互联网语料逐渐见底,模型公司试图让上一代模型批量生产题目、答案、推理过程和对话,再拿这些内容训练下一代模型。数据规模看似继续扩大,但模型接触到的可能只是自身认知边界的复制品。
**合成数据是由算法、仿真器或生成式模型创造,而非直接采集自现实世界的数据。**它可以是一道由模型生成的数学题、一段自动构造的程序、一次虚拟银行交易,也可以是自动驾驶仿真环境中的道路、车辆和行人。
合成数据并非天然低质量,更不是完全无用;问题在于,它究竟是对真实数据的补充,还是逐渐取代了真实世界本身。萨顿的答案很明确:如果 AI 主要通过模仿 AI 生成的数据继续扩展,这条路很可能走不远。

萨顿批评的不是造数据,而是“模型喂模型”
萨顿的核心判断是,人工制造的数据不能充分替代智能体从现实环境中获得的经验。据 IT之家对这次播客的报道,当主持人问合成数据能否帮助大型语言模型持续扩展时,萨顿回答:“这绝对是个大错误。也许这会成为下一条重要的经验教训。”
**大型语言模型(LLM)是通过预测文本序列中的后续词元,学习语言统计规律和知识表达方式的神经网络。**它擅长建模“人类通常会怎样描述世界”,却不天然拥有一个可以行动、观察后果并纠正判断的外部环境。
这一差异决定了合成数据的上限。如果模型 A 对某个物理过程、历史事件或软件行为存在误解,那么由模型 A 批量生成的数据很可能系统性地保留这种误解。模型 B 即使把这些内容学得更熟练,也不等于更接近事实。
**模型坍塌(model collapse)是生成模型反复学习模型生成内容后,数据分布逐渐变窄、稀有模式消失或错误被循环放大的现象。**它不意味着使用一次合成数据就会让模型立即退化,而是提醒开发者:当训练集与真实分布脱钩,生成内容越多,未必代表有效信息越多。
这类似于让一群学生只根据彼此的答案整理教材,却不再查阅原始文献、做实验或接受外部评分。整理速度会越来越快,文本也可能越来越工整,但其中一个早期错误可能被改写成十种不同表述,最终看起来像是得到了广泛验证。
“真实经验”与真实语料不是同一个概念
**真实经验数据是智能体通过观察环境、采取行动并接收实际结果而形成的连续数据。**它不仅包括静态网页、书籍或聊天记录,也包括“做了什么、环境发生了什么、结果是否符合目标”这样的因果链条。
萨顿特别强调,AI 不能凭空制造其他人的思想,也无法仅靠模拟完整预测无人机与现实物理世界的互动。机器人电机存在摩擦、磨损、装配误差和温度变化,摄像头会受逆光与污渍影响,网络服务会出现延迟、权限变化和不可预期的用户输入;这些细节很难被一个预先设定的模拟器全部覆盖。
**环境反馈是智能体行动后由外部系统返回、可用于判断行为效果的信息。**对于编程智能体,反馈可以是程序能否编译、测试是否通过以及线上指标是否异常;对于机器人,反馈可以是物体是否被抓起、路径是否发生碰撞以及电机能耗;对于科研智能体,最终反馈则可能来自实验结果,而不是另一段语言模型生成的解释。
下面这张表可以更清楚地说明三类数据的差别:
| 数据路线 | 数据来自哪里 | 优势 | 主要风险 | 更适合的场景 | |---|---|---|---|---| | 真实静态数据 | 网页、书籍、代码库、业务记录、传感器历史数据 | 信息密度高,包含人类长期积累的知识 | 成本高、版权复杂、更新慢,存量有限 | 基础预训练、知识覆盖、语言能力 | | 合成数据 | 大模型、规则系统、仿真器 | 可快速扩展,可定向覆盖长尾任务,可控制格式 | 错误循环、分布变窄、缺乏外部真实性 | 蒸馏、格式训练、数学与代码练习、隐私敏感任务 | | 真实经验数据 | 智能体与软件、机器人或现实环境持续交互 | 能获得行动后果,适合学习因果关系和长期策略 | 采集慢、成本高,真实试错可能有安全风险 | Agent、机器人、自动驾驶、在线决策、持续学习 |
这个对比也解释了为什么萨顿没有简单主张“多抓一些网页”。在他的框架里,互联网文本依然主要是人类经验被压缩后的描述;AI 若只学习描述,就仍然没有亲自验证描述与现实是否一致。
这与《惨痛的教训》并不矛盾
萨顿的观点经常被误读成反对规模化计算,但他的经典判断恰恰强调通用计算方法最终会胜过大量手工编码的人类知识。围绕这次争议,更准确的问题不是“要不要规模化”,而是“规模化什么”。
**《惨痛的教训》所强调的是,能够利用持续增长算力进行搜索和学习的通用方法,长期往往优于依赖人类专家手工设计规则的方法。**这并不自动等价于“只要继续堆文本和参数,语言模型就会自然获得完整智能”。
萨顿认为,真正应该规模化的是智能体获得经验、预测环境和通过试错改进策略的过程,而不是无限复制人类已经说过的话。换句话说,他并不反对更多计算,而是认为算力应更多用于与环境交互,而非让模型永远停留在离线模仿阶段。
**强化学习是智能体通过行动、奖励和后续状态学习决策策略的方法。**与静态监督学习相比,强化学习关心的不只是“标准答案是什么”,还关心当前行动会怎样改变未来,以及一连串决策最终能否实现目标。
这也是萨顿长期研究路线与主流 LLM 路线之间最深的分歧。语言模型首先学习的是“下一个词最可能是什么”;经验型智能体首先要面对的是“我采取这个行动之后,世界究竟发生了什么”。前者可以复述游泳教程,后者必须真正下水并处理浮力、体力与水流。
合成数据仍然有用,但必须有外部裁判
合成数据在可验证任务上依然非常有价值,萨顿的批评不应被理解为开发者需要把所有生成数据从训练管线中删除。数学、代码、形式逻辑和游戏等领域存在相对可靠的验证器,模型可以批量生成候选答案,再由编译器、单元测试、定理证明器或游戏规则筛掉错误结果。
**可验证合成数据是由模型生成、再经过独立规则或外部工具判断正确性的训练数据。**它与“让模型自己生成答案,再让同一个模型判断答案”的自循环并不相同,因为前者至少引入了一个不依赖语言流畅度的外部裁判。
开发者真正需要警惕的是“生成即真相”的数据流水线。只根据另一个模型的偏好分数筛选回答,容易奖励措辞完整、自信且符合评审模型口味的内容,却未必奖励真实、可执行和可复现的内容。
不同合成数据方案的风险差异很大:
| 合成方式 | 是否有独立验证 | 可靠性判断 | 典型问题 | |---|---:|---|---| | 模型生成答案,直接用于训练 | 否 | 风险最高 | 幻觉与偏见被原样复制 | | 模型生成、另一个模型评分 | 较弱 | 取决于评审模型 | 两个模型可能共享同类盲点 | | 模型生成、人工抽样审核 | 部分 | 适合控制总体质量 | 成本高,长尾错误仍可能漏过 | | 模型生成、编译器或测试验证 | 是 | 在验证范围内较可靠 | 测试覆盖不足会产生“钻空子”行为 | | 仿真生成、现实数据校准 | 部分到较强 | 适合机器人与自动驾驶 | 存在仿真到现实的分布差异 | | 智能体真实执行并记录结果 | 是 | 最接近任务本身 | 昂贵、缓慢,且需要安全边界 |
因此,关键不是给数据贴上“真实”或“合成”的二元标签,而是追问三个问题:数据是否引入了新信息,是否存在独立验证,以及训练分布是否仍与部署环境一致。
科技公司正在为不可复制的真实数据付费
真实世界数据的稀缺性正在成为新的竞争壁垒。据 IT之家 8 月 19 日报道,OpenAI 此前曾公开寻找大规模专有数据集,希望获得无法轻易从互联网抓取的内容;同一报道还称,谷歌同意支付 1,000 万美元收购已破产 Spirit Airlines 的内部数据和软件。
这笔交易如果按报道所述完成,其价值不只是获得更多文本,而是获得公开互联网中不存在的业务流程、运营记录和软件系统。对模型公司而言,公开网页可以被多家竞争者重复收集,企业内部真实运行数据却具有排他性,也更接近 Agent 未来需要处理的工作环境。
真实数据争夺战还会改变 AI 公司的成本结构。过去的核心资源是 GPU、模型架构和工程人才;接下来,具备合法授权的企业数据、真实用户任务、软件执行环境和机器人交互记录,可能与算力同样重要。
不过,花钱购买真实数据也不等于自动获得智能。静态的航空公司内部记录依然只是历史切片,如果模型无法进入受控环境执行任务、接收反馈并持续修正策略,它得到的仍然是关于业务的描述,而不是处理业务的能力。
Oak Lab 押注的是持续学习,而不是更大的离线数据集
萨顿已经把这一判断变成创业方向。2026 年 7 月,他与前学生 Khurram Javed 共同创办 Oak Lab,目标是开发能够持续从自身经历中学习的 AI 智能体,而不是主要依赖提前整理好的超大规模数据集。
**持续学习是模型在部署后不断吸收新经验,同时尽量保留既有能力的学习范式。**当前多数大模型虽然每天服务海量用户,但基础权重并不会因为每次对话立即更新;模型“看起来在学习”,通常只是上下文增加了信息,或后台隔一段时间重新训练,并不是真正的在线持续学习。
持续学习的难点远比“保存聊天记录”复杂。模型需要区分偶然噪声与稳定规律,避免新知识覆盖旧知识,还要处理奖励投机、恶意反馈、隐私泄露和行为漂移。如果一个智能体可以自行更新,那么一次错误经验也可能改变其后续策略。
Oak Lab 至今尚未公布融资轮次或投资者信息,产品形态和技术指标也没有公开。因此,现在还不能把它视为已经验证萨顿路线的成功案例;它更像是一项明确的技术下注:LLM 可以充当语言接口和初始知识底座,但真正的能力增长要发生在部署后的经验循环中。
对开发者而言,下一代 Agent 要从“会回答”转向“会闭环”
开发团队短期内没有必要在 LLM 与强化学习之间二选一。更现实的架构是让语言模型承担理解指令、拆解任务和生成候选行动,再让外部工具、执行环境与结果验证器提供真实反馈。
一个可靠的 Agent 系统至少需要四层闭环:
- **感知层必须读取真实状态。**系统要获取数据库结果、页面变化、日志、传感器信号或任务队列,而不是只依赖模型对环境的猜测。
- **行动层必须产生可观察后果。**模型输出不能永远停留在自然语言建议,而应在权限控制下调用工具、修改状态或执行实验。
- **验证层必须独立于生成模型。**优先使用测试、规则、约束检查和真实业务指标,不能把另一次语言模型判断当成唯一真相。
- **记忆层必须记录经验而非只保存对话。**有价值的记忆应包含初始状态、采取的行动、环境反馈、失败原因和最终结果。
这种设计会比纯聊天应用更慢、更贵,也更难演示。聊天模型可以在几秒内给出一个听起来合理的答案,而经验闭环需要等待代码运行、用户确认、设备动作或业务结果;但只有后者能够提供萨顿所说的“基准真相”。
开发者还应把合成数据比例当作需要监控的工程指标。除了统计合成样本数量,更应分别追踪真实验证通过率、真实环境失败率、长尾任务覆盖率,以及模型在连续多轮执行后是否发生策略漂移。
萨顿可能低估了语言,但行业确实高估了自循环
萨顿对 LLM 的批评有力量,但“语言模仿无法产生智能”仍是一个尚未被证明的强判断。人类语言并非纯粹的表面符号,它压缩了大量实验、工程、社会协作和历史经验;模型通过语言学习,也能获得相当程度的世界规律,并通过工具调用间接影响现实。
真正的问题在于,压缩后的经验终究会损失细节。一本机器人维修手册可以告诉模型轴承磨损的常见表现,却无法替代具体设备的振动数据;一百万段驾驶视频可以覆盖大量道路场景,却不等于车辆已经学会在罕见冰面状态下安全控制。
行业更可能走向混合路线,而不是 LLM 被强化学习彻底替代。大模型提供预训练得到的通用知识、语言能力和任务先验,仿真环境提供低成本练习,真实环境则负责校准偏差、暴露未知变量并给出最终反馈。
这场争论的价值,也不在于判断谁能在一句话里定义 AGI。萨顿真正敲响的警钟是:当模型生成数据的速度远快于现实世界产生新经验的速度时,行业很容易把“数据量变大”误判成“知识边界扩大”。
合成数据可以让模型练习得更勤,却不能保证练习的是现实;语言模型可以描述世界,却不能仅凭描述证明自己理解了世界。下一阶段最稀缺的资源,或许不再是更多 token,而是能够让 AI 行动、犯错、接受外部检验并承担结果的真实环境。
参考来源
- IT之家:图灵奖得主萨顿警告 AI 行业过度依赖合成数据——报道萨顿在红杉资本播客中的最新表态,以及 Oak Lab、专有真实数据交易等信息。
- 知乎:图灵奖得主理查德·萨顿谈 LLM 与经验学习——梳理萨顿对世界模型、真实经验和持续学习路线的主要观点。



