AI 快讯王云鹤创业首模亮相
模型上新

王云鹤创业首模亮相

2026-09-08T06:08:02.992Z
王云鹤创业首模亮相

原华为盘古大模型负责人王云鹤创业后的首个模型近日曝光。基元律动试图把多模型路由中积累的真实任务、模型选择和用户反馈,反过来用于训练面向 Agent 的新模型。

王云鹤创业首模亮相:多模型执行经验开始反哺模型训练

原华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创业后的首个模型,近日正式交出答卷。

这次发布的重点,不只是“又一个模型上线”,而是它背后的训练路径:基元律动先通过多模型路由系统处理真实 Agent 任务,再把模型选择、任务拆解、执行结果和用户反馈沉淀下来,用于训练自己的模型。

**多模型路由是根据任务类型、执行阶段和成本约束,自动选择并切换不同大模型的技术体系。**过去,这类系统通常被看作模型调用层,价值主要体现在降低成本、改善延迟和提高任务成功率。王云鹤想做的,是让这一层继续向上生长,成为新模型的训练数据和能力来源。

这也是他离开华为、创办基元律动半年后,首次把“Routing Harness”和“Agent-Native Model”这条路线落到具体模型上。

王云鹤创业后首个模型与多模型路由系统的关系示意图

先做调度,再做模型

基元律动的核心判断是,大模型竞争正在从单模型能力竞争,转向复杂任务中的多模型协同竞争。

一个 Agent 任务往往不是一次问答,而是十几轮甚至数十轮执行。例如,用户要求 Agent 完成一份行业研究报告,系统可能需要先检索资料,再清洗数据、提炼观点、生成图表、检查事实,最后完成排版。不同环节对模型的要求并不一样:检索结果整理不需要最昂贵的推理模型,复杂判断和代码执行却可能需要更强的模型。

**Routing Harness 是为多模型 Agent 提供任务拆解、模型选择、调用切换和结果评估的执行底座。**它更接近软件工程里的运行时系统,而不是一个简单的模型聚合页面。

在王云鹤此前公开谈到的 OpenSquilla 产品中,系统会逐轮判断当前步骤适合调用哪一个模型:需要深度推理的步骤交给能力更强的模型,格式整理、分类、摘要等步骤则使用成本更低的模型。这样做的目标,是用低于全程调用顶尖模型的价格,获得接近甚至相同的最终质量。

这套思路的价值并不难理解。假设一个复杂任务需要 20 次模型调用,其中只有 5 次真正需要强推理模型,另外 15 次只是信息抽取、格式转换和中间结果整理。若全部使用最高价模型,系统会为大量低难度步骤支付溢价;若全部使用便宜模型,最终质量又可能不稳定。路由系统解决的是“每一步该用谁”的问题。

但基元律动显然不满足于此。

如果路由系统每天处理大量真实任务,它看到的不只是用户的输入和模型的输出,还包括每一步调用了什么模型、模型在哪个阶段失败、用户是否接受结果、Agent 是否需要重试、不同模型之间如何接力。这些信号对训练面向 Agent 的模型,比静态问答数据更接近真实生产环境。

从“调用记录”到训练信号

基元律动试图利用的,不是简单的调用日志,而是完整的任务执行轨迹。

**Agent 轨迹是记录智能体从目标理解、步骤规划、工具调用到结果交付全过程的结构化执行记录。**传统模型训练通常以“问题—答案”作为基本样本,而 Agent 训练更关注中间过程:为什么选择某个工具,为什么切换模型,哪一步导致任务失败,怎样修正后才能完成目标。

对于一个多模型路由系统来说,一次任务至少可以产生几类训练信号:

  • 模型选择信号:在特定任务阶段,哪类模型更容易得到正确结果。
  • 执行质量信号:模型输出是否被后续步骤采用,是否触发重试或回退。
  • 成本与延迟信号:完成同一任务时,不同模型组合的价格和耗时差异。
  • 用户反馈信号:用户是否修改、拒绝、重新提问或直接采纳结果。
  • 协同策略信号:强模型、快模型和专用模型怎样分工,才能让整体任务更稳定。

这些信号可以反过来用于训练模型的路由能力、规划能力和工具使用能力。换句话说,模型学习的对象不再只是“怎样回答一个问题”,而是“怎样组织一组模型和工具,把任务完成”。

这也是“Agent-Native Model”的含义。

**Agent-Native Model 是从设计目标上就面向多轮任务执行、工具调用和环境反馈训练的模型,而不是把普通聊天模型直接包装成 Agent。**它可能不以单轮对话的语言流畅度作为唯一指标,而更看重任务完成率、步骤规划质量、工具调用准确率、失败恢复能力和单位成本产出。

王云鹤此前在接受《晚点 LatePost》采访时提到,模型之间存在差异,这正是第三方路由存在的空间。这个判断也解释了基元律动为什么没有直接从“训练一个更大的通用模型”切入,而是先搭建多模型执行系统。

这不是传统意义上的“模型发布”

目前公开信息没有披露该模型的参数规模、训练数据规模、上下文长度、推理价格和标准跑分,因此它暂时无法与 GPT、Claude、Gemini、Qwen 或 DeepSeek 等模型进行严格的参数级对比。

这点需要明确:基元律动此次交出的首个模型,更像是一次产品和训练路线的公开亮相,而不是一场以参数规模或榜单成绩为核心的模型发布会。

从公开信息看,它的差异化主要集中在三个方面:

  1. 训练数据来自真实多模型执行过程。模型不只学习人工整理的标准答案,还可能学习不同模型在复杂任务中的分工和协作。
  2. 优化目标更接近任务完成。相比单纯追求问答准确率,它需要面对任务拆解、工具使用、模型切换和错误恢复。
  3. 与 Routing Harness 形成闭环。路由系统负责产生真实任务数据,模型再反过来提升路由和执行能力。

| 方向 | 传统通用模型 | 多模型路由系统 | Agent-Native Model | |---|---|---|---| | 核心对象 | 单轮或多轮文本生成 | 多个模型的任务协同 | 面向完整任务的智能体执行 | | 主要输入 | 指令、上下文和知识 | 任务阶段、模型表现和成本约束 | 目标、环境状态、工具和历史轨迹 | | 主要指标 | 准确率、推理能力、上下文能力 | 成功率、延迟、成本和稳定性 | 任务完成率、规划质量、恢复能力和成本 | | 典型价值 | 直接生成答案 | 选择最合适的模型组合 | 独立完成复杂工作流 | | 数据来源 | 预训练语料和指令数据 | 调用结果与用户反馈 | 多模型执行轨迹和环境反馈 |

因此,判断这个模型有没有价值,不能只看它在某个静态榜单上的分数。更关键的问题是:它能否在真实工作流中减少失败步骤,能否比单一强模型更便宜地完成任务,能否在模型能力变化后仍然保持稳定。

路由层为什么可能成为训练入口

大模型厂商通常掌握模型本身,却未必能看到模型在所有真实业务中的完整执行过程。第三方路由平台恰恰处在不同模型和真实任务之间,能够观察到更丰富的横向数据。

**模型路由平台是连接用户任务、多个模型和工具执行环境的中间基础设施。**它的独特之处在于,可以把不同模型放进同一个任务框架,用统一指标比较它们在不同阶段的表现。

例如,在一项代码修复任务中,系统可能发现:某模型擅长定位错误,另一模型更适合修改代码,第三个模型在测试失败后更擅长分析日志。单看聊天结果,很难发现这种能力结构;把任务拆成多个步骤后,模型之间的差异会变得清晰。

这些差异可以形成一种“能力地图”:什么模型适合什么任务,什么模型适合哪个阶段,怎样组合才能降低成本,什么时候应该让强模型接管。随着样本数量增加,路由系统就有机会从经验规则逐渐过渡到学习型调度。

更进一步,模型训练也可以从这些执行轨迹中得到偏好数据。一个结果是否好,不再只由标注员判断,还可以由后续行为验证:代码是否通过测试,报告是否被用户采纳,自动化流程是否顺利结束,用户是否需要重新修改。

这类反馈的优势是更贴近结果,缺点是噪声也更大。用户没有继续追问,不一定代表结果正确;任务成功结束,也不一定说明每一步都做得最优。基元律动需要解决的,正是如何从复杂、带噪声的生产数据中提取可靠训练信号。

与 OpenRouter 等平台的区别在哪里

基元律动选择的赛道,很容易被拿来与 OpenRouter 等大模型路由平台比较,但两者的定位并不完全相同。

OpenRouter 更接近全球模型分发和调用入口,核心价值是让开发者以相对统一的方式访问多个模型。基元律动公开强调的则是面向 Agent 的 Routing Harness,以及从执行数据进一步训练 Agent-Native Model。

| 对比项 | OpenRouter | 基元律动公开路线 | |---|---|---| | 主要定位 | 多模型访问与路由平台 | Agent 执行底座与模型训练体系 | | 核心用户 | 开发者、应用厂商 | 企业 Agent、生产力工具和开发者 | | 主要问题 | 如何访问和选择不同模型 | 如何让复杂任务在多个模型间稳定完成 | | 数据价值 | 调用流量和模型使用反馈 | 任务轨迹、模型协作和结果反馈 | | 长期目标 | 成为模型流量入口 | 从路由基础设施走向 Agent 模型 |

当然,这个区别目前更多体现为战略方向,而不是已经被公开产品完全验证的结果。路由平台能否真正沉淀高质量训练数据,取决于任务规模、数据授权、评估体系和模型训练能力。仅有大量调用量,并不能自动转化为更强模型。

据雷峰网 8 月 26 日报道,基元律动单日 Token 调用量已经突破 5000 亿,并完成新一轮融资,累计融资金额达到数千万美元。这个调用规模如果属实,意味着它有机会获得足够丰富的真实任务样本。但 Token 数量本身不是模型能力的直接证明,关键还要看其中有多少是高价值、多步骤、可评估的 Agent 任务。

创业背景:从盘古到 Agent 基础设施

王云鹤于 2026 年 3 月离开华为,随后与前华为诺亚方舟实验室首席研究员韩凯共同创办基元律动。

公开资料显示,王云鹤 1991 年出生,本科毕业于西安电子科技大学数学与应用数学专业,后在北京大学攻读博士。他在 2017 年进入华为诺亚方舟实验室实习,2018 年博士毕业后正式加入华为,先后负责机器学习、计算机视觉、模型压缩和大模型等方向。

他曾参与 GhostNet 等轻量级神经网络相关工作,也曾担任华为诺亚方舟实验室主任和盘古大模型负责人。2025 年,王云鹤接棒姚骏,负责盘古大模型研发;2026 年 3 月,他还以项目负责人身份出席盘古大模型全面开源发布会。

从履历看,他完全可以继续押注通用大模型、世界模型或具身智能。但他选择了一个看起来更靠近基础设施、却又试图重新回到模型训练的方向。

这条路线的吸引力在于,它绕开了单纯堆算力和堆参数的正面竞争。创业公司很难在训练规模上与头部科技公司长期对抗,但可以先从模型使用现场积累数据,再用这些数据训练更适合真实任务的模型。

问题是,路由层的窗口期究竟有多长。

最大质疑:强模型会不会吞掉路由层

对路由基础设施最大的质疑是,随着顶尖模型不断增强,今天需要多个模型协同完成的任务,明天可能由一个强模型直接完成。

这个质疑并非没有道理。模型能力持续提升后,应用开发者会倾向于减少系统复杂度。假如一个模型能够同时完成规划、搜索、编码、审核和交付,企业就没有动力维护复杂的多模型调度系统。

但“一个模型吞噬一切”也有现实边界。

第一,能力最强的模型通常并不意味着成本最低。企业任务量扩大后,单位成本会直接影响产品毛利。即便强模型可以完成所有步骤,简单任务仍然没有必要使用最高成本模型。

第二,不同模型的能力差异不会只体现在总榜分数上。一个模型可能擅长长文本分析,另一个模型可能在代码补全、中文写作、视觉理解或结构化输出上更稳定。Agent 任务是多个能力的组合,不是一个总分可以概括的单一维度。

第三,企业更关心可控性。模型输出不稳定、工具调用失败、上下文过长和权限边界错误,都会影响生产系统。路由层可以作为监控、回退、评估和成本治理的位置,即使未来模型更强,这些工程问题也不会自然消失。

因此,路由层是否会消失,取决于它最终只是“模型选择器”,还是能成为 Agent 的执行控制面。如果只是把请求转发给不同模型,竞争优势很容易被模型厂商和云平台复制;如果它能掌握任务分解、执行评估、反馈学习和企业工作流数据,价值就不止是节省几分钱调用成本。

现在还不能急着下结论

基元律动首个模型的发布,最值得关注的不是参数规模,而是它能否证明“执行数据反哺模型训练”确实有效。

接下来至少有四个指标值得观察:

  • 真实任务完成率:模型能否在多轮工具调用中完成任务,而不是只在单轮问答中表现良好。
  • 单位任务成本:与全程使用顶尖模型相比,整体成本能降低多少;与单一低价模型相比,质量提升多少。
  • 失败恢复能力:工具报错、模型输出格式错误或中间步骤失败后,系统能否自动修正。
  • 跨模型泛化能力:更换底层模型后,Agent 是否仍然能够稳定工作,还是严重依赖某几个模型。

如果未来官方披露参数规模、训练方法、评测集、任务完成率和价格,外界才有可能对它进行更严格的横向比较。在此之前,把它称为“又一个国产大模型”并不准确;更准确的说法是:这是一次从多模型执行基础设施向 Agent 模型训练的产品化尝试。

OpenAI Hub 判断

王云鹤创业后的首个模型,真正押注的是一个闭环:用 Routing Harness 观察复杂任务,用真实执行轨迹训练模型,再让模型提升 Agent 的执行效率。

这条路线有明显优势。它能接触到传统模型厂商不一定拥有的横向数据,也能把成本、延迟、失败率和用户反馈纳入训练目标。对于企业 Agent 来说,这些指标往往比聊天榜单上的几分差距更重要。

但它也有更高的验证门槛。多模型调用量不等于高质量数据,真实轨迹不等于有效监督,路由策略也不等于模型能力。基元律动最终能否从基础设施公司走向模型公司,要看它能不能把“看见任务”转化为“学会完成任务”。

截至 2026 年 9 月 8 日,公开信息尚不足以证明这款首个模型已经在通用能力上超过主流大模型。它的意义更像是方向上的信号:在模型越来越多、Agent 任务越来越复杂的阶段,模型训练开始从静态数据集走向动态执行环境,而多模型基础设施可能成为新的数据入口和训练入口。

这比发布一个参数更大的模型更值得跟踪。

参考来源

  • GitHub:用于检索基元律动、OpenSquilla 及相关公开项目线索,具体信息以官方发布为准。
  • GitHub Topics: AI Agents:Agent 开源项目与执行框架的公开资料索引,可用于了解相关技术生态。

本文根据公开报道和采访资料整理,基元律动首个模型的参数、训练数据、价格及标准评测结果,需等待官方进一步披露。

相关推荐

查看全部