Salesforce推理模型Koa来了

Salesforce 联合英伟达推出企业推理模型 Koa,基于 Nemotron-3-Super-120B 后训练而来,重点提升销售、营销、客服场景中的工具调用与多步骤任务能力。
Salesforce 推出 Koa:企业 AI 不再只依赖 Claude 和 ChatGPT
Salesforce 在 2026 年 Dreamforce 大会上发布了企业推理模型 Koa,正式补上了 Agentforce 在复杂推理能力上的关键一环。Koa 基于英伟达开放权重的 Nemotron-3-Super-120B 基础模型打造,由 Salesforce 与英伟达联合完成后训练,主要服务于销售、市场营销、客户服务和企业智能体等场景。
这不是又一个试图在通用能力榜单上挑战顶级闭源模型的产品。Koa 的真正目标,是把企业日常工作里那些需要多步判断、调用业务工具、读取客户上下文并执行操作的任务,交给一套更容易部署、治理和控制成本的模型。
换句话说,Salesforce 并没有把 Koa 包装成“另一个 ChatGPT”,而是把它定位成 Agentforce 平台里的企业级推理引擎。它不一定要在所有数学题、代码题或开放式知识问答上击败前沿模型,但需要在“查客户资料—判断意图—调用 CRM 工具—生成回复—更新记录”这类连续流程中稳定工作。

Koa 是什么:面向企业智能体的推理模型
Koa 是 Salesforce 基于 Nemotron-3-Super-120B 开放权重模型后训练得到的企业语言模型,重点优化工具调用、任务规划和多步骤业务流程执行能力。
根据论文摘要,Koa 采用强化学习方式进行后训练,使用了 Group Relative Policy Optimization,即 GRPO。与传统监督微调主要学习“标准答案”不同,GRPO 会让模型针对多个候选结果进行相对比较,从而鼓励模型生成更符合任务目标的答案。
在企业智能体场景中,模型的好坏并不只取决于回复是否流畅。它还要判断什么时候查询数据库、该调用哪个工具、参数是否完整、上一步执行失败后是否需要重试,以及什么时候应该把问题转交给人工员工。这些动作如果有一个环节出错,最终结果就可能不是“回答得不够好”,而是直接修改了错误的客户记录、发出了错误的邮件,甚至触发了不该触发的业务流程。
因此,Koa 的训练重点是 agentic tool use,也就是面向智能体的工具使用能力。它需要把自然语言请求拆成可以执行的步骤,再根据工具返回的结果继续推理。对企业来说,这比单纯增加模型的聊天能力更有价值。
Salesforce 为什么现在要做自研推理模型
Salesforce 开发 Koa 的直接原因,是 Agentforce 过去在复杂推理任务上需要依赖外部前沿模型。
在 Koa 出现之前,Agentforce 可以根据请求类型,通过 AI Gateway 把任务路由到不同模型。简单的分类、摘要或字段提取可以交给速度更快、成本更低的小模型;长流程任务和多步骤推理,则可能转发到 Claude 或 ChatGPT 等第三方模型。
这种架构灵活,但也有三个明显问题。
第一,企业客户对数据边界越来越敏感。客服对话、销售机会、合同内容和客户健康度等信息,往往属于企业最核心的数据资产。即使第三方模型服务商提供了数据保护承诺,企业仍然需要评估数据如何传输、在哪里处理、保留多久,以及是否符合行业监管要求。
第二,通用前沿模型的能力并不等于企业工作流能力。一个模型可以在复杂数学题上表现突出,但不一定知道 Salesforce 对象、字段、权限和业务规则之间的关系。企业真正需要的,通常不是更长的答案,而是更少的错误工具调用、更高的任务完成率和更稳定的流程执行。
第三,长链路智能体任务的成本会快速累积。一个客服智能体可能需要读取客户历史、查询订单、检查库存、匹配退换货政策,再生成最终回复。每一步都消耗 token,若所有环节都使用最昂贵的前沿模型,单次任务的成本可能远高于一次普通问答。
Koa 的意义在于,Salesforce 可以把一部分高频企业任务留在自己的平台和模型体系内,而不是把复杂请求全部交给外部模型服务商。这是产品控制力、数据治理和成本控制的结合,而不只是一次模型发布。
Koa 的训练数据不包含真实客户数据
Koa 使用公开数据和合成数据进行训练,没有摄入 Salesforce 客户的真实业务数据。
这一点是企业采用 Koa 时最容易关注的特性之一。Salesforce 表示,Koa 的训练过程没有使用真实客户数据,而是通过公开数据和合成数据训练模型的通用能力与企业任务能力。
这并不意味着企业使用 Koa 后可以完全不做安全评估。模型依然需要接受权限控制、输出审计、提示注入防护和工具调用隔离等安全机制约束。但从训练数据边界来看,客户不需要担心自己的 CRM 记录被直接用于训练一个面向其他客户的基础模型。
对于金融、医疗、政府和大型制造企业来说,数据治理不是部署后的附加功能,而是采购决策的前置条件。模型是否允许部署在受控环境中、数据是否能够留在企业安全边界内、不同租户之间能否严格隔离,往往比榜单上的几个百分点更重要。
Nemotron-3-Super-120B 为 Koa 提供了什么
Nemotron-3-Super-120B 是 Koa 所依赖的开放权重基础模型,Koa 主要通过后训练而不是从零预训练获得企业场景能力。
从技术路线看,Salesforce 没有重新训练一套完整的基础模型,而是选择英伟达的 Nemotron-3-Super-120B 作为底座,再利用强化学习和企业任务数据进行定向优化。这样做可以减少从零开始训练大模型所需的算力、数据和时间,也让 Salesforce 能够把更多资源集中在工具调用、业务流程和安全约束上。
开放权重的价值也不只是“免费”。它意味着企业和模型提供方拥有更多部署与适配空间,可以根据不同环境选择公有云、私有云或本地基础设施,并对推理过程进行更细的控制。当然,开放权重并不自动等于低成本或易部署。120B 级别模型的显存、并行和运维要求仍然不低,企业需要结合量化、批处理、推理加速和模型路由做整体规划。
英伟达此前还强调,Nemotron 系列模型面向智能体任务提供了可配置的思考预算,并通过混合专家架构、紧凑型量化模型等方式降低推理成本。相关资料提到,在特定推理工作流中,这类组合最高可以将推理成本降低 60%。不过,这个数字取决于模型版本、任务复杂度、硬件环境和对比基线,不能直接理解为所有 Koa 任务都能降低 60%。
Koa 在 Agentforce 中扮演什么角色
Agentforce 是 Salesforce 的企业智能体平台,Koa 将作为其中可选的推理模型,为智能体提供规划、工具调用和业务流程执行能力。
企业可以在 Agentforce 中创建面向不同岗位的智能体。例如,客服智能体可以识别客户意图、检索订单信息并根据政策生成回复;销售智能体可以整理客户互动历史、判断销售机会阶段,并提醒销售人员下一步跟进;市场营销智能体则可以根据客户画像和活动数据生成内容或筛选潜在客户。
过去,这些任务可能由多个小型模型和外部前沿模型共同完成。Koa 的加入,让 Salesforce 能够在同一套平台内提供更完整的模型选择:
- 简单分类、摘要和字段抽取,优先使用速度快、成本低的模型;
- 需要读取长上下文或执行多步操作的任务,使用具备更强推理能力的模型;
- 对高风险决策、复杂分析或开放式问题,再根据企业策略调用外部前沿模型;
- 对涉及敏感数据的任务,优先选择可以在受控环境中运行的模型。
这种路由机制的价值,在于企业不需要用同一个模型解决所有问题。AI Gateway 更像一个交通调度系统:它根据任务难度、数据敏感程度、延迟要求和成本预算,把请求送到更合适的模型上。
Koa 与通用闭源模型的差异
Koa 的竞争力不在于“什么都能聊”,而在于“能否把企业任务做完”。将它与 Claude、ChatGPT 等通用前沿模型直接比较,容易得出错误结论,因为两者的优化目标并不完全相同。
| 对比维度 | Salesforce Koa | 通用闭源前沿模型 | 企业实际影响 | |---|---|---|---| | 基础路线 | 基于 Nemotron-3-Super-120B 后训练 | 由模型厂商自建闭源基础模型 | Koa 的开放权重路线更利于定制和受控部署 | | 主要场景 | 销售、营销、客服、工具调用 | 通用问答、代码、分析和复杂推理 | Koa 更聚焦 CRM 与业务流程 | | 训练数据 | 公开数据与合成数据,不使用真实客户数据 | 各厂商训练数据策略不同 | 企业更容易审查数据边界 | | 推理方式 | 通过 GRPO 等方法强化任务执行能力 | 通常采用通用能力与推理能力联合优化 | Koa 更强调工具调用和流程完成率 | | 部署控制 | 可结合 Agentforce 与受控基础设施 | 主要依赖模型厂商提供的服务 | Koa 更适合有数据驻留要求的企业 | | 模型选择 | 可通过 AI Gateway 进行路由 | 通常围绕单一模型服务体系 | 企业可以平衡延迟、质量与成本 | | 适合任务 | 多步骤业务操作、结构化流程 | 开放式复杂问题和跨领域任务 | 两类模型可能长期共存,而非互相替代 |
从这个表格可以看出,Koa 并不是要全面取代外部前沿模型。Salesforce 更可能把它用于高频、标准化、与 CRM 数据和工具深度绑定的工作流,而把少量非常复杂、开放性很强的任务交给更通用的模型。
真正的考验:不是聊天质量,而是任务完成率
企业模型最终需要用任务完成率、错误操作率和单位任务成本来衡量,而不是只看聊天演示是否自然。
例如,一个客服智能体需要完成以下流程:识别客户身份、查询最近订单、判断是否符合退货条件、检查库存、创建售后工单,并向客户说明处理结果。模型如果能写出一段漂亮的回复,但漏掉了权限检查或错误调用了退款工具,这个系统仍然不合格。
Koa 的价值要通过一组更具体的指标验证,包括:
- 工具调用准确率:模型是否选择了正确的工具,以及是否填写了正确参数;
- 多步骤任务完成率:任务经过五步、十步甚至更长链路后,最终是否达到业务目标;
- 错误恢复能力:工具返回异常、数据缺失或权限不足时,模型是否能停止、重试或转人工;
- 推理 token 数量:完成同一任务需要生成多少 token,直接影响推理成本和响应时间;
- 延迟与吞吐量:高峰期能否同时处理大量客户请求;
- 合规与可审计性:企业能否知道模型为什么做出某个决定,以及谁批准了最终动作。
目前公开资料主要说明了 Koa 的模型路线、训练方式和定位,尚未给出足够完整的第三方基准成绩、商业定价或与 Claude、ChatGPT 的统一测试结果。因此,现阶段不宜直接宣称 Koa 已经在通用能力上击败闭源前沿模型。更准确的判断是:Salesforce 正在把企业 AI 的竞争标准,从“谁的模型更聪明”转向“谁能以更低风险完成更多真实工作”。
对企业客户意味着什么
Koa 的发布会进一步推动企业 AI 采购从单模型采购转向模型组合管理。企业未来可能同时使用多个模型,并根据数据敏感度、任务复杂度和成本预算自动切换。
对 Salesforce 客户来说,最大的变化可能不是多了一个聊天机器人,而是 Agentforce 的模型层更加完整。企业可以在 Salesforce 业务数据、权限系统、工作流和智能体框架之上,选择更适合自身要求的推理模型。
对开发者来说,模型开放权重也带来更多实验空间。开发者可以围绕工具调用格式、工作流规划、错误恢复和领域任务构建评测集,而不是只做提示词优化。企业 AI 的核心工作正在从“写一个好提示词”转向“设计一套可观测、可回滚、可审计的智能体系统”。
但 Koa 也面临现实限制。首先,企业模型的表现高度依赖上下文工程、工具描述和业务数据质量,模型本身并不能自动修复混乱的 CRM 数据。其次,开放权重模型并不意味着部署没有门槛,企业仍需要承担硬件、推理服务和安全运维成本。最后,如果模型主要绑定在 Agentforce 生态内,客户还需要评估平台依赖和长期迁移成本。
OpenAI、Anthropic 等模型厂商会受到什么影响
Salesforce 的动作对闭源模型厂商的真正压力,不是少卖出几个通用模型调用,而是企业开始拥有更强的议价能力。
过去,企业面对复杂智能体任务时,往往只能在少数前沿模型中选择。现在,像 Salesforce 这样的 SaaS 厂商可以利用自身的业务数据、工作流和客户场景,训练出更窄但更实用的模型。只要这些模型在特定任务上的成本更低、合规性更好,企业就没有必要把所有请求都交给最大、最昂贵的通用模型。
这会形成一种新的分工:通用前沿模型负责开放式推理和跨领域能力,行业模型负责高频业务流程,轻量模型负责分类、抽取与路由。最终的赢家不一定是参数规模最大的模型,而可能是最懂得如何把模型嵌入业务流程的平台。
结论:Koa 是 Salesforce 的模型自主权尝试
Salesforce 推出 Koa,标志着它不再满足于做外部大模型的企业接入层,而是开始掌握 Agentforce 的核心推理能力。
Koa 的卖点很明确:基于 Nemotron-3-Super-120B 开放权重模型,使用公开数据和合成数据进行后训练,通过 GRPO 强化工具调用和智能体任务能力,并在 Agentforce 中与其他模型协同工作。它不追求成为所有领域的第一名,而是试图成为销售、营销和客服流程中更可控、更节省成本的执行者。
短期来看,Koa 能否真正撼动 Claude、ChatGPT 等闭源模型,还要看公开基准、实际客户案例和成本数据。长期来看,它更重要的意义在于证明了一件事:企业 AI 的下一场竞争,不只是基础模型之间的竞争,也会是 SaaS 平台利用业务场景训练专用模型、重新掌握模型选择权的竞争。
对于开发者和企业技术负责人,值得关注的不是 Koa 的宣传口号,而是三个问题:它在真实工具调用任务中的完成率是多少?每个任务的推理成本降低了多少?企业能否在自己的安全边界内部署、监控和审计?这三个问题的答案,才决定 Koa 是一次产品包装,还是企业推理模型走向成熟的信号。
参考来源
- IT之家:Salesforce 联合英伟达推出 Koa 推理大模型,挑战闭源前沿模型 —— 介绍 Koa 在 Dreamforce 大会上的发布背景、产品定位以及 Agentforce 中的模型路由方式。
- 英伟达中文博客:CrowdStrike、Uber 和 Zoom 等行业先驱利用 NVIDIA Nemotron 和 Cosmos 推理模型 —— 介绍 Nemotron 系列模型面向企业智能体的推理效率、可配置思考预算及行业应用情况。



