AI 快讯英伟达筹备万亿参数Nemotron 4
模型上新

英伟达筹备万亿参数Nemotron 4

2026-08-11T17:05:02.748Z
英伟达筹备万亿参数Nemotron 4

英伟达据称正在训练至少1万亿参数的Nemotron 4,最快可能于2026年秋末就绪。它既是对顶级开放模型的追赶,也是英伟达扩大GPU与软件生态需求的一步棋。

英伟达要把 Nemotron 推到万亿参数

英伟达正在研发新一代开放模型系列 Nemotron 4,其中最大版本预计至少拥有 1 万亿个参数,目标是进入全球顶级开放模型的竞争区间。

IT之家援引 The Information 的报道,多名项目参与者透露,Nemotron 4 仍未完成最终训练,英伟达也没有确定正式发布日期。内部参与者目前给出的最积极时间表,是模型可能在 2026 年秋末准备就绪。

这意味着 Nemotron 4 现在仍是一款“在训练中的模型”,而不是已经发布、可以下载权重或部署的产品。参数规模、模型架构、上下文长度、许可证、训练数据、推理成本以及最终是否完整开放权重,都要等英伟达正式公告才能确认。

英伟达Nemotron模型演进路线示意图,从Nemotron-4 340B、Nemotron 3 Super、Nemotron 3 Ultra延伸至传闻中的万亿参数Nemotron 4

“万亿参数”很大,但不等于每次推理都运行万亿参数

万亿参数模型是指模型总参数量达到或超过 1,000,000,000,000 个,但总参数量并不能直接代表推理速度、运行成本或实际能力。

Nemotron 4 最大版本是否采用混合专家架构,目前没有得到英伟达确认。混合专家模型(Mixture of Experts,MoE)是一种每次只激活部分专家网络的架构,它可以把模型的总容量做得很大,同时把单次推理计算量控制在远低于总参数规模的水平。

如果 Nemotron 4 是稠密模型,那么万亿参数几乎意味着万亿参数都会参与每个 token 的计算,推理成本会极其高昂。如果它采用 MoE,并把活跃参数控制在数百亿级别,那么“1 万亿总参数”更接近一个容量指标,而不是每次推理的真实计算量。

仅从权重存储估算,1 万亿参数使用 FP16 或 BF16 精度需要约 2 TB 显存,使用 8-bit 权重量化需要约 1 TB,使用 4-bit 权重量化也需要约 500 GB。这些数字还没有计入 KV Cache、激活值、路由模块、运行时缓冲区和并行通信开销,因此实际部署需要的显存会更高。

以单卡 80 GB 显存为例,FP16 权重理论上至少需要 25 张卡才能装下,4-bit 权重理论上也需要至少 7 张卡;以单卡 141 GB 显存计算,对应的理论下限分别约为 15 张和 4 张。现实部署通常需要预留更多空间,所以“能装下”和“能以可接受吞吐运行”是两件不同的事。

这也是判断 Nemotron 4 成色时最重要的技术问题:英伟达需要公布的不只是总参数,而是活跃参数、每 token 计算量、首 token 延迟、输出吞吐、长上下文性能和单位任务成本。

Nemotron 4 的命名可能再次制造混淆

Nemotron 4 是英伟达据称正在开发的新一代模型系列,但这个名称容易与 2024 年发布的 Nemotron-4 340B 混淆。

旧款 Nemotron-4 340B 是一个 3400 亿参数系列,包含 Base、Instruct 和 Reward 三类模型,并使用约 9 万亿 token 进行训练。它的重要用途不是直接争夺聊天助手榜首,而是生成合成数据、训练奖励模型,并帮助企业构建垂直领域模型。

新一代 Nemotron 4 则被描述为面向前沿开放模型竞争的系列,最大版本参数规模至少达到旧款 340B 的约 2.94 倍。两者名称中的连字符、空格和代际逻辑并不直观,开发者在检索模型、论文和权重时需要特别核对发布日期与具体参数规模。

目前可整理出的 Nemotron 产品演进如下:

| 模型 | 总参数量 | 活跃参数量 | 上下文 | 当前状态 | 主要定位 | |---|---:|---:|---:|---|---| | Nemotron-4 340B | 3400 亿 | 未披露 | 以官方模型卡为准 | 已发布的旧系列 | 合成数据、指令模型、奖励模型 | | Nemotron 3 Super | 1200 亿 | 120 亿 | 100 万 token | 已公开 | Agent 与高效率推理 | | Nemotron 3 Ultra | 5500 亿 | 550 亿 | 100 万 token | 已披露,具体开放进度需看官方模型页 | 大规模基础模型与Agent底座 | | Nemotron 3.5 Lightning | 官方尚未完整披露 | 官方尚未完整披露 | 官方尚未完整披露 | 已对外公布 | 代码审查、工具调用、安全监控等任务 | | Nemotron 4 最大版本 | 至少 1 万亿,据报道 | 未披露 | 未披露 | 训练尚未完成 | 挑战顶级开放模型 |

表格中的 Nemotron 4 信息仍来自媒体报道,而不是正式模型卡。任何具体跑分、许可证和硬件需求在官方发布前都不应被当作既定事实。

英伟达真正想卖的仍然是整套计算平台

英伟达投资开放模型并不是单纯做一个聊天机器人,而是希望把模型、数据、训练框架、推理引擎和 GPU 绑定成完整的开发闭环。

英伟达生成式 AI 副总裁 Kari Briski 表示,公司投资 Nemotron,是因为相信每家企业和每个国家都需要可及的前沿开放模型。这一表态强调了“主权 AI”和企业私有化部署,但从商业上看,模型规模越大,对 GPU 集群、互联网络和推理优化的要求也越高。

Nemotron 因而更像英伟达硬件生态的需求生成器。开发者可以在开放权重上微调和部署,企业可以把数据留在自己的基础设施中,而英伟达则有机会同时推动 GPU、CUDA、NeMo、TensorRT-LLM 以及相关部署工具的采用。

这种策略与芯片公司的传统做法并不矛盾。过去,英伟达通过 CUDA 让开发者更容易使用 GPU;现在,它需要用足够有竞争力的模型,让企业拥有继续扩建 GPU 集群的理由。

Nemotron 4 如果只是参数大、实际效果一般,反而会放大“为了卖卡而堆规模”的质疑。Nemotron 4 如果能在代码、工具调用、长程规划、检索增强和多轮 Agent 任务上达到一线水平,它才可能成为英伟达软件栈真正有吸引力的入口。

Agent 能力可能比聊天跑分更重要

Agent 模型是能够调用工具、分解任务、执行多步操作并根据反馈继续行动的模型,它与只生成一次回答的传统聊天模型有明显区别。

英伟达近期的 Nemotron 产品方向已经明显偏向 Agent。报道提到,Nemotron 3.5 Lightning 主要面向代码审查、工具调用、安全警报监控和账单问答等任务,这些场景都需要模型连接企业系统,而不是只在对话框中输出文本。

企业真正愿意支付成本的场景也正在从“写一段内容”转向“完成一项工作”。代码审查需要读取代码仓库和测试结果,安全监控需要分析告警并调用处置工具,账单问答则需要查询数据库、核对权限和解释费用明细。

万亿参数在这些任务中的价值不一定体现为更会聊天,而可能体现为更稳定的工具选择、更低的参数填错率、更长的任务链和更好的异常恢复。一个模型即使基准测试高出几分,只要在第十步调用工具时频繁出错,就很难进入生产环境。

因此,Nemotron 4 发布时最值得关注的不是单一 MMLU 类成绩,而是 SWE-bench 类代码任务、工具调用成功率、长任务完成率、并发吞吐和单位成功任务成本。对于 Agent 来说,“每百万 token 价格”也不是完整指标,因为失败后反复重试可能比单次推理贵得多。

NeMo Switchyard 补上了多模型协作的一环

NeMo Switchyard 是英伟达推出的开源模型路由库,它会根据任务类型、质量要求和运行条件,把请求分配给更合适的模型。

模型路由的逻辑类似给 AI 系统安装一个调度台:简单分类和信息抽取交给小模型,复杂代码修改和长程规划交给大模型,涉及特定领域知识时再切换到专门微调的模型。这样做比所有请求都调用万亿参数模型更现实。

Nemotron 4 与 Switchyard 的组合也解释了英伟达为什么需要一整套不同尺寸的模型。Lightning 可以处理强调速度和吞吐的任务,Super 或 Ultra 可以覆盖中高难度工作,万亿参数版本则承担低频但复杂的推理与规划。

这种“模型组合”比单纯追求一个万能模型更符合企业部署需求。只要路由准确,小模型承担大部分流量可以降低成本;只有真正困难的请求才升级到旗舰模型,从而把总体延迟和硬件占用控制在合理范围。

开放权重不等于完整开源

开放权重模型是指开发者能够获取并在一定许可证范围内运行模型参数,但它不一定同时公开训练数据、数据清洗规则、完整训练代码和训练日志。

媒体报道目前使用了“开源模型”的表述,但 Nemotron 4 的许可证尚未公布。判断它是否真正适合商业部署,需要核对是否允许商用、是否限制特定用途、是否要求衍生模型遵循相同许可证,以及训练数据和合成数据配方是否开放。

Nemotron 系列过去强调模型、数据和训练配方的协同开放,这比只提供一个在线服务更适合研究和私有化部署。不过,Nemotron 4 的规模越大,能够下载权重也不代表普通团队能够轻松复现训练。

这形成了当前开放模型竞争中的一个现实矛盾:法律意义上的可用性在提高,计算意义上的可及性却可能下降。一个需要多机多卡高速互联才能运行的万亿参数模型,对中小开发者并不比闭源服务轻多少。

安全问题会成为 Nemotron 4 的敏感变量

开放模型的安全风险来自可本地修改和绕过默认限制,而不是“开放”本身必然导致攻击。

近期涉及自主 Agent 的安全事件让外界更关注模型在网络安全任务中的双重用途。开放权重允许防守方在内网分析告警、审计代码和训练专用检测模型,也允许攻击者移除拒答策略并自动化部分恶意流程。

英伟达在 2026 年 7 月与多家企业成立联盟,共同开发和共享 AI 安全及网络安全工具,这说明公司不会只把 Nemotron 4 当作性能项目。模型卡中的风险评估、网络安全能力边界、工具权限隔离和审计机制,将直接影响企业是否敢把它接入生产系统。

真正有效的防护也不能只依赖模型拒答。企业需要限制 Agent 能访问的工具、为高风险操作设置人工确认、隔离执行环境、记录完整调用轨迹,并对模型输出进行独立验证。

Nemotron 4 有机会,但“参数冠军”远远不够

Nemotron 4 的机会在于,英伟达同时掌握训练硬件、互联网络、模型框架和推理优化,这种垂直整合能力是多数模型创业公司不具备的。

Nemotron 4 的压力则来自开放模型市场已经不再缺少大参数产品。开发者现在更在意可部署性、中文与代码能力、许可证、推理成本和生态兼容性,而不是厂商仅仅宣布一个更大的数字。

如果最大版本最终采用高效 MoE 架构、开放可商用权重,并在 Agent 和代码任务上达到顶级水平,英伟达就有可能补上美国开放模型阵营的大模型底座。如果它需要昂贵集群才能换来有限性能提升,那么更小、更便宜的模型仍会是多数企业的优先选择。

截至 2026 年 8 月 11 日,关于 Nemotron 4 最准确的结论只有三个:模型正在开发,最大版本据称至少为 1 万亿参数,最终训练和发布日期都尚未确定。最快于秋末就绪只是项目参与者的预期,不是英伟达给出的发布承诺。

接下来应该关注什么

Nemotron 4 是否具有竞争力,可以用以下六项信息快速判断:

  1. 架构与活跃参数:确认是稠密模型还是 MoE,以及每个 token 实际激活多少参数。
  2. 许可证:确认是否允许商业部署、微调和发布衍生模型。
  3. 开放范围:确认是否只有权重,还是同时提供数据集、训练配方和评测工具。
  4. Agent 评测:重点观察工具调用、代码修复、长任务规划和异常恢复能力。
  5. 推理效率:比较首 token 延迟、每秒输出 token、并发吞吐和单位成功任务成本。
  6. 部署门槛:确认量化版本、最低显存、推荐集群配置以及主流推理框架支持情况。

Nemotron 4 目前值得关注,但还不值得提前下结论。英伟达已经证明自己能提供算力和工程工具,现在需要证明的是,它也能做出一个开发者愿意长期使用、而不只是用来展示 GPU 规模的前沿开放模型。

参考来源

相关推荐

查看全部