字节谋划5万亿参数模型

据《晚点 LatePost》消息,字节跳动正在讨论训练参数规模超过5万亿的模型,若计划落地,将刷新国内已知模型规模纪录。但该项目仍处于早期阶段,超大参数能否转化为实际能力,仍取决于数据、算力和训练方法。
字节跳动据称讨论训练超5万亿参数模型,国内模型规模再上探
字节跳动正在讨论训练一个参数规模超过5万亿的模型。根据《晚点 LatePost》8月6日披露、IT之家转述的消息,这一项目目前仍处于早期讨论阶段,尚未公布正式立项、训练时间表或最终模型架构;如果计划落地,它将成为目前国内已知参数规模最大的基础模型。
这个数字本身足够醒目:据报道,阿里近期的 Qwen 3.8-Max 参数规模为2.4万亿,月之暗面的 Kimi K3 为2.8万亿,字节拟议中的模型相当于把参数规模再推高约一倍,至少是当前国内公开报道中最大模型的1.8倍左右。更重要的是,这不是一次常规的产品迭代,而是一次对训练上限、算力组织和模型路线的重新下注。

5万亿参数意味着什么
**参数是模型在训练过程中学习到的权重数量,参数规模通常代表模型能够承载的模式和知识容量,但不等于模型实际能力。**简单来说,参数可以被理解为模型内部用于处理语言、代码、图像或推理关系的“可调旋钮”。旋钮更多,理论上可以容纳更复杂的知识和能力,但也会带来更高的训练成本、数据要求和工程难度。
通常而言,更大的模型拥有更高的智能上限,尤其是在复杂推理、长链条任务、代码生成和跨领域知识整合方面。但“参数越多越聪明”只在训练数据、优化方法、推理预算和硬件条件同步匹配时成立。一个数据质量不够、训练不充分的超大模型,可能只是一个昂贵但低效的知识仓库,而不是能力更强的智能系统。
**稠密模型是每次推理都激活全部参数的模型,混合专家模型则只激活部分专家参数来完成单次计算。**这一区别决定了“5万亿参数”到底意味着什么。如果字节采用稠密架构,那么每个 token 都需要经过接近5万亿参数,训练和推理成本将极其惊人;如果采用 MoE,即混合专家架构,模型总参数可以达到5万亿,但每次只调用其中一部分专家,实际计算量可能低得多。
目前公开信息没有披露字节拟议模型的架构、激活参数规模、上下文长度、训练 token 数量或硬件配置。因此,不能简单把“5万亿参数”换算成模型能力,更不能据此判断它一定会超过国内外现有旗舰模型。行业真正应该关注的,是总参数与激活参数的比例、训练数据规模、后训练方法,以及模型在代码、数学、智能体和真实工作负载中的表现。
国内模型规模比较
下表整理了此次报道中涉及的模型规模。需要强调的是,相关参数数字来自媒体报道,部分模型的官方技术细节和统计口径可能并不完全一致。
| 模型/计划 | 公司或团队 | 报道参数规模 | 当前状态 | 说明 | |---|---|---:|---|---| | 字节跳动超5万亿模型 | 字节跳动 Seed | 超过5万亿 | 早期讨论阶段 | 若落地,将刷新国内已知规模纪录 | | Kimi K3 | 月之暗面 | 约2.8万亿 | 已被报道发布 | 规模低于字节拟议模型约1.8倍 | | Qwen 3.8-Max | 阿里巴巴 | 约2.4万亿 | 已被报道发布 | 规模低于字节拟议模型约2.1倍 |
从规模竞争的角度看,字节的计划并不是把模型从几千亿参数小幅推到万亿级,而是试图直接跨过一个数量级。这样的路线与近两年行业普遍强调的“小模型、高效率、低成本”形成明显反差,也说明部分头部公司并没有放弃对基础模型智能上限的追逐。
谁在负责这场豪赌
**Seed Foundation 是字节跳动负责基础模型研究与预训练能力建设的重要团队。**据报道,这一超大模型计划将由 Seed Foundation 负责人项亮主导,并与大语言模型预训练数据负责人沈科合作,两人都被视为字节 AI 研发体系中的核心骨干。
项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016年加入字节跳动,曾负责机器学习中台 AML 团队,之后转任豆包大模型 Foundation 团队负责人。沈科于2018年清华大学毕业后加入字节,目前主要负责大语言模型预训练数据工作。
两人的分工组合具有一定信号意义:项亮代表基础模型架构、训练系统和研究组织能力,沈科则掌握决定大模型上限的预训练数据体系。对于一个超过5万亿参数的模型,数据不是简单地“找得更多”,而是要解决去重、质量筛选、版权合规、污染检测、合成数据比例和多模态数据配比等问题。
超大模型的竞争,本质上已经从“谁能把模型训出来”转向“谁能持续获得高质量数据并稳定完成多轮训练”。模型参数规模扩大后,低质量数据会被放大,重复数据会造成训练收益递减,错误代码和错误事实还可能被模型内化。字节如果真的推动这一计划,数据工程很可能和芯片、集群同样重要。
Seed 为什么重新考虑做大模型
据报道,上半年字节多个 Seed 团队开始不断反思,这成为讨论训练超5万亿参数模型的原因之一。一位字节内部人士将“把参数规模一次推到同行数倍”形容为“像一场赌博”。这个判断并不夸张,因为超大模型项目的风险不是线性增加,而是会同时牵动算力采购、训练稳定性、数据供给、人才组织和产品兑现周期。
**大模型训练的核心风险,是投入在能力出现之前发生,而能力是否兑现要等到训练后期才能验证。**一个数万亿参数项目可能需要数月甚至更长时间持续运行,期间任何数据污染、训练发散、硬件故障或优化方向错误,都可能造成巨额资源浪费。与快速迭代的小模型相比,它更像造一座大型实验设施,而不是发布一个普通软件版本。
不过,字节的内部判断也可能来自另一个现实:单纯依靠蒸馏和后训练,能够快速追赶,但很难建立真正的基础能力差异。蒸馏是让一个较小模型学习更强模型输出结果的技术,优点是成本低、见效快,缺点是容易继承教师模型的能力边界和错误模式。
据报道,字节跳动创始人张一鸣在两周前的 Seed 全员会上表示,训练大模型本身就是一件困难的事,团队不必过度焦虑;他同时明确,在一段时间内可以接受模型落后于行业,希望 Seed 以追求智能上限为目标,最终进入世界第一梯队。
张一鸣还表示自己反对蒸馏。在他的判断中,蒸馏可以在短期内改善模型表现,但本质上仍是在复制 Claude 已有的能力,沿着这条路线最多只能不断逼近对手,很难真正实现超越。这个表态解释了为什么字节可能愿意承受更高的训练风险:它要争夺的不是榜单上的短期领先,而是下一代基础模型的能力源头。
为什么重点会落在编程和智能上限
**代码能力是衡量大模型真实生产力的重要指标,因为代码任务同时考验知识、逻辑、规划、执行和错误修复能力。**相比简单问答,复杂编程往往需要模型理解一个大型代码仓库,拆解需求,修改多个文件,运行测试,再根据报错反复迭代。
据报道,张一鸣认为编程是当前的关键方向。这一判断与模型竞争的变化有关:聊天体验、基础写作和常识问答已经逐渐同质化,真正能够拉开差距的场景,越来越集中在软件开发、数据分析、研究辅助和复杂智能体任务上。
如果一个模型只能生成看起来正确的代码,它的价值有限;如果它能够完成需求分析、调用工具、定位线上问题、编写测试并持续修复错误,才更接近生产力系统。后者需要模型具备更长的任务规划能力、更强的工作记忆和更可靠的自我验证机制,这些能力很难仅靠表面上的答案模仿获得。
因此,字节讨论超大模型,并不意味着它只想在参数排行榜上占据第一。更可能的目标是通过扩大基础模型容量,提升复杂代码任务和长程推理的能力上限,再将这些能力沉淀到豆包、Seed 旗下产品和企业服务中。不过,这仍然是推测,公开报道尚未给出具体产品路线。
5万亿模型最大的难题不是“能不能训”
**超大模型的第一道门槛是算力利用率,而不是芯片数量。**当模型规模扩大到数万亿参数后,训练集群需要处理更大的通信量、更多的专家路由和更复杂的并行策略。数据并行、张量并行、流水线并行和专家并行需要协同工作,任何一个环节效率下降,都会让昂贵的加速卡处于等待状态。
第二道门槛是显存与通信。即使采用低精度训练,5万亿参数的权重、梯度和优化器状态也会占据极大空间。MoE 能够降低单 token 的计算量,却不能消除模型参数存储和专家之间的通信成本。专家路由如果不均衡,还可能出现部分设备过载、其他设备空闲的问题。
第三道门槛是训练稳定性。模型越大,学习率、批次大小、初始化方式、归一化策略和优化器参数越敏感。一次训练失败的代价可能不是重新跑几个小时,而是损失数周计算资源。企业需要建立检查点保存、故障恢复、在线监控和自动回滚体系,这对训练平台提出了接近超级计算工程的要求。
第四道门槛是数据规模和数据质量是否匹配。参数数量增加后,如果训练 token 没有同步增长,模型可能无法充分利用新增容量。反过来,盲目加入大量低质量网页、重复文本和机器生成内容,也可能导致模型训练收益下降。真正有效的扩容,必须同时提升数据量、数据质量和训练 token 的多样性。
第五道门槛是推理成本。即便模型成功训练出来,如果一次请求需要消耗过多计算资源,它也很难大规模服务普通用户。字节拥有豆包、火山引擎等应用和企业服务入口,能够提供大量真实反馈,但这也意味着模型必须兼顾峰值流量、响应延迟和单位调用成本。
国内模型竞争从“发布速度”转向“体系能力”
过去两年,国内模型竞争常被概括为发布速度、价格和榜单排名,但2026年的竞争正在转向更完整的生产体系。模型公司需要同时解决基础研究、训练基础设施、数据治理、后训练、产品分发和商业化交付,单点优势已经不足以支撑长期领先。
近期国内多家公司在较短时间内推出大模型新品,说明中国 AI 行业正在形成更可复制的模型生产流程。这个变化的意义在于,DeepSeek 式的单次突破正在被更多团队的持续迭代补充;但它也带来更激烈的淘汰压力,缺乏前沿能力或明显成本优势的模型,很难长期留在市场中。
字节的优势在于拥有大规模互联网业务、豆包用户入口、Seed 基础模型团队以及火山引擎的计算和企业服务体系。模型可以获得更丰富的真实使用反馈,产品也有机会把基础能力快速转化为搜索、办公、内容创作和代码开发工具。
但字节的短板同样明显:超大模型投入周期长,商业回报未必同步出现;模型参数达到5万亿后,推理成本、数据合规和组织协同都会变得更加复杂。对字节而言,这不是单纯追加算力预算,而是要证明“更大的基础模型”能够带来足够明显的产品差异。
不要只看5万亿这个数字
**判断超大模型价值的关键,不是参数数量,而是参数规模能否转化为可重复、可验证、可负担的任务能力。**未来如果字节公布更详细信息,开发者和企业用户至少应该关注以下指标:
- 激活参数规模:总参数超过5万亿并不代表每次推理都使用全部参数,需要区分总参数与每 token 实际激活的参数。
- 训练数据规模:包括总 token 数、中文与英文比例、代码数据比例、多模态数据来源,以及是否大量使用合成数据。
- 核心评测结果:重点看复杂编程、数学推理、长上下文、工具调用和智能体任务,而不只是通用选择题榜单。
- 真实工作负载成本:同一项代码生成、文档分析或多轮智能体任务,模型实际需要消耗多少 token 和计算资源。
- 服务稳定性:包括高峰期延迟、上下文长度、并发能力、输出可靠性和错误率。
- 产品转化能力:模型是否能在豆包、飞书或企业工作流中形成可持续使用,而不是停留在实验室指标。
截至8月6日,字节跳动尚未公开确认这一超5万亿参数模型计划,相关信息仍应视为媒体报道和内部讨论线索。它最值得关注的地方,不是“5万亿”是否最终实现,而是字节是否准备重新把资源集中到基础模型能力上限,以及这场高风险下注能否改变国内模型竞争的节奏。
如果项目最终落地,国内大模型的规模竞争将进入新的阶段;如果最终没有按计划推进,这次讨论也至少说明,头部公司仍在重新评估“参数规模、训练成本与智能上限”之间的关系。对开发者而言,真正有价值的答案,仍要等模型开放测试、披露架构和接受真实任务检验之后才能得出。
参考来源
- IT之家:国内已知最大规模!消息称字节跳动正讨论训练超5万亿参数模型 —— 转述《晚点 LatePost》关于字节跳动超5万亿参数模型讨论、项目负责人及内部会议表态的报道。



