Ling 3.0 Flash开源:只激活51亿

蚂蚁百灵正式开源124B MoE模型Ling-3.0-flash,每次推理仅激活5.1B参数,并提供FP8、MXFP4与INT4版本,试图同时拿下Agent性能、长上下文效率和单机私有化部署。
Ling 3.0 Flash开源:124B模型为何只激活51亿参数
蚂蚁集团旗下百灵大模型已于8月7日正式开源Ling-3.0-flash,这是一款总参数124B、单次推理仅激活5.1B参数的原生混合推理模型。 截至今天(2026年8月8日),模型权重已经在Hugging Face等平台公开,并同步提供基础版本、FP8、MXFP4和INT4等不同精度版本。
这次发布最值得关注的不是124B这个数字,而是5.1B激活参数。按照两者直接计算,Ling-3.0-flash每次推理只使用约4.11%的总参数,相当于每处理一个Token,仅让大约二十四分之一的参数参与主要计算。
Ling-3.0-flash的目标并不是继续堆大模型规模,而是提高每单位推理成本所能换来的智能水平。 蚂蚁把它定位为面向Agent、长文本和生产环境的Flash模型:既要比传统小模型更有能力,又要避免万亿参数模型在推理延迟、显存占用和服务成本上的沉重负担。

124B是能力上限,5.1B决定主要计算量
MoE是Mixture of Experts的缩写,即通过路由器为每个Token选择少量专家参与计算的稀疏模型架构。 它与稠密模型的核心区别在于,稠密模型会让几乎全部参数参与每次前向计算,而MoE模型可以拥有更大的参数池,却只调用其中一小部分专家。
一个直观类比是,124B总参数像一家拥有大量专科医生的医院,5.1B激活参数则是每位患者实际会诊时被叫到现场的医生。医院的知识覆盖范围由全部专家决定,但一次诊疗的时间和主要计算成本,取决于真正参与会诊的人数。
Ling-3.0-flash的激活参数比例约为4.11%,但这不代表它的部署成本等同于一个5.1B稠密模型。 124B权重通常仍需要被加载到内存或显存中,专家路由、跨卡通信、缓存和推理框架也会带来额外开销;5.1B主要反映每个Token实际参与运算的参数规模,而不是完整模型文件的大小。
按照不考虑量化元数据、缓存和运行时开销的理论值估算,124B参数采用FP8存储时仅权重就约为124GB,采用4比特量化时约为62GB。真实部署还要为KV Cache、激活值、路由逻辑和推理框架预留空间,因此量化版本能否稳定单机运行,不能只用“参数量乘位宽”判断。
蚂蚁为Ling-3.0-flash准备的MXFP4和INT4版本,正是其单机私有化路线能够成立的关键。 官方表示,这两个版本可以在单台NVIDIA DGX Spark上完成端到端推理,适合数据不能离开本地环境、又不愿维护多卡服务器集群的企业和研发团队。
| 对比项 | Ling-3.0-flash | 5.1B级稠密模型 | 124B级稠密模型 | |---|---:|---:|---:| | 总参数规模 | 124B | 约5.1B | 约124B | | 单次推理主要激活参数 | 5.1B | 约5.1B | 约124B | | 激活参数占比 | 约4.11% | 接近100% | 接近100% | | 权重存储压力 | 高于5.1B稠密模型 | 最低 | 较高 | | 单Token主要计算量 | 接近小模型量级,但有MoE额外开销 | 小 | 大 | | 知识与专家容量 | 更高 | 受模型规模限制 | 高 | | 部署难点 | 专家路由、权重带宽、量化适配 | 相对简单 | 显存与计算成本高 |
这张表也说明了Ling-3.0-flash真正的工程取舍:它没有消除大模型的权重存储压力,而是重点压低每个Token的计算压力。对于持续生成长答案、反复调用工具的Agent来说,后者往往直接决定响应速度和服务吞吐。
混合注意力在解决长上下文的账单问题
原生混合推理模型是指同一套模型能够根据问题难度,在快速回答与更长链路的推理之间进行调节。 简单的信息抽取、改写和分类任务没有必要持续展开复杂推理,而代码调试、研究分析和多步骤Agent任务则需要更多计算预算;两类任务由同一个模型承接,可以减少产品侧反复切换模型的复杂度。
Ling-3.0-flash还采用了原生混合线性注意力架构,以降低长上下文带来的计算和缓存压力。 根据此前披露的架构信息,模型以5:1的方式交替堆叠KDA与MLA模块,并使用KDA承担细粒度状态记忆,从而避免所有层都按传统全注意力方式处理长序列。
MLA通常指Multi-head Latent Attention,即通过低维潜在表示压缩注意力所需的键值状态。线性注意力则试图让上下文计算量随序列长度更接近线性增长,而不是让所有Token两两交互;两者结合的目的不是让长上下文“免费”,而是减缓序列变长时的计算量和KV Cache膨胀速度。
Ling-3.0-flash原生支持256K上下文,并在特定配置下最高扩展至1M上下文。 256K已经足以容纳大型代码仓库的一部分文件、数百页材料或长时间Agent执行轨迹,1M则进一步面向跨文档研究、复杂工程分析和超长状态记忆。
不过,最大上下文长度从来不等于有效上下文能力。模型能把100万Token放进窗口,只说明系统可以接收这段输入;它能否从接近窗口开头的位置准确找回事实、处理跨章节依赖,并在高并发时维持可接受的首Token延迟,仍需要通过真实任务验证。
百灵此前公布的集群分层缓存方案可让长文本首Token时间下降60%至80%,但这一数字不能直接套用到所有本地部署环境。 缓存命中率、输入复用程度、并发数量、上下文长度和硬件带宽都会改变结果,因此企业评估时应使用自己的文档长度与Agent轨迹做压力测试,而不是只运行短提示词跑分。
353 tokens/s与1100 tokens/s不是同一种成绩
Ling-3.0-flash目前公开的速度数据主要有两组:Artificial Analysis记录的353 tokens/s,以及指定GPU测试配置下超过1100 tokens/s的平均输出速率。 两个数字都说明模型把生成速度放在了核心位置,但它们来自不同测试环境,不能直接理解为同一服务从353 tokens/s提升到1100 tokens/s。
Artificial Analysis的数据更接近第三方平台对线上模型服务的观测结果,通常会受到服务端批处理、网络、并发策略和推理参数影响。官方披露的1100 tokens/s则对应指定GPU测试配置,更适合观察优化后的性能上限,但在完整硬件配置、并发数、输入长度和量化精度明确之前,不宜把它当作任意单机都能复现的速度。
| 指标 | 公布结果 | 应如何理解 | |---|---:|---| | 总参数量 | 124B | 决定模型容量及主要权重存储规模 | | 激活参数量 | 5.1B | 决定每Token的主要计算规模 | | 参数激活比例 | 约4.11% | 每次仅调用少量专家参数 | | Artificial Analysis输出速度 | 353 tokens/s | 第三方线上服务观测数据 | | 指定GPU配置平均输出速率 | 超过1100 tokens/s | 优化部署条件下的官方测试结果 | | AA加权平均任务成本 | 约0.04美元 | 按榜单任务组合计算,并非每百万Token价格 | | AA加权平均解码时间 | 约1.4分钟 | 面向一组评测任务的加权结果 | | 原生上下文 | 256K | 面向长文档与长程Agent任务 | | 可扩展上下文 | 最高1M | 需结合具体部署配置评估 |
0.04美元同样不是Ling-3.0-flash的标准Token单价,而是Artificial Analysis Intelligence Index针对评测任务计算的加权平均成本。 按参考汇率折算约为0.27元人民币,它更适合回答“完成一项基准任务大致花多少钱”,不能替代输入、输出Token价格或企业部署的总拥有成本。
AA榜单显示,Ling-3.0-flash同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域。这个位置比单纯的跑分更有产品意义,因为Agent应用真正需要控制的是完成任务所需的总成本与总时间,而不是某一道数学题的最高分。
三种落地方式对应三类用户
Ling-3.0-flash提供云端调用、单机私有化和高性能服务三条落地路线。 这比只放出基础权重更接近生产发布,因为不同团队面对的瓶颈完全不同:个人开发者缺少运维能力,金融和医疗客户在意数据边界,大规模在线产品则更看重吞吐与尾延迟。
- 云端调用适合快速验证产品。 开发者不需要先准备推理集群,即可测试Agent、代码生成和文档处理效果。官方还宣布,2026年8月7日00:00至8月31日24:00,Ling-3.0-flash在Ling Studio限时按原价的25%计费,9月1日00:00起恢复原价。
- 单机私有化适合数据不能离开本地环境的团队。 MXFP4与INT4版本能够在单台DGX Spark上完成端到端推理,减少多机部署中的通信、调度和运维负担。
- 高性能部署适合对单请求延迟敏感的在线服务。 指定GPU配置下超过1100 tokens/s的平均输出速率,可以服务实时编程助手、多步骤Agent以及需要快速生成长内容的生产系统。
开源权重让企业能够检查和改造模型,但量化版本才是Ling-3.0-flash能否真正普及的决定性因素。 一个只能依靠昂贵多卡节点运行的124B模型,和一个可以在单台工作站级设备上启动的124B模型,面对的是完全不同的用户群。
FP8更适合追求较高精度和GPU吞吐的服务器环境,MXFP4强调面向支持微缩放格式的硬件进行低精度计算,INT4则拥有更广泛的量化部署生态。三者之间并不存在绝对最优选项:高精度版本通常更稳,4比特版本更节省内存,但代码、数学推理和工具参数生成对量化误差可能更敏感。
它更像执行模型,而不是缩水旗舰
Ling-3.0-flash更适合被理解为高频执行模型,而不是Ring-2.6-1T的简单缩小版。 Ring-2.6-1T通过万亿级总参数追求旗舰推理上限,Ling-3.0-flash的124B总参数仅相当于前者的12.4%,但它试图用更高的参数利用效率承接大量真实请求。
| 产品定位 | Ling-3.0-flash | Ring-2.6-1T | |---|---|---| | 总参数规模 | 124B | 1T级 | | 相对规模 | 约为Ring的12.4% | 旗舰基准 | | 核心目标 | 速度、成本、Agent执行与部署 | 更高推理能力上限 | | 典型任务 | 高频Agent、代码、长文档、工具调用 | 高难度推理与复杂研究任务 | | 部署取向 | 提供4比特单机方案 | 更依赖高规格算力环境 |
这种分工正在成为模型产品的常见形态。最强模型负责规划、复核和解决少数高难度问题,Flash模型负责搜索、读取文件、填写参数、执行工具和生成中间结果;如果一个Agent需要连续运行几十步,单步成本与延迟的累积效应会迅速超过模型单次跑分的差距。
Ling-3.0-flash真正需要证明的是长程执行稳定性,而不是再赢一张静态基准表。 Agent任务中更关键的指标包括工具选择是否准确、结构化参数是否稳定、失败后能否自我修正、上下文变长后是否遗忘早期约束,以及量化部署后能力下降多少。
蚂蚁此前披露,模型训练扩充了万级交互环境,并加入多智能体协同纠错机制。这说明其优化目标已经从“生成一个看起来正确的答案”,转向“在环境中连续采取正确行动”;前者更像考试,后者更接近真正的软件执行者。
开源价值成立,但部署账不能只看5.1B
Ling-3.0-flash是目前少见的兼顾百亿级以上总容量、低激活参数和单机量化部署的开源模型。 对开发者而言,它的吸引力不只是免费获得一套权重,而是能够在云端快速测试后,再迁移到本地环境,降低模型切换和数据迁移成本。
企业评估Ling-3.0-flash时仍应重点核算权重常驻、KV Cache和并发带来的完整资源消耗。 5.1B激活参数可以显著减少主要计算量,却不会把124B权重自动变成5.1B模型;当并发上升、上下文接近256K甚至1M时,内存带宽和缓存容量仍可能成为瓶颈。
建议团队至少用四组真实任务进行验证:
- 以内部文档长度测试首Token延迟和长上下文召回率;
- 以连续20步以上的Agent任务测试工具调用与错误恢复;
- 对比FP8、MXFP4和INT4在代码、数学及结构化输出上的精度变化;
- 同时记录单请求速度、并发吞吐、峰值内存和每项任务总成本。
从现阶段公开信息看,Ling-3.0-flash是一款工程方向正确、部署选择完整,但仍需生产负载验证的模型。 124B总参数提供了比传统小模型更大的知识与专家容量,5.1B激活参数则把主要计算量压到更可控的范围;再加上256K原生上下文、4比特单机版本和超过千Token每秒的优化成绩,它确实具备成为高频Agent执行模型的条件。
真正的分水岭将出现在开源后的复现结果中。如果社区能在常见推理框架和不同硬件上稳定复现其速度,并证明INT4版本在长程Agent任务上没有明显能力坍塌,Ling-3.0-flash会是一款实用价值很高的开源模型;如果部署严重依赖特定算子与硬件优化,那么“单机可运行”和“单机好用”之间仍有一段距离。
参考来源
- IT之家:蚂蚁集团百灵开源Ling-3.0-flash模型——整理模型参数、部署方式、第三方速度数据及限时价格信息。
- Hugging Face:inclusionAI/Ling-3.0-flash——官方开源权重、模型卡与版本文件页面。
- 知乎:Ling-3.0-flash,智以密胜——介绍模型的混合注意力、长上下文与智能密度设计。



