AI 快讯百灵5.1B激活参数挑战1T旗舰
模型上新

百灵5.1B激活参数挑战1T旗舰

2026-07-24T15:03:32.811Z
百灵5.1B激活参数挑战1T旗舰

蚂蚁发布原生混合推理模型 Ling-3.0-flash,以124B总参数、5.1B激活参数对标上一代1T旗舰,并针对长上下文与Agent工作流重点优化。

蚂蚁把1T旗舰的能力,压进了5.1B激活参数

蚂蚁集团旗下百灵大模型今天(7月24日)发布 Ling-3.0-flash,一款总参数量为124B、每个Token仅激活5.1B参数的原生混合推理模型。按照蚂蚁给出的数据,它只动用上一代旗舰 Ring-2.6-1T 约8.1%的激活参数,就能在传统推理、指令遵循、长文本和Agent任务上实现能力对标,部分项目甚至超越后者。

这次发布最值得关注的不是124B,而是5.1B。Ling-3.0-flash的总参数虽然超过千亿,但一次前向计算只调用其中约4.1%,这决定了它在推理成本、吞吐量和长任务响应速度上,更接近小型稠密模型,而不是传统意义上的千亿参数模型。

原生混合推理模型是从预训练阶段就同时面向思考与非思考模式、并围绕多种注意力机制进行联合设计的模型。 Ling-3.0-flash并非先训练一套标准Transformer,再通过后训练补上推理能力,而是从底层架构开始处理推理深度、长上下文效率和状态记忆之间的关系。

Ling-3.0-flash架构示意图,展示124B总参数、5.1B激活参数,以及KDA与MLA按5比1交替堆叠

124B只是模型容量,5.1B才是计算账单

MoE是混合专家模型,即模型为不同输入准备多组专家网络,但每个Token只调用其中少量专家。 这种架构的核心价值是把“知识容量”和“单次计算量”拆开:模型可以拥有124B参数来存储不同领域的知识,却不必在每次生成时计算全部124B参数。

Ling-3.0-flash采用1/64稀疏MoE设计,最终将单Token激活参数控制在5.1B。需要注意的是,1/64并不意味着总参数直接除以64,因为注意力层、共享模块和部分公共参数仍然会参与计算;5.1B是综合这些结构之后的实际激活规模,占124B总参数约4.1%。

这组数字比“千亿模型”标签更能反映部署价值。对于Agent服务来说,模型往往需要连续进行几十次工具选择、网页阅读、代码修改和结果验证,单步推理成本会被调用次数成倍放大,激活参数从数十B降到5.1B,影响的不只是一次回答快几秒,而是整条任务链能否在合理的时间和资源预算内完成。

公开信息显示,Ling-3.0-flash与百灵近期几代模型的参数关系如下:

| 模型 | 总参数量 | 激活参数量 | 激活参数占比 | 主要定位 | |---|---:|---:|---:|---| | Ling-3.0-flash | 124B | 5.1B | 约4.1% | 原生混合推理、长上下文、Agent | | Ling-2.6-flash | 104B | 7.4B | 约7.1% | 上一代高效率模型 | | Ring-2.6-1T | 约1T | 约63B | 约6.3% | 上一代旗舰思考模型 |

Ling-3.0-flash相对Ring-2.6-1T减少了约87.6%的总参数和91.9%的激活参数。相对Ling-2.6-flash,它的总容量从104B增加到124B,增幅约19.2%,但激活参数从7.4B降到5.1B,降幅约31.1%,说明百灵这次不是单纯缩小模型,而是在扩大知识容量的同时继续压低每次计算量。

这条路线比直接追逐更大的总参数更务实。当前模型进入Agent阶段后,决定产品体验的指标已经从“单轮答题最高分”逐渐转向每项任务的完成率、总耗时、调用轮数和资源消耗;一个需要思考两分钟的高分模型,未必比一个能在十几秒内稳定执行下一步的模型更适合生产环境。

5比1混合注意力,重点是给长任务减负

混合线性注意力是在线性注意力层和全注意力层之间进行组合,以降低长序列计算与缓存成本的架构。 标准全注意力需要让Token彼此建立直接联系,表达能力强,但随着上下文增长,计算量和KV Cache占用都会迅速上升;线性注意力则把历史内容压缩成状态,读取成本更稳定,但可能损失部分精细的信息匹配能力。

Ling-3.0-flash从预训练开始采用KDA与MLA按5比1交替堆叠的设计,也就是以更多线性注意力层承担持续记忆,再用较少的全注意力层保留精确检索能力。这种组合更像是一套“摘要记忆加原文索引”系统:大部分时候读取压缩后的状态,遇到需要核对具体细节的任务,再依靠全注意力完成高精度匹配。

KDA是Kimi Delta Attention,一种通过Delta更新和细粒度门控维护序列状态的线性注意力机制。 Ling-3.0-flash进一步加入细粒度对角门控,让模型能够更有选择地保留、更新或遗忘不同维度的信息,而不是把长历史粗暴压缩成一个统一状态。

MLA是Multi-head Latent Attention,即通过低维潜在表示压缩键值缓存的多头潜在注意力。 MLA仍保留全注意力擅长的Token间精确关联,但比常规多头注意力更节省缓存,因此适合穿插在线性注意力层之间,补足后者在复杂检索和细节追踪上的短板。

原生设计是Ling-3.0-flash与早期迁移式混合架构的关键区别。迁移式方案通常需要把已经训练好的全注意力模型改造成混合架构,模型还要重新适应状态记忆方式;原生方案则从第一阶段预训练就让KDA、MLA和MoE共同学习,理论上能减少架构改造造成的能力损失。

这并不意味着混合线性架构已经全面取代全注意力。全注意力在复杂复制、精确回溯和跨段落细节关联上仍有表达优势,混合方案本质上是用更低成本换取足够好的能力上限;这个交换是否划算,最终不能只看架构名称,而要看超长上下文中的召回准确率、长程Agent成功率和多轮任务稳定性。

长输入TTFT降低60%至80%以上

TTFT是Time to First Token,即用户提交请求到模型输出第一个Token之间的等待时间。 对长文档问答和Agent任务来说,TTFT往往比生成速度更影响体感,因为模型每次接收扩大的历史记录时,都可能重新执行一遍Prefill计算。

Ling-3.0-flash接入了SGLang HiCache与Mooncake分级缓存架构,通过物理双池和集群共享L3缓存保存长程交互产生的中间状态。官方称,这套方案可使长输入场景的TTFT降低60%至80%以上,并让多轮任务不必反复计算相同的历史内容。

分级缓存解决的是Agent时代非常具体的浪费。一个代码Agent在第20轮修改文件时,前19轮对话、仓库说明和已经读取过的代码通常没有变化,如果每一轮都重新处理全部上下文,就像程序每次执行一个新函数前都重新编译整个项目;缓存命中后,系统只需要处理新增部分。

60%至80%的TTFT降幅具有直接的产品意义。以未缓存时首Token等待10秒为简单算术示例,降低60%后约为4秒,降低80%后约为2秒;当一项任务需要20轮模型交互时,这部分节省可能从几秒累计到数分钟。不过,实际效果仍会受到上下文重复率、缓存命中率、集群网络和并发压力影响,不能把官方峰值直接视为所有场景的稳定表现。

公开资料还显示,Ling-3.0-flash原生支持256K上下文,并可扩展到100万Token,最高推理速度宣称可达每秒1000 Token。这些指标给出了很高的理论上限,但100万Token“能够输入”不等于模型能稳定利用全部信息,开发者更应该关注长上下文针查找、多文档交叉验证和任务中后段指令保持能力。

Agent不是加分项,而是这代模型的主战场

Agent模型是能够围绕目标连续规划、调用工具、读取反馈并修正行动的模型。 它与普通聊天模型的区别不在于是否会写函数调用格式,而在于能否在几十轮甚至上百轮操作后保持目标一致,并根据环境反馈完成闭环。

蚂蚁为Ling-3.0-flash扩展了超过10,000个可交互训练环境,覆盖Coding、General Agent和Deep Research Agent任务。可交互环境的价值在于,模型面对的不是一组静态问答,而是会根据操作发生变化的系统:代码可能运行失败,搜索结果可能互相冲突,工具也可能返回异常,模型必须根据新状态调整下一步。

长程闭环能力比单次工具调用更难训练。一个模型会选择搜索工具,并不代表它能判断搜索结果是否足够;一个模型会修改代码,也不代表它能运行测试、定位回归并继续修复。Ling-3.0-flash试图用更多交互环境加缓存优化,将规划能力和系统吞吐放在同一套设计里,这比单纯强调“支持函数调用”更接近真实生产需求。

Ling-3.0-flash比较适合三类工作负载:

  • 代码仓库级任务: 需要多轮读取文件、修改代码、运行测试和处理报错,重复上下文比例高,缓存收益明显。
  • 深度研究任务: 需要持续检索、整理多个来源并检查结论,256K以上上下文可以容纳更多中间材料。
  • 企业流程自动化: 需要连续调用内部工具并保留任务状态,较低激活参数有利于控制高频调用成本。

Ling-3.0-flash不一定适合只追求最高单题准确率的场景。如果任务只调用模型一次,而且对延迟和资源不敏感,那么更大的全注意力旗舰仍可能拥有更高的能力上限;Flash路线的优势,要在长输入、多步骤和高并发条件下才会被充分放大。

“对标1T”目前仍是厂商结论

蚂蚁的参数效率成绩很激进,但“全面对标甚至超越Ring-2.6-1T”仍需要第三方结果验证。现阶段公开信息主要给出了架构、参数规模和总体能力判断,尚缺少一张覆盖数学、代码、长上下文、指令遵循和真实Agent任务的完整基准表。

缺乏横向竞品对比也是这次发布的明显遗憾。当前高效率模型普遍采用稀疏MoE、混合注意力或稀疏注意力,Ling-3.0-flash真正要证明的并不是能否追平自家上一代1T模型,而是面对同代Qwen、DeepSeek、Kimi等模型时,能否在相同硬件、相同输出长度和相同推理预算下取得更好的任务完成率。

模型评测还需要区分非思考和思考模式。一个模型可以通过生成更长的思维过程提高跑分,但这会增加延迟和输出成本;所谓“智效比”必须同时报告准确率、平均输出Token、总耗时和任务成功率,否则开发者很难判断5.1B激活参数最终转化成了多少实际收益。

下面几项数据尤其值得后续第三方实测:

  1. 256K与100万Token下的有效信息召回率,而不只是上下文窗口是否能够接收输入。
  2. 复杂代码Agent连续运行数十轮后的任务成功率和错误恢复能力。
  3. 每秒1000 Token对应的硬件、量化精度、并发规模与输入长度。
  4. 分级缓存冷启动、热缓存和低重复上下文下的TTFT差异。
  5. 思考模式开启前后的准确率增益、输出长度和端到端成本。

权重将在免费体验结束后开放

Ling-3.0-flash已于7月24日在百灵官方平台及第三方模型平台开放限时免费体验,免费期截至2026年8月3日23:00(北京时间)。蚂蚁表示,模型权重将在免费期结束后正式开源,这意味着当前阶段更像是一次在线服务预热,完整的本地部署条件仍需等待权重、模型卡和许可证公布。

延后开放权重是这次发布中一个值得观察的策略变化。百灵此前通过开放模型建立开发者影响力,而Ling-3.0-flash先提供在线体验、再公布权重,可能是为了在早期集中验证负载、收集真实Agent任务反馈,并为后续模型文件发布留出准备时间。

开发者现在不应急于依据参数表制定部署方案。124B总参数即使每次只激活5.1B,完整权重仍要占用可观的显存或内存;MoE模型的实际速度还取决于专家并行、跨卡通信、量化支持和推理框架适配,激活参数少并不等于单卡必然轻松运行。

开源后的关键不只是“能不能下载”,而是社区能否低成本复现官方性能。如果SGLang、Mooncake、量化工具和常见推理后端能够迅速适配,Ling-3.0-flash才有机会把5.1B激活参数转化为真实部署优势;如果必须依赖复杂集群配置才能达到理想速度,它对中小团队的价值就会打折。

OpenAI Hub判断:方向比跑分更重要

Ling-3.0-flash最有价值的地方,是把模型竞争从总参数规模拉回了有效计算量。124B总参数提供容量,5.1B激活参数压低单步成本,5比1混合注意力服务长上下文,分级缓存则减少Agent多轮交互中的重复计算,这四部分共同指向同一个目标:让模型真正持续工作,而不是只完成一次漂亮回答。

这代模型也反映出行业架构正在收敛。全注意力仍负责精确关联,线性注意力承担长程状态,MoE负责扩大容量,系统层缓存负责消除重复Prefill;下一轮竞争很可能不再由某一个新模块决定,而是看训练、推理引擎、缓存和Agent环境能否被打磨成一套完整系统。

“5.1B激活参数对标1T旗舰”目前可以视为一个有吸引力、但尚未被独立验证的结论。对于开发者,最合理的做法是趁免费阶段用自己的长文档、代码仓库和多轮工具任务测试,而不是只看厂商榜单;等到8月3日之后权重、许可证和第三方评测齐备,再判断它是否真正具备生产部署价值。

参考来源

相关推荐

查看全部