AI 快讯百灵124B金融模型下周开源
模型上新

百灵124B金融模型下周开源

2026-08-28T04:03:51.432Z
百灵124B金融模型下周开源

蚂蚁百灵发布金融增强模型 Ling-3.0-flash-Fin,以 124B 总参数、5.1B 激活参数强化金融检索、研报分析、估值建模和银行业务能力,模型权重将在下周开源。

蚂蚁百灵把 124B 模型进一步推向金融腹地

蚂蚁百灵在 8 月 28 日发布金融增强模型 Ling-3.0-flash-Fin,并宣布模型权重将在下周正式开源。新模型延续 Ling-3.0-flash 的稀疏 MoE 架构,保持 124B 总参数、5.1B 激活参数的配置,重点强化年报分析、金融信息检索、估值建模、电子表格处理和长流程金融任务执行能力。

**Ling-3.0-flash-Fin 是一款面向金融研究与业务自动化场景训练的开源大语言模型。**它并不是简单地在通用模型提示词前加一句“你是一名金融分析师”,而是在 Ling-3.0-flash 基础上继续进行金融语料预训练、领域后训练和工具使用优化,让模型更熟悉财报结构、研究口径、估值流程以及金融任务中的证据追溯要求。

IT之家报道,Ling-3.0-flash-Fin 已在 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench 和 τ³-Banking 等基准中接受测试。蚂蚁百灵称,新模型面对多款通用模型具备较强竞争力,并在部分金融任务中超过了一些更大尺寸的旗舰模型。

Ling-3.0-flash-Fin 模型架构与金融能力示意图,展示 124B 总参数、5.1B 激活参数,以及财报分析、金融检索、估值建模、电子表格和银行业务五类场景

124B 总参数不等于每次都计算 124B

**MoE 是一种每次推理只调用部分专家参数的稀疏模型架构。**Ling-3.0-flash-Fin 虽然拥有 124B,也就是约 1240 亿总参数,但生成每个 Token 时只激活约 5.1B 参数,激活比例约为 4.1%

这套设计的核心价值,是把“知识容量”和“单次计算量”拆开。124B 总参数负责容纳不同领域和任务所需的知识,路由模块则根据当前输入选择少量专家参与计算,因此模型不必在每一步都完整运行 1240 亿参数。

从产品角度看,5.1B 激活参数比 124B 这个标签更值得关注。金融智能体通常需要反复搜索、读取文档、调用工具、检查结果和修正计算,如果每一步都使用高成本稠密模型,长流程任务的延迟与算力消耗会迅速累积;稀疏 MoE 则有机会在保留大模型容量的同时,把多轮执行的成本压到更适合生产部署的范围。

不过,5.1B 激活参数也不能直接等同于一款普通 5B 模型的部署成本。模型完整权重仍然需要被存储和加载,实际显存占用还取决于权重量化精度、KV Cache、上下文长度、并行方案及推理框架,因此“每 Token 只激活 5.1B”描述的是计算路径,而不是模型文件只有 5.1B 参数。

| 项目 | Ling-3.0-flash-Fin | Ling-3.0-flash | 典型稠密 100B+ 模型 | |---|---:|---:|---:| | 总参数 | 124B | 124B | 100B 以上 | | 单 Token 激活参数 | 5.1B | 5.1B | 通常接近全部参数 | | 架构 | 稀疏 MoE | 稀疏 MoE | 稠密 Transformer 为主 | | 主要定位 | 金融研究与金融智能体 | 通用智能体与混合推理 | 通用高能力任务 | | 金融专项训练 | 金融持续预训练、领域后训练、工具优化 | 未突出金融专项增强 | 视具体模型而定 | | 权重状态 | 计划下周开源 | 已开源 | 开源与闭源并存 |

金融模型真正难的是证据,而不是术语

**金融信息检索是从公告、年报、研报和数据库中找到可验证事实,并保留证据来源的过程。**相比回答“什么是市盈率”,真实金融任务更难的地方在于数据分散、口径不一、时间敏感,而且一个结论往往需要同时引用多份材料。

例如,分析一家上市公司的毛利率变化,模型不能只找出两个百分比。它还要确认比较的是季度还是年度数据、是否剔除已终止业务、会计政策有没有调整、币种是否一致,以及数字来自公司公告、交易所文件还是二手媒体转述。任何一个环节出错,最终结论都可能看起来合理却无法用于决策。

Ling-3.0-flash-Fin 的训练方向因此比“多记住一些金融知识”更实用。官方强调模型能够处理年报、财务工作簿和多份研究材料,这意味着其目标是进入金融从业者真正耗时的环节:从复杂材料中抽取信息、统一口径、完成计算,并将结论回溯到原始证据。

**证据可追溯性是指模型给出的关键数据和结论能够定位到权威原始资料。**在金融行业里,一个答案是否能查到出处,往往比文字是否流畅更重要,因为研究报告、投决材料和合规流程都需要审阅依据。

蚂蚁集团与中金公司联合打造的 FinFIRST 就围绕这一问题设计。FinFIRST 全称为 Financial Information Retrieval, Sourcing and Traceability,是一个从结果、研究过程和证据链三个层面评估金融研究能力的基准,共有 50 余名金融专业人士参与设计。

FinFIRST 不只检查最终答案是否正确,还会判断研究口径与计算过程是否合理,以及关键数字能否回溯至官方或高可信资料。按照蚂蚁百灵披露的信息,Ling-3.0-flash-Fin 尤其擅长优先定位官方、一手和高可信来源,而 FinFIRST 也计划在近期开放。

六类基准覆盖的不是同一种能力

**金融智能体基准是用于测试模型检索、分析、工具调用和长流程执行能力的任务集合。**此次披露的六类评测并不只是换了题库,而是覆盖了从“找到信息”到“完成业务”的不同阶段。

| 评测基准 | 主要考察方向 | 对应实际场景 | |---|---|---| | FinFIRST | 金融检索、研究过程、来源追溯 | 公司研究、行业研究、尽调 | | FinSearchComp Verified | 复杂金融搜索与答案验证 | 公告检索、数据核验 | | Finance Agent | 金融智能体综合能力 | 投研助理、分析工作流 | | APEX-Agents | 长程任务规划与工具执行 | 多步骤研究、连续决策 | | SpreadsheetBench | 电子表格理解与操作 | 财务工作簿、估值模型 | | τ³-Banking | 银行业务交互与任务处理 | 客户服务、账户及业务流程 |

这些评测中,SpreadsheetBench 和 APEX-Agents 的现实意义尤其突出。金融机构沉淀的大量工作并不在纯文本中,而是在 Excel 模板、估值表、预算表和内部业务系统里;一个只会总结研报、不会识别单元格依赖关系或调用工具的模型,很难真正替代重复劳动。

官方目前没有在公开报道中给出六项基准的完整原始分数、误差范围和逐模型对照表,因此“超过部分大尺寸旗舰模型”仍需要等模型卡、评测数据和可复现实验进一步验证。金融基准很容易受到检索源、工具权限、提示词、最大推理步数和评分器设置影响,单一综合分数不能完全代表真实生产表现。

专业增强没有以牺牲通用能力为代价

**AA Intelligence Index 是用于综合衡量模型完成多类智能任务水平的第三方评测指标。**蚂蚁百灵披露,Ling-3.0-flash-Fin 在 AA Intelligence Index v4.1.1 上获得 41 分,而基础版 Ling-3.0-flash 的得分为 38 分,绝对增加 3 分,相对增幅约为 7.9%

这个变化值得注意,因为领域后训练经常伴随能力偏移。模型如果过度适配金融问答,可能在通用推理、指令遵循或非金融工具任务上退化;Ling-3.0-flash-Fin 的综合得分反而从 38 分升至 41 分,至少从官方披露结果看,金融数据和工具训练没有把它变成只能回答财务问题的“窄模型”。

专业训练带动通用分数上升也并不反常。金融任务本身包含长文阅读、多源信息整合、数学计算、表格操作、规划执行和证据核验,这些训练信号与通用智能体能力高度重叠,因此高质量金融后训练有可能同时改善模型的任务分解与工具使用表现。

下周开源比一个月免费体验更重要

**模型权重开源是指开发者可以下载参数文件,并在许可范围内自行部署、评测和微调模型。**Ling-3.0-flash-Fin 计划在下周开放权重,这对金融行业的意义明显高于一次短期在线体验,因为银行、券商、基金和企业财务部门普遍面对严格的数据边界与审计要求。

金融场景很难长期依赖完全外部化的推理服务。未公开财务数据、客户资料、交易信息和内部研究材料通常不能离开指定环境,模型是否能够进入本地服务器或私有云,直接决定了它能否从演示项目走向生产系统。

Ling-3.0-flash 的既有部署路线也为金融版提供了参考。基础模型已提供低精度版本,MXFP4 与 INT4 版本可以显著压缩权重存储和显存需求;其公开资料还提到,在特定 GPU 与推理栈配置下,平均输出速度可以超过 1100 tokens/s,并通过分级缓存降低长输入场景的首 Token 延迟。

这些数字不能原封不动套用到 Ling-3.0-flash-Fin。金融版虽然沿用同一架构,但最终开源的权重格式、量化版本、推理框架支持、上下文配置和硬件测试结果仍应以正式模型卡为准,尤其需要观察金融工具调用能力能否在本地部署后完整复现。

模型上线后还将提供为期一个月的限时免费接口体验,方便开发者验证金融搜索、数据分析和应用开发场景。对团队来说,更合理的用法不是把免费期当作长期成本方案,而是用它做一轮集中评估:固定问题集、记录引用准确率、统计表格计算错误、测试多轮工具任务,再决定是否等待权重进行私有化部署。

蚂蚁百灵正在争夺金融智能体的模型底座

**金融智能体是能够读取资料、调用工具并连续完成金融业务任务的 AI 系统。**Ling-3.0-flash-Fin 的发布说明,国内模型竞争正在从通用聊天和榜单跑分,进一步转向有数据壁垒、有工具链门槛、也有明确付费主体的垂直行业。

蚂蚁的优势不只是训练出一个金融版本。支付、信贷、保险、财富管理和企业服务等业务,使其更容易接触真实金融流程中的任务结构;与中金共同设计 FinFIRST,则补上了专业评测和研究方法论,避免金融模型只在通用团队自建的选择题上证明自己。

Ling-3.0-flash-Fin 的主要竞争力可以概括为三点:第一,124B 总参数提供了足够的知识容量;第二,5.1B 激活参数降低了智能体连续调用时的计算压力;第三,权重开源让数据敏感机构获得本地部署和二次训练的可能性。

它的短板同样清晰。官方尚未公开完整基准明细,模型在中文财报之外的跨市场数据、实时信息、复杂 Excel 公式、审计级计算和高并发部署中的表现,还缺少第三方验证;FinFIRST 也要等正式开放后,外界才能确认评测集设计、数据污染控制和评分规则是否足够严谨。

这不是“懂金融”的终点,而是金融模型进入执行阶段的信号

Ling-3.0-flash-Fin 最值得关注的变化,是把金融大模型的能力边界从知识问答推向检索、溯源、表格和长流程执行。对于投研团队,它可能承担资料搜集、数据核对和初稿生成;对于银行与企业财务部门,它更可能先从规则明确、可审计的辅助任务切入,而不是直接替代最终决策者。

金融模型能否真正落地,最终要看三个指标:引用是否可靠、计算是否稳定、任务过程是否可审计。语言流畅只是最低门槛,模型必须在数十页年报、多份公告和复杂工作簿之间保持口径一致,并在出现错误时让人知道它错在哪里。

下周的权重开放将是更关键的验证节点。届时开发者需要重点检查开源许可证、量化权重、上下文长度、工具调用模板、推理框架兼容性以及官方评测复现脚本;如果这些配套能够同步到位,Ling-3.0-flash-Fin 才有机会从一款金融跑分模型,变成可被机构真正部署的金融智能体底座。

参考来源

相关推荐

查看全部