AI 快讯蚂蚁开源124B多模态模型
模型上新

蚂蚁开源124B多模态模型

2026-09-09T03:08:08.457Z
蚂蚁开源124B多模态模型

蚂蚁百灵今日开源首个原生多模态模型 Ling-3.0-flash-VL,总参数124B、单次激活5.5B,支持图像、文本、视频输入和256K上下文,并以视觉反馈闭环强化网页生成、GUI自动化与医疗报告分析能力。

蚂蚁开源 Ling-3.0-flash-VL:124B 原生多模态模型开始“看结果再改”

蚂蚁集团今天(2026 年 9 月 9 日)发布并开源了百灵系列首个原生多模态模型 Ling-3.0-flash-VL。模型总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本和视频输入,上下文窗口达到 256K Token。

这次更新最值得关注的并不是“模型能看图”本身,而是蚂蚁把视觉输入接进了任务执行闭环:模型不再只根据图片生成一次结果,而是尝试经历“观察—行动—验证—修正”的连续过程。换句话说,它不仅要回答“网页应该怎么写”,还要把代码渲染出来,检查渲染结果,再回头修改代码。

这让 Ling-3.0-flash-VL 的产品定位明显偏向视觉 Agent,而不是传统意义上的图片问答模型。对于前端代码生成、桌面 GUI 自动化、视频交互和长文档分析等任务,模型能否读取环境反馈、判断执行是否成功,往往比第一次输出是否漂亮更重要。

Ling-3.0-flash-VL“观察—行动—验证—修正”视觉反馈闭环示意图

核心参数:124B 总参数,5.5B 激活,256K 上下文

Ling-3.0-flash-VL 是基于 Ling-3.0-flash 扩展的原生多模态模型。原生多模态模型是指视觉与语言能力在统一训练过程中共同形成,而不是先由独立视觉模型提取图片描述、再交给文本模型处理。

从工程角度看,模型采用 MoE,也就是混合专家架构。MoE 是一种让每个 Token 只调用部分专家网络、而不是每次都运行全部参数的稀疏计算架构。Ling-3.0-flash-VL 的总参数为 124B,但单次推理激活参数约 5.5B,意味着它可以保留较大的模型容量,同时把每个 Token 的实际计算量压在相对较低的水平。

需要注意的是,5.5B 激活参数不等于模型只占用 5.5B 显存。部署时仍然需要考虑 124B 总参数的权重存储、并行策略、KV Cache、视觉编码器以及多模态输入带来的额外显存开销。它降低的是单 Token 的计算压力,而不是把一个 124B 模型直接变成了消费级显卡可以轻松运行的小模型。

| 项目 | Ling-3.0-flash-VL | Ling-3.0-flash 文本版 | |---|---:|---:| | 模型类型 | 原生多模态 MoE | 原生混合推理 MoE | | 总参数量 | 124B | 124B | | 单次激活参数 | 5.5B | 5.1B | | 输入模态 | 图像、文本、视频 | 文本 | | 上下文窗口 | 256K Token | 256K Token,并可扩展至更长上下文场景 | | 视觉反馈闭环 | 支持 | 不适用 | | 已公开权重 | BF16、FP8 | 基础版及多种量化版本 | | 体验方式 | Ling Studio 免费体验 | Ling Studio 等平台 |

模型采用任意分辨率视觉编码器,意味着输入图片不必被强制压缩到单一固定尺寸。任意分辨率视觉编码器是能够根据图像原始比例和内容复杂度动态处理视觉信息的编码模块,它更适合网页截图、长页面、表格和复杂界面这类横向或纵向尺寸差异明显的输入。

模型同时引入 VideoRoPE。VideoRoPE 是面向视频时空位置关系设计的位置编码机制,目标是帮助模型区分不同帧之间的时间顺序,以及同一帧中不同区域的空间位置。对于视频对话、操作录屏分析和长时 GUI 任务,模型不仅要知道“画面里有什么”,还要知道“这个变化发生在什么时候”。

语言主干沿用 42 层混合架构,并以 5:1 的比例交替排列 KDA 与 Gated MLA。KDA 可以理解为更适合长序列状态更新的线性注意力结构,Gated MLA 则保留更强的内容关联和信息选择能力。两者混合的思路不是简单追求更大的注意力计算,而是在长上下文成本和局部精确关联之间做取舍。

最大变化:从“看图生成”转向视觉反馈闭环

视觉反馈闭环是指模型根据视觉环境观察结果采取行动,再通过新的视觉状态验证行动是否成功,并在失败时继续修正的机制。

传统视觉语言模型的工作流通常是“一次观察、一次回答”。用户发来一张网页截图,模型分析布局并生成 HTML;用户发来一张报错界面,模型解释可能原因。这种方式在静态理解任务中已经够用,但在真实软件环境里,第一次输出几乎从来不是终点。

以图片转网页为例,模型首先需要识别页面的整体布局、导航栏、卡片、按钮、间距、字号和组件层级;随后生成 HTML、CSS 或前端框架代码;代码渲染后,模型再对比目标截图与实际页面,定位宽度、颜色、对齐方式或响应式布局上的差异;最后,它需要修改代码并再次渲染。

这个过程的关键不在于模型会不会写 CSS,而在于它能否把渲染结果当成一种“环境反馈”。如果模型只生成代码、不检查结果,那么它更像一次性代码补全;如果模型能够根据截图差异连续修正,它才开始接近一个真正的前端 Agent。

蚂蚁表示,在 Image-to-WebDev Arena 官方评测中,Ling-3.0-flash-VL 以代号“linthium”参评,得分高于 GPT-5.4。这个结果说明模型在图片到网页的任务链路上具备竞争力,但不应被解读成它在所有多模态能力上都全面超过 GPT-5.4。网页生成评测通常强依赖截图相似度、代码可运行性、组件还原度和评测流程,单项领先不能替代跨任务、跨数据集的独立结论。

视觉闭环更适合三类真实任务

GUI Agent 是能够理解图形界面结构、操作鼠标键盘或调用软件工具并根据界面变化继续执行的智能体。Ling-3.0-flash-VL 在这一方向上的价值,在于它处理的不是抽象 API 返回值,而是按钮、弹窗、表格、状态栏和错误提示等视觉状态。

第一类场景是跨工具 GUI 自动化。模型可以先识别当前应用界面,再进入另一个工具完成复制、粘贴、筛选、导出或提交等操作。如果某一步触发权限弹窗、页面加载失败或字段校验错误,模型理论上可以通过新的截图识别状态,而不是继续沿着原计划盲目执行。

第二类场景是前端开发与设计还原。图片转网页任务的实际难点,往往不是生成一份能运行的代码,而是还原视觉细节并保持组件关系。视觉反馈闭环能够把截图比较纳入生成流程,这比单轮 VLM 直接输出代码更接近开发者的工作方式。

第三类场景是医疗报告解读。医疗报告多模态分析是指模型联合理解报告文本、影像或图表,并在跨文档信息之间建立关联。蚂蚁称,Ling-3.0-flash-VL 支持跨文档数据整合与风险标识,这类能力可以用于整理检查结果、提取异常指标和提示潜在风险。

不过,医疗场景仍然需要把模型定位为辅助工具,而不是独立诊断系统。视觉模型可能受到图像质量、扫描设备、报告格式和上下文缺失影响;“风险标识”也不等于医学结论,实际部署必须加入医生复核、权限控制、审计日志和数据脱敏机制。

原生多模态训练没有牺牲文本能力,反而带来提升

蚂蚁称,原生多模态联合训练对模型文本能力产生了正向影响。在 Artificial Analysis Intelligence Index v4.1.1 评估中,Ling-3.0-flash-VL 相比纯文本版本 Ling-3.0-flash 提升了 4 分。

这条信息的重要性在于,视觉能力并不一定意味着文本能力被稀释。多模态训练让模型接触到更多结构化信息,例如页面层级、图表关系、空间布局和连续状态变化,这些训练信号也可能反过来增强模型对复杂指令、结构化输出和任务状态的理解。

但“提升 4 分”仍需要放回具体评测体系中理解。不同榜单的分数不能直接横向等同,分数提升也不代表每一个文本任务都变强。对于开发者,更值得关注的是模型在目标工作流中的实际表现:长上下文是否会丢指令,复杂表格是否会漏字段,代码修改后是否能准确定位回归,以及多轮任务是否会在中途偏离目标。

效率路线:低激活参数不等于低部署门槛

Ling-3.0-flash-VL 的核心效率优势来自稀疏激活,而不是单纯压缩模型规模。单次激活 5.5B 参数,有利于降低每 Token 计算量,并为实时视频对话、多轮视觉交互和长时任务提供更低延迟的可能性。

实时多模态任务的瓶颈通常不只在模型计算。视频帧采样、图像编码、视觉 Token 数量、KV Cache 增长、跨卡通信和输出解码都会影响最终响应速度。尤其是在 256K 上下文中同时放入长视频、历史对话和工具结果时,实际延迟可能与输入长度、帧率和缓存命中率密切相关。

因此,开发者不应只看“5.5B 激活”这个数字。更有价值的测试方式是固定硬件和并发条件,分别测量首 Token 延迟、每秒输出 Token、视觉编码耗时、长上下文吞吐、视频帧数对延迟的影响,以及多轮任务中的错误恢复率。

开源版本与部署选择

Ling-3.0-flash-VL 当前已在 Ling Studio 上线并提供免费体验,BF16 与 FP8 版本已经在 Hugging Face 和 ModelScope 开源,FP4 与 INT4 版本计划近期发布。

| 版本 | 适合场景 | 主要特点 | 开发者需要关注的问题 | |---|---|---|---| | BF16 | 高精度验证、研究与基准测试 | 数值稳定性较好 | 显存占用高,部署成本更大 | | FP8 | 推理服务与性能测试 | 在精度和吞吐之间折中 | 需要匹配硬件与推理框架支持 | | FP4 | 计划发布的低比特部署 | 有望进一步降低显存需求 | 需要验证多模态精度损失 | | INT4 | 计划发布的低比特部署 | 更适合资源受限环境 | 视觉细节和长上下文能力需重点测试 |

BF16 是目前更适合建立基线的版本。它可以尽量减少量化误差对网页还原、OCR、表格识别和医疗图像理解的干扰,适合研究人员先确认模型原始能力。FP8 则更接近线上推理的现实选择,但最终收益取决于 GPU、推理引擎和并行配置。

FP4 与 INT4 版本如果按计划发布,可能进一步降低部署门槛,但低比特量化对视觉模型的影响不能只看文本基准。图像细节、字体边缘、表格线条和小尺寸文字都可能对量化更敏感,开发者需要单独测试视觉任务,而不能直接套用文本模型的量化结论。

它与普通视觉语言模型的差别在哪里

普通视觉语言模型是以图像理解和文本生成作为主要交互形式的模型,而视觉 Agent 更强调在外部环境中连续行动、接收反馈并完成目标。两者都能“看图”,但评估重点不同。

| 对比维度 | 普通视觉语言模型 | Ling-3.0-flash-VL 的视觉闭环路线 | |---|---|---| | 典型流程 | 输入图片后生成回答 | 观察、行动、验证、修正 | | 网页生成 | 一次生成代码 | 生成后渲染并根据结果修正 | | GUI 操作 | 识别界面或给出建议 | 识别界面并持续执行操作 | | 视频理解 | 总结内容、回答问题 | 根据连续状态推进任务 | | 失败处理 | 通常需要用户重新提问 | 尝试根据新视觉反馈自我修正 | | 主要风险 | 识别错误、幻觉 | 错误操作被连续放大 |

视觉闭环的价值很明确,但风险也更直接。如果模型在第一步错误识别了按钮,后续操作可能在错误路径上越走越远;如果它误判网页已经修复,可能把错误结果提交到生产环境。因此,Agent 系统仍然需要设置操作权限、关键步骤确认、最大循环次数和失败回滚机制。

OpenAI Hub 判断:这不是“多模态版 Flash”,而是 Agent 基础设施的一次补齐

Ling-3.0-flash-VL 的真正看点,是蚂蚁把原有 Flash 路线的低激活、高吞吐和长上下文能力,进一步接到了视觉环境反馈上。它没有停留在“输入一张图片,输出一段文字”的多模态常规赛道,而是尝试解决视觉 Agent 最棘手的问题:模型如何知道自己刚刚做对了,如何发现做错了,以及如何根据结果继续行动。

从开发者视角看,这个模型最值得试的不是普通图片问答,而是以下工作流:

  • 截图到网页:比较目标截图和实际渲染结果,测试多轮修正能力;
  • 代码与界面联动:让模型读取运行结果、报错窗口和测试页面,再继续修改代码;
  • 跨应用自动化:验证模型是否能在弹窗、加载失败和权限提示下保持任务状态;
  • 长视频任务:测试 256K 上下文对连续画面、长时事件和多轮指令的保持能力;
  • 跨文档分析:观察模型能否关联多份报告,同时明确区分事实、推断和风险提示。

它目前仍有两个现实限制。第一,官方披露的 Image-to-WebDev Arena 领先 GPT-5.4 是单项评测结果,不能替代更广泛的独立测评;第二,124B 总参数意味着开源不等于低门槛,真正实现高并发和低延迟还需要成熟的 MoE 推理、视觉 Token 管理和缓存系统。

总体来看,Ling-3.0-flash-VL 是蚂蚁百灵从“高性价比文本模型”向“可执行多模态 Agent”迈出的一步。它的竞争力不只取决于榜单分数,而取决于闭环是否真的能减少人工返工:网页能否少改几轮、GUI 任务能否少卡住、长视频分析能否保持状态、医疗报告整理能否降低漏项率。对于正在搭建视觉 Agent 的团队,这些才是比参数规模更值得验证的指标。

参考来源

  1. IT之家:蚂蚁百灵系列首个原生多模态模型 Ling-3.0-flash-VL 发布开源——提供模型参数、视觉反馈闭环、评测表现和开源计划等信息。
  2. Hugging Face:inclusionAI/Ling-3.0-flash-VL——模型权重与开源项目信息页面。
  3. OpenAI Hub:蚂蚁发布 Ling-3.0-flash——Ling-3.0-flash 文本版的架构、长上下文和 Agent 训练背景参考。

相关推荐

查看全部