AI 快讯蚂蚁开源6B设计模型,生成后还能拆层
模型上新

蚂蚁开源6B设计模型,生成后还能拆层

2026-09-23T11:08:39.365Z
蚂蚁开源6B设计模型,生成后还能拆层

蚂蚁百灵今日开源 Ming-Image-0.1-Design 系列,两个 6B 模型分别负责生成 UI、海报和信息图,以及把设计图拆成可编辑透明图层。该系列在 Artificial Analysis 的 UI/UX Design 开放权重评测中排名第一。

蚂蚁开源6B设计模型,生成后还能拆层

蚂蚁百灵今天开源了 Ming-Image-0.1-Design 系列,试图解决 AI 生成设计长期存在的一个问题:图片可以生成,但生成之后很难继续改。

这次发布包含两个参数量均为 6B 的模型。Ming-Image-0.1-Design 负责根据文字需求生成 UI、Dashboard、信息图、海报和完整视觉设计;Ming-Image-0.1-Design-Layer 则负责把一张已经生成或导入的设计图拆成 2 至 9 个透明图层,让背景、主体、文字、卡片和装饰元素可以继续独立编辑。

展示 Ming-Image-0.1-Design 生成 UI 海报,以及 Ming-Image-0.1-Design-Layer 将设计图拆分为背景、主体、文字和装饰图层的对比示意图

这不是又一个通用文生图模型

Ming-Image-0.1-Design 是一个面向 UI、信息图和文字密集型视觉设计的 6B 文生图模型,它的目标不是生成一张“看起来漂亮”的图片,而是一次性完成页面结构、文案排布、视觉风格和素材组合。

这一区别很关键。通用文生图模型通常更擅长人物、风景和艺术风格,但在按钮文字、导航栏、卡片布局、多栏信息和长标题等场景中,容易出现文字乱码、模块错位以及页面层级混乱。Ming-Image-0.1-Design 的训练和评测重点则放在了这些更接近真实设计工作的任务上。

蚂蚁百灵此次重点增强了四项能力:

  1. 结构化提示词处理:支持最长 8K token 的结构化提示词,将自然语言需求拆分为文案、模块、布局和视觉风格。
  2. 文字与版式稳定性:针对标题、按钮、卡片和多区域信息进行优化,减少文字渲染错误与布局漂移。
  3. 端到端完整生成:模型一次完成页面的整体设计,而不是先生成背景、再生成插画、最后拼接装饰素材。
  4. 原生 RGBA 生成:通过原生 RGBA VAE 直接生成透明背景的人物、商品、图标和装饰素材。

其中,8K 结构化提示词更像是给模型一份“设计需求文档”,而不是一句简单的画面描述。开发者可以在提示词中明确页面标题、按钮文案、卡片数量、信息层级、配色方案和布局规则,模型再将这些要求组织成完整画面。

这对 AI 生成 UI 尤其重要。一个“生成科技感数据大屏”的提示词,通常只能得到风格化的视觉结果;但如果进一步描述顶部导航、左侧菜单、三列数据卡片、中央趋势图和底部告警区域,模型才有机会生成接近产品原型的页面。

Layer 模型把“生成结果”变成“中间资产”

Ming-Image-0.1-Design-Layer 是这次发布中更值得关注的部分,因为它改变了 AI 设计输出的形态。

Ming-Image-0.1-Design-Layer 是一个将扁平设计图拆解为多个可独立编辑透明图层的模型,输出图层可以重新移动、替换、组合或继续进入后续设计流程。

传统文生图的输出通常是一张 PNG 或 JPG。无论画面里有多少文字、卡片和图标,它们最后都被压缩在同一张图片中。用户想修改一个按钮时,往往只能重新生成整张图,或者使用图像编辑软件手动抠图。

Layer 模型的思路是先理解画面中的视觉组成,再把它们拆出来。例如,一张产品发布海报可能被拆成以下几层:

  • 背景渐变与纹理;
  • 产品主体或人物;
  • 主标题与副标题;
  • 卡片、按钮和数据模块;
  • 图标、装饰线条与光效;
  • 前景遮罩或局部阴影。

根据补充资料,Layer 模型最多可以输出 2 至 9 层。层数并不是越多越好:只需要快速修改主视觉的用户,可能更适合背景、主体和文字三层;需要精细排版的设计师,则可能希望每段文字、每个图标和每个卡片都单独拆开。

这也是该模型目前的限制之一。图层拆分不存在唯一标准,同一张图可以有多种合理的分层方式。模型只能根据画面结构和任务目标做出一种判断,不能保证完全符合用户的编辑习惯。

两个模型分别解决什么问题

| 模型 | 参数量 | 主要输入 | 主要输出 | 更适合的场景 | 当前限制 | |---|---:|---|---|---|---| | Ming-Image-0.1-Design | 6B | 文字需求、结构化提示词 | 完整 UI、海报、信息图、视觉设计 | 从零生成页面和设计方案 | 复杂手部动作、连续操作、精细光影仍不稳定 | | Ming-Image-0.1-Design-Layer | 6B | 创意图或设计图 | 2 至 9 层透明 RGBA 图层 | 拆分背景、主体、文字、卡片和装饰 | 复杂遮挡、透明材质和光效可能导致边缘残留或图层缺失 |

评测第一,但要看清楚“第一”的范围

Ming-Image-0.1-Design 在 Artificial Analysis 于 2026 年 9 月 18 日更新的 UI / UX Design 专项评测中,以 1082 Elo 位列开源模型第一。

该成绩来自 UI/UX Design 开放权重子榜,而不是所有文生图模型的综合排名。这个限定很重要。它说明 Ming-Image-0.1-Design 在界面结构、视觉布局和文字呈现方面具备竞争力,但不能直接推导出它在写实人像、电影感画面、复杂光影或艺术风格迁移上也全面领先。

从具体指标看,模型在 UI/UX 场景中的版式胜率为 67.4%,复杂构图胜率为 67.0%,文字渲染胜率为 66.7%。这三个数字透露出一个相对清晰的结论:它最有价值的地方不是把单张图片做到极致,而是让页面中的多个元素更稳定地共存。

| 评测指标 | Ming-Image-0.1-Design 表现 | 指标含义 | |---|---:|---| | Artificial Analysis Elo | 1082 | UI/UX Design 开放权重子榜排名依据 | | UI/UX 版式胜率 | 67.4% | 页面结构、模块排列和空间组织能力 | | 复杂构图胜率 | 67.0% | 多主体、多区域画面的整体控制能力 | | 文字渲染胜率 | 66.7% | 标题、按钮和信息文本的可读性与准确性 |

对于开发者和深度用户来说,版式胜率比单纯的审美评分更有参考价值。真实的设计工作很少只看一张图是否好看,更多时候要看标题是否放在正确位置、信息卡片是否有明确层级、按钮是否仍然可读,以及页面在多个区域之间是否保持统一的色彩和间距。

为什么端到端生成比“拼素材”更有优势

蚂蚁百灵强调,Ming-Image-0.1-Design 采用端到端生成方式,减少了通过代码多次调用通用生图模型、分别生成背景、插画和装饰素材的需要。

端到端生成的优势在于全局控制。模型在生成标题、主体、背景和装饰时,可以同时考虑它们之间的空间关系、色彩关系和视觉风格。相比之下,传统的模块化流程更像是把多个设计师临时召集到一起:每个人负责一块,最后再把成果拼在画布上。即使每一块单独看都不错,拼接后也可能出现色系冲突、光照方向不一致和画风不统一。

当然,端到端并不意味着所有场景都应该交给一个模型完成。对于需要严格像素控制、品牌规范约束或可验证交互逻辑的产品界面,代码和专业设计工具仍然更可靠。Ming-Image-0.1-Design 更适合前期方案探索、营销物料、活动页面草图、数据大屏概念稿和视觉方向验证。

它的实际价值可以概括为一句话:先把“从无到有”的成本降下来,再把结果交给人或工具继续修改。

Design Skill 和 PPT Skill,把模型接入工作流

蚂蚁百灵还同步开源了 Design Skill 和 PPT Skill,这说明此次发布并不只是单独放出两个模型,而是在尝试把生成结果连接到前端页面和办公文档。

Design Skill 的定位是串联设计生成、素材拆解与前端 Coding。理想流程是:用户先用自然语言描述页面,Design 模型生成视觉方案,再用 Layer 模型拆分素材,最后将结构和素材交给前端代码生成环节。

这条链路对应的是当前 AI 设计工具最常见的工作方式:AI 先生成一个视觉上完整的页面,再由开发者将它还原为 HTML、CSS 或前端组件。相比直接让大模型从零写页面,先提供一张结构完整的视觉参考图,通常更容易保持布局一致。

PPT Skill 则瞄准另一类高频任务:把扁平图片还原为可继续编辑的 PowerPoint。过去,AI 生成的演示文稿经常存在一个问题——看起来像 PPT,但每一页实际上是一张不可编辑的图片。用户想修改一段文字、换一张图片或调整版式时,仍然需要重新制作。

如果 PPT Skill 能够稳定地将文字、图片、背景和图形拆开,那么它的价值不在于“自动做一份 PPT”,而在于让 AI 生成的内容真正进入办公软件的编辑链路。这比单纯输出一组图片更接近生产力工具。

开源方式和体验门槛

Ming-Image-0.1-Design 系列采用 MIT 许可证开源,模型权重和使用说明已经发布到 Hugging Face。官方仓库提供了本地推理方式,并支持 2048 分辨率示例;提示词增强可以结合 Ling-3.0-flash-VL 或 qwen3.8-27B 等模型完成。

需要注意的是,6B 参数并不等于普通电脑可以无压力运行。图像生成模型的显存需求不仅取决于参数量,还与精度、分辨率、推理框架和是否启用量化有关。对于开发者而言,本地部署前需要重点确认显存占用、VAE 配置、生成分辨率和推理速度,而不是只看模型参数规模。

为了方便快速体验,Ming-Image-0.1-Design 已在 OpenRouter 提供为期两周的免费调用。这个方式更适合先验证模型的文字渲染、版式稳定性和风格适配能力,再决定是否投入本地部署和工作流集成。

能力边界仍然清楚

Ming-Image-0.1-Design 目前最稳定的是排版和文字,但在复杂人物动作、连续操作步骤以及非常精细的阴影和反光效果上仍可能出现问题。

这意味着它更像一个“设计方案生成器”,而不是可以直接替代资深设计师的全自动系统。比如,一个包含人物手部交互、多个连续动作和复杂产品反光的广告画面,依然可能需要多轮重绘或人工修正。

Layer 模型的限制则集中在分层准确性上。大量叠加光效、特殊透明材质和复杂遮挡时,模型可能出现边缘残留、主体被切断或图层缺失。透明背景并不等于完美抠图,尤其当主体与背景颜色接近,或者画面中存在半透明阴影时,后续仍可能需要人工清理。

因此,当前更现实的使用方式不是“生成后完全不改”,而是把它放在设计流程的中前段:

  1. 用 Design 模型快速探索多个页面方向;
  2. 选择结构和风格最接近目标的结果;
  3. 用 Layer 模型拆出背景、主体、文字和装饰;
  4. 将图层交给设计工具、前端代码或 PPT 工作流继续处理;
  5. 对品牌字体、间距、交互逻辑和复杂光影进行人工修正。

判断:开源竞争正在从“大模型”转向“专项工作流模型”

Ming-Image-0.1-Design 的意义,不只是蚂蚁又开源了一个 6B 图像模型,而是它把开源模型的竞争单位进一步缩小到了具体工作流。

过去,模型发布往往围绕参数量、通用能力和综合榜单展开;现在,6B 规模的专项模型也可以凭借 UI 排版、文字渲染、透明素材生成和图层拆解能力,在一个明确的生产场景中建立优势。对用户而言,这种模型未必需要“什么都会”,但必须在某一条链路上足够稳定。

Ming-Image-0.1-Design 当前最值得关注的地方,是它没有把输出终点设定为一张图片。Design 负责生成,Layer 负责拆解,Design Skill 负责连接前端,PPT Skill 负责进入办公文档。模型输出正在从最终成品,变成可以被继续编辑、重组和复用的中间资产。

但它距离真正替代设计软件还有明显距离。文字和版式已经是它的强项,复杂光影、精细抠图、严格品牌规范和可验证交互仍需要人工或传统工具兜底。对于开发者和 AI 深度用户来说,最值得现在就测试的不是它能不能“一键做出完美页面”,而是它能否把从需求到可编辑原型的时间,从几个小时压缩到几十分钟。

如果这个目标成立,Ming-Image-0.1-Design 就不只是一个开源生图模型,而是一个面向设计、前端和办公协作的视觉中间层。它的上限取决于图像生成质量,下限则取决于图层、代码和文档之间能否真正打通。

参考来源

相关推荐

查看全部