AI 快讯微软上线 MAI-Image-2.6-Flash
模型上新

微软上线 MAI-Image-2.6-Flash

2026-09-05T09:03:24.645Z
微软上线 MAI-Image-2.6-Flash

微软于 9 月 4 日在 Microsoft Foundry 开放预览 MAI-Image-2.6-Flash,主打高速、低成本的文生图与图像编辑。微软称其生成速度是 GPT-Image-2-Medium 的 2 倍,GPU 效率提升 72%。

微软上线 MAI-Image-2.6-Flash:速度翻倍,价格砍半

微软在 9 月 4 日发布了 MAI-Image-2.6-Flash,并通过 Microsoft Foundry 开放公开预览。这是 MAI-Image-2.6 的高速版本,核心目标不是把图像质量继续推到极限,而是把图像生成从“偶尔调用的创意工具”推进到可以大规模接入产品和工作流的基础能力。

微软 AI 负责人穆斯塔法·苏莱曼在 9 月 5 日公开表示,MAI-Image-2.6-Flash 的生图速度是目前全球最佳图像模型 GPT-Image-2-Medium 的 2 倍,GPU 效率提升 72%。这里的对比对象在微软官方博文中标注为 GPT-Image-2-Medium,而不是一个笼统的“GPT Image 2”。

这次发布最值得关注的地方,不是又多了一个可以生成海报、产品图和概念图的模型,而是微软开始把图像模型明确拆成两条产品路线:MAI-Image-2.6 负责质量和复杂任务,MAI-Image-2.6-Flash 负责速度、吞吐量和成本。对于企业用户来说,这种区分比单纯公布一组漂亮的样例图更有价值。

微软 MAI-Image-2.6-Flash 与 MAI-Image-2.6 的速度、价格和适用场景对比示意图

Flash 版到底快在哪里

MAI-Image-2.6-Flash 是微软面向低延迟和高吞吐量场景优化的图像生成模型。它支持文本生成图像,也支持基于现有图片的图像编辑,同时保留了 MAI-Image-2.6 的主要生成与编辑能力。

微软公布的核心指标是:相较 GPT-Image-2-Medium,MAI-Image-2.6-Flash 的图像生成速度达到 2 倍,GPU 效率提升 72%。其中,“速度 2 倍”更接近用户等待时间的改善,“GPU 效率提升 72%”则更直接影响服务商的单位成本和并发能力。

这两个数字需要分开理解。生成速度提升 2 倍,意味着在相同硬件和近似任务条件下,用户等待时间有机会从 10 秒降到 5 秒;GPU 效率提升 72%,则意味着在同样的 GPU 预算下,系统可能承载更多请求。不过,微软目前公开信息没有完整披露测试时的图片尺寸、并发量、硬件型号、采样配置和 p50 或 p95 延迟,因此不能把这两个数字直接理解为所有场景下都能稳定获得的固定收益。

对于图片生成产品,真正影响体验的往往不是平均速度,而是排队时间、首张结果延迟和批量任务吞吐量。一个电商后台每天生成 10 万张商品图,和一个设计师偶尔生成一张概念图,对模型的要求完全不同。前者更关心每小时完成多少张图、单位图片成本是多少,以及高峰期是否会出现队列堆积;后者才更关心细节质量和一次生成是否成功。

Flash 版本的价值,主要就体现在前一种工作负载中。

能做什么:生成和编辑能力没有被砍掉

文生图是根据自然语言描述生成新图像的能力;图生图编辑则是基于现有图像进行修改,同时尽量保留原图的主体、构图或品牌元素。

MAI-Image-2.6-Flash 同时支持这两类任务,功能范围包括:

  • 对象移除:删除画面中的人物、物体或背景元素,并补全被遮挡区域。
  • 对象替换:将图片中的产品、服装、家具或其他主体替换成指定内容。
  • 局部重绘:只修改选定区域,不必重新生成整张图片。
  • 属性修改:调整颜色、材质、尺寸、光照、姿态或其他视觉属性。
  • 文字更新:修改海报、包装、广告牌等图片中的文字内容。
  • 文生图生成:根据自然语言提示生成产品图、营销素材、概念设计和其他商业视觉内容。

微软在 MAI 图像模型的产品描述中,重点强调了复杂场景中的对象一致性、跨视角和时刻的人物一致性、材料与物理属性准确性,以及空间和几何推理能力。这些能力决定了模型是否适合连续创作,而不只是生成一张看起来不错的单图。

对象一致性是指同一个物体在复杂画面中能够保持身份、材质、比例、标记和方向不变。比如一辆汽车出现在街景、展厅和广告海报中,车标、车身比例和颜色不能每张图都发生变化。人物一致性则要求同一角色在不同姿势、镜头角度、服装和光照下仍然容易被识别。

这些能力对商业场景尤其重要。做一张社交媒体配图时,模型偶尔画错一个按钮问题不大;但如果要为同一款手机制作 20 张不同场景的广告图,产品边框、摄像头位置、Logo 和材质一旦漂移,后续就需要人工返工,模型节省的时间会被重新消耗掉。

价格明显低于旗舰版

MAI-Image-2.6-Flash 的价格低于 MAI-Image-2.6,尤其是图片输入和图片输出的价格差距比较明显。以下价格按每 100 万 Token 计费,具体费用还会受到图片尺寸、输入内容和实际调用量影响。

| 计费项 | MAI-Image-2.6-Flash | MAI-Image-2.6 | Flash 相对旗舰版 | |---|---:|---:|---:| | 文本输入 | 1.75 美元 / 100 万 Token | 5 美元 / 100 万 Token | 低 65% | | 图片输入 | 2.50 美元 / 100 万 Token | 8 美元 / 100 万 Token | 低 68.75% | | 图片输出 | 19 美元 / 100 万 Token | 38 美元 / 100 万 Token | 低 50% |

按参考汇率计算,MAI-Image-2.6-Flash 的文本输入价格约为每 100 万 Token 11.8 元人民币,图片输入约为 16.8 元,图片输出约为 127.8 元。MAI-Image-2.6 的对应价格约为 33.6 元、53.8 元和 255.7 元。

对图片模型来说,输出价格通常才是成本大头。Flash 版将图片输出价格从 38 美元降到 19 美元,相当于直接降低 50%。如果一个内容平台每天生成 1 万张图片,且其他条件相同,单看输出计费,Flash 版的理论费用可以比旗舰版少一半。

不过,Token 计费并不等于“一张图固定多少钱”。图片输入通常会根据图片分辨率和视觉内容折算为 Token,输出成本也可能受到生成尺寸和返回内容影响。因此,企业在评估模型时,应该用真实任务做一轮成本测试,而不是简单地把每百万 Token 的价格换算成每张图片的固定价格。

价格对比也说明了微软的产品策略:MAI-Image-2.6-Flash 并非低配试验品,而是试图用更低的单位成本争夺高频图像工作流。只要质量损失控制在可接受范围内,生产系统通常会优先选择 Flash 版本,把旗舰模型留给失败成本更高的任务。

两个版本怎么选

MAI-Image-2.6 适合最终交付、复杂编辑、商业设计和对文字渲染要求较高的任务;MAI-Image-2.6-Flash 适合对延迟、吞吐量和成本更敏感的批量工作流。

| 使用场景 | 推荐模型 | 原因 | |---|---|---| | 最终商业广告素材 | MAI-Image-2.6 | 更适合追求最高图像质量和细节稳定性 | | 复杂的多轮图像编辑 | MAI-Image-2.6 | 编辑失败或主体漂移的代价更高 | | 包装、海报、Logo 等文字密集图片 | MAI-Image-2.6 | 对文字准确性和版式控制要求更高 | | 电商商品图批量生成 | MAI-Image-2.6-Flash | 更低的输出价格和更高吞吐量 | | 社交媒体配图和内容变体 | MAI-Image-2.6-Flash | 需要快速生成大量可用版本 | | 设计流程中的草图探索 | MAI-Image-2.6-Flash | 先低成本试错,再用旗舰版定稿 | | 实时交互式图片编辑 | MAI-Image-2.6-Flash | 更低延迟有利于连续修改 |

更实际的用法是让两个模型形成分工。第一阶段用 Flash 生成多个构图和风格方向,快速筛掉不合格结果;第二阶段把选中的方案交给 MAI-Image-2.6 处理最终细节、文字和商业交付。这类似视频制作中的代理文件和最终渲染:预览阶段追求快,成片阶段追求稳定。

微软正在补齐自己的模型矩阵

MAI-Image-2.6-Flash 并不是微软突然进入图像生成市场,而是 MAI 系列继续扩张后的又一次产品迭代。微软此前已经推出 MAI-Image-2.5、MAI-Image-2.5-Flash 和 MAI-Image-2.5-Pro,并将这些模型放入 Microsoft Foundry 的模型目录中。

微软在 2026 年 6 月发布 MAI-Image-2.5 时,已经把图生图编辑、保留身份特征和品牌元素的可控编辑作为重点能力,并强调该模型在 Arena.ai 图像生成模型榜单首发排名第 3。随后推出的 Pro 和 Flash 版本,进一步把同一能力拆分成质量优先和效率优先两条路线。

这套节奏和大型云平台常见的模型产品化方式一致:先用一个高质量模型建立能力上限,再用 Flash、Efficient 或 Mini 一类的版本扩大调用规模。对开发者来说,模型名称的更新速度可能让选型变得更复杂,但好处是可以根据任务价值分配预算,而不是所有请求都使用最贵的模型。

微软选择通过 Microsoft Foundry 开放预览,也说明它更看重企业集成,而不仅是面向个人用户提供一个聊天式图片生成入口。Foundry 的定位是微软的模型开发与部署平台,企业可以在其中进行模型选择、部署和工作负载管理。图像模型一旦进入企业平台,竞争重点就会从“谁生成的样例图更惊艳”,转向可用性、稳定性、计费透明度、并发能力和合规支持。

真正的短板仍需要实测

MAI-Image-2.6-Flash 目前最大的未知数,是它在速度下降低了多少质量,以及这种质量差异是否会在高频编辑任务中被放大。

图像模型的质量并不是单一分数。一次性生成一张风格化插画,Flash 版可能已经足够;但在以下任务中,模型差异会更明显:

  • 需要精确还原产品外观的商品图。
  • 需要连续修改十几轮的设计稿。
  • 需要在图片中生成大量准确文字的海报。
  • 需要保持角色、服装和道具一致的系列内容。
  • 需要严格控制透视、比例和遮挡关系的空间场景。

尤其是文字生成,仍然是图像模型最容易暴露问题的地方。一个标题错一个字,商品包装上的型号少一个字符,都会让图片无法直接投入商业使用。微软明确建议将对文字渲染要求高的任务交给 MAI-Image-2.6,这实际上也是对 Flash 版能力边界的提示。

此外,当前公开信息主要集中在速度、GPU 效率、价格和功能覆盖上,尚未给出一套足够完整的跨模型评测表。包括平均延迟、p95 延迟、不同分辨率下的生成时间、批量并发上限、图像编辑成功率、文字准确率,以及在复杂提示词下的失败率,都需要等用户实际接入后再判断。

因此,Flash 版“速度是 2 倍”可以作为选型信号,但不能直接当成完整的性能结论。对生产系统而言,最应该测的是单位可交付素材成本,而不是单次生成速度。假设 Flash 版每张图快 2 倍,但需要多生成一次才能得到可用结果,那么实际吞吐和成本优势就会小于宣传数字;反过来,如果它在批量任务中保持较高的一次成功率,优势才会真正体现出来。

对开发者和产品团队意味着什么

MAI-Image-2.6-Flash 的发布,最直接的影响是降低了将图像生成接入现有产品的试错成本。

第一类受益者是电商和营销团队。商品主图、场景图、节日活动图和广告变体通常需要大量版本,人工制作速度慢,旗舰模型成本又高。Flash 版更适合先批量生产候选素材,再由人工筛选和后期处理。

第二类受益者是设计软件和内容工具。实时预览、局部重绘、背景替换和风格变体都属于用户会连续操作的功能。延迟从十几秒降到几秒,用户体验会从“提交任务后等待结果”变成“边改边看”,产品交互逻辑也会因此改变。

第三类受益者是需要多轮视觉生成的代理系统。一个自动化内容流程可能需要先生成草图,再检查构图,随后修改主体、替换背景、调整文案,最后输出多个尺寸。如果每一步都使用旗舰模型,成本会迅速累积;Flash 版可以承担前置探索和大部分中间步骤,旗舰模型只负责最终交付。

但企业不应该只看单价。接入之前至少需要记录四组指标:首图延迟、达到可用标准所需的平均生成次数、每张可交付图片成本,以及在高并发下的失败和排队比例。只有把这些指标放进实际业务流程,才能判断 Flash 版究竟是便宜,还是只是单次调用价格便宜。

OpenAI Hub 观点

MAI-Image-2.6-Flash 是一次有明确产品定位的更新。它没有试图取代 MAI-Image-2.6,而是把图像生成模型拆成“质量上限”和“生产效率”两种能力。微软给出的 2 倍速度、72% GPU 效率提升,以及图片输出价格降低 50%,都指向同一个结论:Flash 版的战场是规模化调用。

它是否能成为企业图像工作流的默认模型,还要看真实编辑质量和一次生成成功率。对于只需要偶尔做一张海报的用户,旗舰版仍然更稳;对于电商、营销、设计工具和内容平台,Flash 版值得优先测试。更合理的部署方式是把它作为高频生产层,把 MAI-Image-2.6 作为最终交付层,而不是在所有任务中二选一。

截至今天,也就是 2026 年 9 月 5 日,MAI-Image-2.6-Flash 已通过 Microsoft Foundry 开放公开预览。它现在更像一个面向开发者和企业团队的生产工具,而不是一次单纯的模型榜单更新。接下来最值得观察的,是微软是否会公布更完整的延迟测试,以及用户在产品图、文字海报和连续编辑任务中的实际反馈。

参考来源

相关推荐

查看全部