AI 快讯微软图像语音模型同时补位
模型上新

微软图像语音模型同时补位

2026-07-24T02:04:27.349Z

微软开放预览 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash,并已将同系列模型部署到 Bing、PowerPoint 和 OneDrive。真正值得关注的不是又多了两个模型,而是微软开始用自研模型替换产品栈中的高频能力。

微软一次补上图像与语音两块拼图

微软在当地时间 7 月 23 日开放预览两款自研模型:面向高质量图像生成与编辑的 MAI-Image-2.5-Pro,以及面向高并发语音服务的 MAI-Voice-2-Flash

这次发布的关键信号不是微软又增加了两个模型名称,而是 MAI 自研模型已经开始进入 Bing、PowerPoint 和 OneDrive 等真实产品,承担默认生成、图像编辑或高频交互任务。对于微软而言,模型竞争正从“有没有旗舰模型”转向“能不能用自己的模型覆盖数亿用户每天触发的具体功能”。

MAI 是 Microsoft AI 自研模型系列,目标是为微软产品提供可控、可追踪并能针对特定场景优化的基础能力。 微软表示,这些模型采用内部训练流程和经过清理、可追踪的企业级数据训练,不依赖对第三方产品进行蒸馏。

这里的“未蒸馏第三方产品”值得单独看待。模型蒸馏是让较小模型学习另一模型输出分布或行为模式的训练方法,通常用于压缩成本和复制能力。 微软特意强调不依赖第三方模型蒸馏,实际上是在回答两个问题:一是模型能力的来源是否独立,二是在版权、数据治理和供应链上是否能够向企业客户解释清楚。

MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 双模型发布示意图,左侧为图像生成和局部编辑,右侧为低延迟语音波形与客服场景

MAI-Image-2.5-Pro:重点不是“会画”,而是能进入办公流程

MAI-Image-2.5-Pro 是微软目前精度最高的自研图像模型,主要处理高质量生成、细节编辑和图像内文字渲染。 这三个方向并不新鲜,但非常贴近微软自己的产品需求:Bing 需要规模化生成,PowerPoint 需要可控编辑,OneDrive 则需要用户愿意保存的稳定结果。

图像内文字渲染尤其重要。多数图像模型已经能生成观感不错的海报,但一旦要求它正确写出品牌名、活动日期或产品型号,字符缺失、笔画错乱和文字变形仍然常见。对于 PowerPoint 的封面、信息图和营销物料而言,“画面漂亮但文字错误”不是轻微瑕疵,而是直接不可用。

自然语言图像编辑是用户用文字描述修改目标,而不必手动画遮罩或调整图层。 用户可以要求模型“保留人物和构图,把背景改成傍晚”“删除桌上的水杯”“将标题换成白色无衬线字体”,模型据此完成局部或整体修改。这个能力放进 PowerPoint,比单独提供一个文生图入口更有价值,因为办公用户真正高频的需求往往不是从零生成,而是把已有素材改到能用。

微软公布的公开预览价格如下:

| 计费项目 | MAI-Image-2.5-Pro 价格 | 按参考汇率折算 | 相对文本输入价格 | |---|---:|---:|---:| | 文本输入 | 5 美元/100 万 Token | 约 33.9 元 | 1 倍 | | 图像输入 | 8 美元/100 万 Token | 约 54.3 元 | 1.6 倍 | | 图像输出 | 106 美元/100 万 Token | 约 718.8 元 | 21.2 倍 |

图像输出是这套价格结构中最主要的成本项。 每 100 万输出 Token 收费 106 美元,是文本输入的 21.2 倍、图像输入的 13.25 倍,这符合图像生成模型的计算特点:提示词通常很短,真正消耗算力的是图像表示的逐步生成过程。

不过,这组数字暂时不能直接换算成“生成一张图多少钱”。微软在现有公开信息中没有同时给出不同分辨率、画幅和质量档位对应的输出 Token 数量,因此开发者不能只拿 106 美元除以一个固定张数。等模型进入正式可用阶段后,单图 Token 消耗、并发限制、生成时延和失败重试策略,才是判断实际成本的必要参数。

MAI-Voice-2-Flash:微软要的是吞吐量,不只是拟人度

MAI-Voice-2-Flash 是为高频、低延迟和大规模部署优化的语音模型。 微软给出的核心数字是:相较 MAI-Voice-2,速度提升约 2 倍,成本降低 32%,公开预览价格为每 100 万个字符 15 美元,约合人民币 101.7 元。

语音模型的“Flash”并不只是模型变小。对客服中心、语音助手和实时播报系统而言,系统要同时处理成百上千路请求,首段音频何时开始播放、长文本能否持续稳定输出、峰值并发时是否排队,都比单条样音的拟人度更直接影响体验。

低延迟语音服务是指系统在接收文本或交互请求后,能快速开始并持续返回自然语音。 如果一句回复要等待数秒才能开口,即使最终声音足够自然,也会让用户误以为系统失去响应;反过来,首包足够快、韵律稍有妥协的模型,往往更适合电话客服和车载助手。

| 模型 | 主要定位 | 公开预览价格 | 官方披露的性能或成本变化 | 典型场景 | |---|---|---:|---|---| | MAI-Image-2.5-Pro | 高精度图像生成与编辑 | 文本输入 5 美元、图像输入 8 美元、图像输出 106 美元/百万 Token | PowerPoint 特定场景对比 GPT-Image-2,GPU 成本最高降低 84% | 主视觉、图中文字、局部编辑 | | MAI-Voice-2-Flash | 高并发低延迟语音 | 15 美元/百万字符 | 相比 MAI-Voice-2 速度约 2 倍,成本降低 32% | 客服、语音助手、批量播报 | | MAI-Voice-2 | 较高质量语音基线 | 官方此次未列出当前价格 | Flash 版本的对照基线 | 自然语音生成 | | GPT-Image-2 | PowerPoint 场景中的对照模型 | 此次未公布可比价格 | MAI-Image-2.5 在特定负载下最高节省 84% GPU 成本 | 图像生成与编辑 |

如果按“降低 32% 后为 15 美元”反向估算,MAI-Voice-2 在相同计费口径下的理论成本约为每 100 万字符 22.06 美元。但这只是基于百分比的数学推算,并不等于微软公布了 MAI-Voice-2 的现行标价,因为预览折扣、部署方式和服务等级都可能改变最终账单。

微软同样没有给出 MAI-Voice-2-Flash 的首音频延迟、实时率、并发上限以及多语言覆盖范围。“速度提升 2 倍”是相对指标,而不是完整的实时性能结论。 如果基线延迟是 800 毫秒,提升 2 倍可能意味着降至约 400 毫秒;如果基线是 200 毫秒,体验差异则可能没有数字看起来那么明显。在缺少毫秒级数据前,它更适合被理解为吞吐效率声明,而非实时对话跑分。

真正的进展发生在 Bing、PowerPoint 和 OneDrive

产品落地是这次发布比模型榜单更有说服力的部分。 微软表示,Bing Image Creator 已全面采用微软自研图像模型,MAI-Image-2.5 成为默认图像生成模型,为用户提供生成和编辑能力。

这里需要区分两个名称:本次开放预览的是 MAI-Image-2.5-Pro,而微软披露已部署到多个产品中的名称是 MAI-Image-2.5。现有信息没有说明两者是否拥有完全相同的参数规模、推理配置或质量档位,因此不能简单认定 Bing 默认调用的就是 Pro 版本。更合理的理解是,MAI-Image-2.5 是模型家族或生产版本,Pro 是其中面向高精度场景开放的具体规格。

PowerPoint 的 GPU 成本数据说明微软正在用自研模型替代昂贵的通用能力。 在 PowerPoint 的图生图编辑场景中,微软称 MAI-Image-2.5 相比 GPT-Image-2 最高可降低 84% 的 GPU 成本。换算来看,新模型在该特定条件下只需原先约 16% 的 GPU 成本,理论资源效率约为原方案的 6.25 倍。

但“最高降低 84%”不能被外推成所有图像任务都节省 84%。这个结果会受到分辨率、编辑强度、批处理规模、硬件型号和推理精度影响,而且 GPU 内部成本也不等于开发者最终支付的服务价格。它最能证明的是:微软已经能针对 PowerPoint 的固定工作负载做深度优化,而不是让一个通用模型以相同配置处理所有请求。

OneDrive 的保存成功率提升反映了生成质量之外的产品指标。 微软披露,MAI-Image-2.5 成为部分图像编辑功能的默认模型后,相关场景的保存成功率提升 26%。保存动作通常意味着用户认可结果并愿意留下,因此它比单纯的点赞率更接近实际产品价值。

微软没有进一步说明这 26% 是相对增幅还是提升了 26 个百分点,也没有公布样本规模和对照周期。即便如此,这项指标仍然提供了一个重要视角:图像模型是否有用,不应只看盲测偏好,还要看用户生成后是否下载、保存、插入幻灯片或继续编辑。

“不蒸馏第三方”背后,是微软在重建模型供应链

微软自研 MAI 模型的战略意义是降低核心产品对外部模型能力和成本结构的依赖。 微软与 OpenAI 的合作仍然重要,Azure 和 Copilot 产品也不会因为两款专用模型上线就立刻改变技术路线,但在图像编辑、语音合成等高频任务上,自研模型可以带来更直接的成本控制和产品定制空间。

专用模型不必在所有榜单上击败旗舰模型。它只需要在微软自己的流量结构中做到三件事:质量达到用户可接受门槛,单位请求成本足够低,并且能围绕 Bing、Office 和云存储场景持续优化。MAI-Voice-2-Flash 的 2 倍速度与 32% 成本下降,以及 PowerPoint 场景最高 84% 的 GPU 成本下降,正好对应了后两项。

数据可追踪也会成为企业采购的重要卖点。企业客户关心的不只是模型“聪不聪明”,还包括训练数据来源能否说明、生成内容是否适合商用、数据是否进入后续训练、输出能否审计,以及模型更新后行为是否可控。微软把“清理、可追踪、企业级数据”放在发布说明的核心位置,显然是在为 Microsoft 365 和 Azure 的企业客户准备答案。

现在值得用吗?图像模型更成熟,语音模型还需等硬指标

MAI-Image-2.5-Pro 当前最有吸引力的能力是文字渲染和自然语言编辑,而不是从零生成普通图片。 文生图市场已经非常拥挤,单纯强调画质很难建立差异;但如果模型能稳定修改已有品牌素材、保留主体一致性,并正确生成图中文字,它就有机会在 Office 工作流中形成优势。

MAI-Voice-2-Flash 当前最有吸引力的指标是每 100 万字符 15 美元和相对 2 倍速度。 这套定价适合长文本播报、呼叫中心和批量内容生产,但实时助手开发者仍需等待首包延迟、抖动、并发限制、语言列表及情绪控制等数据。语音质量“自然”是必要条件,却不足以证明它适合复杂实时对话。

公开预览是产品面向外部用户测试价格、稳定性和能力边界的阶段,并不等同于正式商用版本。 预览期模型可能调整价格、限额、名称和接口行为,企业不宜仅凭当前数字锁定长期成本。现阶段更合理的做法是用真实业务素材测试文字正确率、编辑一致性、首音频延迟和失败率,而不是只比较官方演示。

微软这次不是冲榜,而是在拿回产品底层控制权

两款模型同时开放预览,说明微软正在形成“通用模型负责复杂推理、专用模型承接高频任务”的分层策略。 图像和语音都是调用量大、成本敏感、容易针对具体产品优化的能力,也最适合率先从外部模型迁移到自研模型。

这条路线短期内不会让 MAI 在公众认知上追平 GPT、Gemini 或 Claude,但它可能更快改善微软的毛利率和产品响应速度。对于一家拥有 Bing、Windows、Microsoft 365、OneDrive 和 Azure 的公司来说,能把模型塞进现有入口并跑出保存率、GPU 成本和吞吐量数据,往往比再拿一个公开榜单第一更有商业价值。

微软目前仍欠缺一份更完整的技术成绩单:MAI-Image-2.5-Pro 没有公开标准化图像评测结果,MAI-Voice-2-Flash 也没有毫秒级延迟与多语言质量数据。这次发布证明了 MAI 已经进入生产体系,但还不足以证明两款模型在开放市场上全面领先。

可以确定的是,微软不再满足于只做模型渠道、云基础设施和应用封装。随着 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 补上图像和语音能力,微软正在一点点拿回 Copilot 时代最关键的东西:模型成本、迭代节奏和产品体验的控制权。

参考来源

相关推荐

查看全部