微软:MAI在Excel追平GPT-5.6

微软称,自研MAI模型已在多数常见Excel任务上达到GPT-5.6相近水平,并可运行于H100、A100 GPU。重点不是跑分夺冠,而是用模型编排压低企业AI的单位任务成本。
微软开始用自研模型接管高频办公任务
微软正在把自研 MAI 模型推向 Excel、GitHub Copilot 等核心产品,并称其在大部分常见 Excel 任务上的表现已经与 OpenAI GPT-5.6 相当。
据 7 月 23 日披露、7 月 25 日国内媒体跟进的消息,微软首席执行官萨提亚·纳德拉表示,MAI 不仅能在部分真实业务场景中接近或超过前沿模型,还能运行在英伟达 H100、A100 等较早两代的数据中心 GPU 上,不必完全依赖最新一代 AI 加速器。微软给出的核心卖点并不是“MAI 全面击败 GPT-5.6”,而是用接近的任务效果换取更低的部署门槛和推理成本。
MAI 是微软自研的一系列人工智能模型,目标是针对 Microsoft 365、Copilot 和开发者工具中的具体工作流进行优化。 与追求所有基准测试都领先的通用前沿模型不同,MAI 更像一组面向产品的“专用发动机”:不一定负责最难的开放式推理,却要高频、稳定、便宜地完成表格分析、内容整理和工具调用。
这项进展最值得关注的地方,是微软不再把外部前沿模型视为 Copilot 唯一的智能来源。OpenAI、Anthropic 和 MAI 会共同进入微软的模型编排系统,由系统根据任务难度、时延要求、数据边界和成本预算选择模型。

“接近GPT-5.6”目前只适用于特定Excel任务
微软此次公布的是产品场景结论,而不是一份可以完整复现的通用模型评测报告。
纳德拉使用的限定语是“大部分常见的 Excel 任务”。这通常可能包括公式生成与修正、数据清洗、表格格式转换、分类汇总、趋势解释、图表建议以及基于工作簿上下文的问答,但微软目前没有公开这些任务的完整集合、样本数量、成功率、人工评分标准,也没有给出 MAI 与 GPT-5.6 的逐项分数。
因此,“相当于 GPT-5.6”不能被扩展解读为 MAI 在代码、数学、长上下文、网页检索和通用智能体任务上全面追平 GPT-5.6。更准确的表述是:微软称,经过 Excel 工作流定向训练后,MAI 已经在一批高频办公任务上进入 GPT-5.6 的同一可用区间。
现阶段可确认与尚未披露的信息如下:
| 对比维度 | 微软 MAI | OpenAI GPT-5.6 | Anthropic前沿模型 | |---|---|---|---| | Excel常见任务表现 | 微软称与GPT-5.6相当 | 被微软作为对照基准 | 未公布同条件结果 | | 主要定位 | 产品定制、高频任务、成本优化 | 通用前沿能力与复杂推理 | 通用推理、代码与智能体任务 | | 微软产品中的角色 | 承接适配度高、调用量大的任务 | 处理复杂或需要更强通用能力的任务 | 作为外部前沿模型参与编排 | | 可用硬件 | 微软称可运行于H100、A100 | 未披露本次对比的部署硬件 | 未披露本次对比的部署硬件 | | Excel评测集 | 未公开 | 未公开 | 未公开 | | 单次任务价格 | 未公开 | 未公开本次内部结算口径 | 未公开本次内部结算口径 | | 上下文长度与参数规模 | 未披露 | 本次消息未披露 | 本次消息未披露 | | 是否有完整技术报告 | 截至7月25日未见公开 | 不适用 | 不适用 |
这张表也说明,微软目前给出了方向明确但细节不足的结论。没有任务级成功率、单位任务成本和端到端时延,“更便宜”与“相当”都还无法由外部开发者独立复核。
RLE让模型学习的不是Excel知识,而是Excel工作方式
微软把 MAI 的进展归因于面向特定产品构建的强化学习环境,即 RLEs。
强化学习环境(Reinforcement Learning Environments,RLEs)是让模型在可交互任务中执行操作、获得结果反馈并持续修正策略的训练环境。 对 Excel 而言,模型不只是回答“SUMIFS 怎么写”,而是需要读取工作簿上下文、判断用户意图、选择工具、修改单元格、检查公式结果,并在失败后重新规划。
这种训练方式与普通问答数据的差异很大。静态训练样本更像让模型看大量驾考题,产品化 RLE 则像把模型放进真实道路:它必须知道什么时候转向、什么时候刹车,以及操作后是否真的到达目的地。
Excel 恰好是最适合专用模型优化的场景之一。它的操作空间虽然复杂,但结果往往可以验证:公式是否报错、引用范围是否正确、汇总数字能否对上、格式是否符合要求,这些都能转化为奖励信号。相比审美写作或开放式咨询,表格任务更容易形成自动评估闭环。
GitHub Copilot 也具备类似特点。代码能否编译、测试是否通过、补丁是否引入回归,都可以作为相对清晰的反馈,因此微软可以把模型优化目标从“生成看起来合理的内容”推进到“完成一个能被验证的操作”。
专用强化学习带来的价值,并不一定表现为模型知识面扩大。它更可能让一个尺寸较小的模型少走弯路,在固定工具和固定界面里以更短的推理链完成任务,从而同时降低延迟与计算量。
H100和A100可运行,不等于成本已经有明确数字
微软强调 MAI 可以运行在 H100、A100 上,是在向企业释放一个非常具体的部署信号:现有 GPU 资产仍然可以继续使用。
H100 于 2022 年推出,A100 则来自 2020 年,两者至今仍广泛存在于企业数据中心和云计算集群。对于已经采购这些设备的客户,避免为模型升级而迁移到更新一代硬件,可以减少资本开支、机房改造和容量排期压力。
但“能运行”与“运行得更便宜”之间仍隔着多项关键指标。企业实际成本至少取决于模型参数规模、量化精度、批处理效率、显存占用、每秒生成量、上下文缓存命中率、工具调用次数以及任务一次成功率。
一个单次推理便宜 40% 但经常需要重试的模型,最终每项任务的成本可能高于昂贵但一次完成的模型。反过来,一个能力略弱却能覆盖 80% 高频请求的小模型,也可能显著降低整个 Copilot 系统的平均成本。
单位任务成本是完成一次可验证业务任务所消耗的全部模型推理、工具调用和重试成本。 这个指标比每百万 Token 价格更适合衡量 Excel 智能体,因为用户购买的是“整理完这张表”,而不是“生成了多少 Token”。
微软此次没有公布 MAI 的具体价格,也没有披露其相对 GPT-5.6 的单位任务成本降幅。因此,现阶段能够确认的是硬件兼容性更宽,而不是某个已经量化的成本数字。
微软真正押注的是“前沿扩散与控制”
纳德拉提出的“前沿扩散与控制”,本质上是一套多模型企业 AI 架构。
前沿扩散与控制(Frontier Diffusion & Control)是把前沿模型能力分配到不同产品和任务中,并通过路由、上下文、记忆、工具与权限控制优化最终结果的系统策略。 在这套策略中,模型只是智能体系统的一部分,决定产品效果的还包括用户上下文、工具执行、长期记忆、操作权限和失败恢复机制。
纳德拉将问题概括为:当软件第一次出现可感知的真实边际成本,如何把前沿 AI 的优势扩散到整个生态系统。传统 Office 软件多服务一个用户,新增一次点击的计算成本几乎可以忽略;生成式 AI 则不同,每次总结邮件、修改公式或分析数据都会消耗 GPU 算力。
模型路由是根据任务特征动态选择最合适模型的调度机制。 一个合理的路由系统可以把公式补全、格式整理等确定性较高的任务交给 MAI,把跨工作簿推理、复杂代码生成或高风险决策交给能力更强的外部前沿模型。
这种架构可以类比医院分诊。普通问题由全科或专科门诊快速处理,疑难病例才进入成本更高的专家会诊;如果所有请求都直接送给最昂贵的模型,能力可能足够,但经济上无法支撑数亿办公用户持续调用。
微软预计会按以下逻辑拆分任务:
- 高频且可验证的任务由 MAI 优先承接。 例如表格清洗、邮件归纳、格式调整和常规公式生成。
- 复杂开放式任务继续使用前沿模型。 例如跨文档深度推理、大型代码库修改和不确定条件下的多步规划。
- 涉及企业数据的任务叠加权限与上下文控制。 模型能看到什么、能修改什么,需要由 Microsoft 365 的身份和权限系统决定。
- 失败请求可以自动升级到更强模型。 小模型无法完成时,系统再把上下文交给 GPT-5.6 或其他前沿模型,而不是一开始就支付最高计算成本。
这意味着企业未来看到的未必是一个固定模型名称。用户面对的仍然是 Excel Copilot 或 GitHub Copilot,底层模型可能在同一次任务中切换多次。
这不是微软抛弃OpenAI,而是夺回成本控制权
微软的动作更像供应链多元化,而不是与 OpenAI 切割。
微软已经明确表示,来自 OpenAI 和 Anthropic 的前沿模型仍会与 MAI 一起组成编排系统。外部模型负责维持能力上限,自研模型负责覆盖高频工作负载,微软自己的控制层则决定何时调用谁。
这种组合对微软有三重价值。第一,自研模型可以降低对单一供应商在价格、容量和发布节奏上的依赖;第二,微软掌握 Office、Windows、GitHub 和 Azure 中大量真实工作流,更容易构造贴近产品的训练环境;第三,模型路由权留在微软手中,意味着 Copilot 的毛利率和用户体验不再完全由外部模型决定。
对 OpenAI 而言,这也不必然是坏消息。随着 Copilot 用户规模扩大,最难的任务仍可能带来大量高价值调用,只是简单任务不再全部由最大模型处理。双方关系会从“单一模型深度绑定”转向“前沿能力合作加底层模型竞争”。
对 Anthropic 而言,进入微软编排体系证明企业客户正在接受多模型架构。竞争重点将不只是某个模型在排行榜上高出两分,而是谁能在指定任务、指定延迟和指定预算下提供最稳定的结果。
企业买AI,最终会从模型跑分转向成本—成果前沿
微软提出的“成本—成果前沿”比单纯讨论模型排行榜更接近企业采购现实。
成本—成果前沿是指在满足指定任务质量的前提下,寻找最低成本、最低延迟和最少资源消耗的模型与系统组合。 企业不需要每封邮件都由最强模型总结,也不需要每个 Excel 公式都触发长时间深度推理。
对于拥有大量 Microsoft 365 席位的公司,即便单次操作只节省几分钱,乘以每天数百万次调用后也会成为可观数字。更重要的是,旧 GPU 可用意味着企业不必等待最新硬件供应,也可以在已有基础设施上部署或承载更多工作负载。
不过,企业在评估 MAI 时不应只看硬件型号。真正需要追问的问题包括:常见任务覆盖率是多少、错误请求如何升级、端到端成功率是多少、峰值并发下延迟如何、企业数据是否进入训练流程,以及复杂任务切换到外部模型后成本如何计算。
微软若要证明 MAI 的优势,下一步需要公开更完整的任务集和数字。最有价值的数据不是一句“接近 GPT-5.6”,而是诸如 Excel 公式修复成功率、工作簿操作完成率、P95 延迟、平均重试次数,以及每 1000 项成功任务的总计算成本。
判断:MAI的意义大于一次Excel跑分
MAI 最重要的意义,是微软终于补上了 Copilot 体系中能够自行控制的模型层。
从产品角度看,用专用小模型承接 Excel 高频任务是合理选择。Excel 工作流结构化、反馈可验证、调用规模巨大,正适合通过 RLE 和工具控制把模型训练成“熟练操作员”,而不是继续用昂贵的通用模型完成所有动作。
从技术角度看,微软仍欠外界一份完整成绩单。没有公开评测集、模型规模和成本数据,就无法判断“相当”究竟意味着平均分接近,还是只在选定任务上达到相似可用率。
从行业角度看,模型竞争正在进入下半场。上半场比的是谁能训练出最强模型,下半场比的是谁能把不同模型塞进真实软件,在用户几乎无感的情况下控制延迟、错误率和每次操作成本。
微软在 Excel 上展示的并不是一次彻底替代,而是一种更现实的企业 AI 路线:最强模型守住能力上限,自研模型消化高频需求,编排与控制系统决定最终体验。如果 MAI 后续能拿出可复现数据,这套路线可能比再赢一次通用跑分更有商业价值。
参考来源
- IT之家:纳德拉称微软自研MAI模型在Excel任务表现与GPT-5.6相当——整理了纳德拉关于MAI、Excel任务表现、RLE训练环境及H100/A100部署的相关表述。


