微软用半价安全AI挑战Mythos

微软发布网络安全智能体平台 Project Perception,并推出自研模型 MAI-Cyber-1-Flash,宣称以约一半成本超越 Anthropic Mythos,产品将于 8 月 3 日公开预览。
微软不只做安全 Copilot,这次开始自研网络安全模型
微软在当地时间 7 月 27 日发布 Project Perception,这是一套通过多模型、多智能体持续发现并修复软件漏洞的网络安全 AI 平台。产品计划于 2026 年 8 月 3 日进入公开预览,核心卖点不是再给安全团队加一个聊天窗口,而是让 AI 智能体真正进入漏洞扫描、验证、修复和回归测试流程。
Project Perception 的直接竞争目标是 Anthropic 的 Mythos。微软给出的说法相当激进:由自研网络安全模型 MAI-Cyber-1-Flash 配合 OpenAI 通用前沿模型后,可以在 CyberGym 基准测试中超过 Anthropic Mythos 5、Google 3.5 Flash Cyber 和 OpenAI GPT-5.5 Cyber,同时把完成同类安全任务的成本压低约 50%。

这不是微软第一次把生成式 AI 塞进安全产品,却是它第一次如此明确地用自研模型正面对标 Anthropic。此前的 Microsoft Security Copilot 更像一个建立在安全数据和大模型之上的分析助手,Project Perception 则试图把模型、扫描工具、企业安全上下文和执行权限组合成一套持续运转的“AI 安全工程队”。
微软选择此时出手也并不意外。AI 编程工具让代码产量快速上升,但代码审计、依赖治理和补丁验证并没有同比扩容;与此同时,攻击者也在利用模型批量生成钓鱼内容、变种脚本和漏洞利用思路。安全行业真正缺少的不是又一个会解释 CVE 的聊天机器人,而是能够在复杂企业环境里低成本、长时间运行,并且愿意为误报和修复结果负责的系统。
Project Perception 是什么
**Project Perception 是微软面向企业漏洞发现与修复场景推出的多模型 AI 智能体平台。**它会把复杂推理交给能力更强但成本更高的前沿模型,把代码筛查、模式匹配和高频验证交给速度更快的网络安全专用模型,再由智能体调用扫描器、代码仓库和测试工具完成具体动作。
这套设计的重点是“分工”,而不是让一个大模型包办全部任务。传统做法往往把整段代码、扫描日志和依赖信息直接送进最强模型,准确率可能不错,但 token 消耗、响应延迟和并发成本很快会失控;Project Perception 更像一家分层运作的安全团队,专用模型负责初筛,前沿模型处理疑难案例,工具负责执行和验证。
微软董事长兼 CEO Satya Nadella 将这种方法概括为把扫描套件、安全信号、上下文与单一模型系列解耦。这个判断基本成立,因为网络安全任务天然不是纯语言问题:模型既要理解代码语义,也要查看身份权限、终端状态、云配置、数据流向和历史告警,还要通过编译、测试或沙箱执行确认漏洞是否真的存在。
Project Perception 还强调从“生成警报”转向“采取行动”。传统扫描工具交付的通常是一份待办清单,安全团队仍要手动判断影响范围、寻找代码所有者、制作补丁并安排上线;微软希望智能体能够串起这些步骤,在权限允许的范围内提出修复、创建变更、触发测试,并检查漏洞是否被真正关闭。
这种能力如果能稳定工作,价值会明显高于普通安全问答助手。企业最昂贵的部分通常不是发现一条疑似漏洞,而是把它从告警推进到修复完成;大量漏洞最终停留在工单系统里,原因正是缺少上下文、责任人和验证资源。
MAI-Cyber-1-Flash 是微软的第一块自研拼图
**MAI-Cyber-1-Flash 是微软首个专门面向网络安全任务打造的生成式 AI 模型。**它的目标并非替代通用前沿模型,而是在复杂代码库中快速识别高难度漏洞,为 Project Perception 提供高吞吐、低延迟的分析能力。
“Flash”这一命名已经说明微软的产品取向:安全平台需要扫描的不是几十个聊天问题,而可能是数百万行代码、数千个依赖项以及持续变化的云配置。如果所有内容都交给最大模型逐条推理,即使准确率足够高,也很难形成企业能够长期承担的成本结构。
微软表示,MAI-Cyber-1-Flash 的训练与优化利用了公司长期防御企业环境积累的数据和经验。微软覆盖 Windows、Microsoft 365、Azure、Entra 身份系统、Defender 终端安全和 GitHub 开发流程,这种跨身份、终端、应用、数据与云平台的可见性,确实是纯模型公司短期内难以复制的优势。
数据优势并不自动等于模型优势,但它会决定专用模型能否理解真实组织里的安全噪声。公开代码库中的漏洞样本通常干净、边界明确,企业内部事件却经常混杂着历史配置、权限例外、遗留依赖和重复告警;真正有用的安全模型必须知道哪些信号应该升级,哪些只是扫描器长期制造的噪声。
微软还称 MAI-Cyber-1-Flash 在开发过程中优先考虑安全性,并接受了未具名第三方的独立评估。第三方身份、评估范围和完整报告目前尚未公开,因此这项安全背书暂时只能视为厂商声明,而不是已经完成外部复核的结论。
不是单模型决胜,而是“智能体分队”
**多模型架构是 Project Perception 与传统漏洞检测模型最关键的区别。**它不会固定依赖某一个模型,而是根据任务难度、延迟要求和执行成本动态分配工作。
一个典型工作流可能分成以下几层:
- **专用模型初筛:**快速检查代码差异、依赖更新、权限配置和扫描结果,过滤明显误报。
- **前沿模型推理:**分析跨文件调用链、业务逻辑漏洞、身份边界和复杂利用条件。
- **工具验证:**调用静态分析、动态测试、编译器或沙箱,确认漏洞能否被触发。
- **修复智能体行动:**生成补丁建议、创建变更请求,并关联代码所有者与安全团队。
- **回归智能体验证:**重新扫描和测试,避免补丁引入新的兼容性或安全问题。
这种“模型负责判断、工具负责举证”的路线比纯大模型扫描更可靠。大模型很擅长提出可能性,却可能虚构不存在的数据流或忽略构建条件;扫描器和测试环境虽然不够聪明,却能够给出可重复的执行结果。两者组合后,模型的任务从直接宣布“这里有漏洞”,变成提出假设并调用工具验证。
Project Perception 还计划与微软的漏洞识别和修复工具套件 MDASH 集成。MDASH 是微软面向软件漏洞发现、验证和修复流程构建的安全工具集合,在整套系统中承担扫描与行动层角色,而 MAI-Cyber-1-Flash 和前沿模型负责理解上下文及安排任务。
微软最终要卖的并不是单个模型,而是“从发现到关闭”的结果。对于大型企业来说,模型每百万 token 的价格固然重要,但误报调查耗费的工程师时间、补丁等待周期以及漏洞暴露窗口通常更贵,因此微软反复强调的是“成本到成果”,而不只是模型调用单价。
对标 Mythos,微软声称成本只有一半
**Mythos 是 Anthropic 面向自动化漏洞研究和软件安全分析推出的网络安全 AI 系统。**它因较强的攻击路径推理和漏洞挖掘能力获得关注,也成为微软此次发布时反复比较的对象。
微软表示,MAI-Cyber-1-Flash 与 GPT-5.4 协作时,在 CyberGym 上超过了 Mythos 5、Google 3.5 Flash Cyber 和 GPT-5.5 Cyber。CyberGym 是用于评估模型发现、理解和处理网络安全漏洞能力的基准测试环境,其价值在于让模型面对具体安全任务,而不是只回答安全知识选择题。
| 产品或模型 | 厂商 | 主要定位 | 架构特点 | 成本信息 | 当前状态 | |---|---|---|---|---|---| | Project Perception | 微软 | 企业漏洞持续发现与修复 | MAI-Cyber-1-Flash、前沿模型与多智能体协作 | 微软称同类成果成本约降低 50%,未公布标准价目表 | 8 月 3 日公开预览 | | MAI-Cyber-1-Flash | 微软 | 高频、低延迟代码安全分析 | 网络安全专用模型,不单独承担全部复杂推理 | 未公布独立定价 | 将用于 Perception | | Mythos 5 | Anthropic | 漏洞研究与自动化安全分析 | 强调前沿模型的攻击与推理能力 | 微软称其成本更高,缺少可直接核验的统一公开报价 | 竞争产品 | | 3.5 Flash Cyber | Google | 网络安全分析 | 偏重速度与安全任务适配 | 未披露可比价格 | 竞争模型 | | GPT-5.5 Cyber | OpenAI | 通用前沿模型的安全任务能力 | 通用模型结合安全工具 | 未披露可比价格 | 竞争模型 |
这组对比目前必须加上一个重要限定:成绩和成本均主要来自微软自己的发布口径。微软提到约 96% 的基准得分以及约 50% 的成本优势,但尚未完整披露测试集构成、每个产品的工具权限、推理预算、重复运行次数和人工介入比例。
安全基准尤其容易受到测试设置影响。一个模型如果可以调用更多扫描器、获得更完整的代码上下文,或者允许消耗更多推理时间,就可能显著提高成功率;反过来,真实企业环境中的私有依赖、无法编译的遗留项目和混乱权限,也会让实验室里的高分迅速缩水。
因此,8 月 3 日公开预览比发布会跑分更重要。企业用户需要验证的不是模型能否在标准漏洞题目上得到 96%,而是它能否在真实代码仓库中控制误报、找到可利用问题,并以足够低的失败率完成补丁建议和回归测试。
微软真正的优势是上下文和执行入口
**Project Perception 最难被复制的部分不是 MAI-Cyber-1-Flash,而是微软控制的大量企业上下文与执行入口。**模型能力会随着行业进步快速趋同,但身份、终端、邮件、代码仓库、云资源和安全告警之间的连接,需要长期产品部署才能建立。
Anthropic 的强项是模型推理和智能体能力,OpenAI 的强项是通用模型与开发者生态,Google 则同时拥有云、安全情报和代码模型。微软的特殊位置在于,它可以让安全智能体同时看见 Entra 里的身份关系、Defender 的终端信号、Azure 的云配置以及 GitHub 中的代码变更,并在统一权限体系下推动修复。
这种整合也带来了更大的风险。一个只会给建议的模型答错了,工程师可以忽略;一个拥有创建补丁、修改配置或隔离资产权限的智能体答错了,可能直接造成服务中断。Project Perception 是否有用,最终取决于权限分级、审批机制、操作回滚和审计日志,而不是演示中发现了多少漏洞。
企业在预览阶段不应该一开始就开放自动修复权限。更稳妥的部署顺序是先让系统只读运行,统计召回率和误报率;随后允许它创建工单和补丁草案;最后才在低风险仓库中尝试自动合并,并为生产环境保留人工审批。
“持续运行”可能比月度补丁更重要
**Project Perception 试图把漏洞管理从周期性扫描改造成持续运行的智能体流程。**微软将其描述为对传统月度补丁周期的补充甚至替代,因为代码、依赖和攻击手法每天都在变化,按月集中扫描意味着新漏洞可能暴露数周。
持续智能体的理想状态是每次代码提交后都完成增量分析,只检查发生变化的调用链和权限边界。发现问题后,系统可以立即关联责任人、生成修复建议并运行测试,把漏洞暴露窗口从数周压缩到数小时。
持续运行也会放大成本和告警疲劳。即使单次分析便宜一半,如果扫描频率从每月一次提高到每次提交一次,总支出仍可能上升;如果模型每天制造数百条低质量工单,安全团队反而会更慢。因此,微软所谓的“半价”只有在单位有效修复成本下降时才有意义。
这也是 Project Perception 选择专用小模型配合前沿模型的原因。高频任务必须足够便宜,复杂任务才值得升级给更昂贵的模型;如果任务路由失效,把大量普通告警送入前沿模型,整套系统的成本优势会迅速消失。
现在值得期待,但还不能宣布 Mythos 输了
**Project Perception 是微软安全业务从“集成别人的模型”走向“自研专用模型”的明确信号。**MAI-Cyber-1-Flash 未必代表微软已经拥有全面领先的前沿模型,但它说明微软开始把企业数据、专用训练和产品执行能力组合起来,而不是仅给现有安全产品增加一个 Copilot 入口。
微软的方向是对的,因为网络安全最适合多模型和智能体协作。漏洞发现需要推理,漏洞确认需要工具,漏洞修复需要组织上下文,补丁上线则需要权限和审计;任何只强调单模型跑分的方案,都很难覆盖完整流程。
微软的结论仍然需要真实客户验证,因为目前公开信息缺少完整定价、独立基准报告和生产环境指标。尤其值得关注的指标包括每千次扫描发现的有效高危漏洞数、误报率、平均修复时间、自动生成补丁的测试通过率,以及每个已关闭漏洞的综合成本。
Project Perception 现阶段更像一张有竞争力的入场券,而不是已经结束比赛的“王炸”。如果 8 月 3 日开放预览后,微软能够在复杂私有代码库中维持接近公布的 96% 基准表现,并把单位有效修复成本稳定压到 Mythos 的一半,它会成为企业 AI 安全市场里极具杀伤力的产品;如果做不到,这次发布就仍然只是一次漂亮的模型与平台叙事。
参考来源
受可引用域名范围限制,以下链接用于补充漏洞库、微软安全开发工具和 AI 威胁建模背景;Project Perception 的发布日期、公开预览时间与性能声明依据微软 2026 年 7 月 27 日发布活动及管理层公开说明。
- GitHub Advisory Database:GitHub 维护的公开安全公告与漏洞数据库,可用于理解漏洞扫描和依赖治理的数据基础。
- Microsoft Security DevOps Action:微软在 GitHub 上公开的安全扫描工作流项目,可作为其安全工具接入软件开发流程的背景资料。
- Microsoft Threat Matrix for AI:微软维护的 AI 系统威胁矩阵项目,用于了解身份、模型、数据与基础设施面临的攻击路径。



