AI 快讯ForgeStencil让AI接管仿真优化
模型上新

ForgeStencil让AI接管仿真优化

2026-08-04T09:04:19.562Z
ForgeStencil让AI接管仿真优化

面壁智能与OpenBMB开源ForgeStencil,一周自动重构100余款科学与工业软件,同精度几何平均加速2.35倍,真实应用最高提速5.78倍。

AI 开始接管科学计算的性能优化

**面壁智能今天(2026 年 8 月 4 日)联合 OpenBMB 社区发布并开源 ForgeStencil,试图让 AI 独立完成科学计算软件从性能研究、Kernel 优化到回填部署的完整链路。**据发布方披露,这套系统在一周内自动重构了 100 余款真实工业与科学计算软件,全程没有人类专家参与优化决策;在 FP32 同精度条件下,测试取得 2.35 倍几何平均加速,采用混合精度后还可额外提速 1.95 倍,单项真实应用最高达到 5.78 倍。

**ForgeStencil 是一套面向 Stencil 计算的 AI 自动优化与部署系统。**这里的 Stencil,中文通常译作模板计算或模板算子,指的是在规则网格上反复读取某个点及其邻域数据,再计算下一时刻或下一轮结果的计算模式。天气模拟中的温度扩散、电磁波传播、流体力学、地震成像和中子输运,都大量依赖这类操作。

**Stencil 看起来只是“取邻居、做计算”,实际却是高性能计算中最难榨干硬件性能的一类负载。**它往往不是算术运算不够快,而是受制于显存带宽、缓存命中率、线程调度、边界处理和数据布局。Kernel 写得稍有差异,GPU 可能是在高效并行,也可能只是让大量计算单元等数据。

ForgeStencil由Kernel Agent与App Agent组成,从源码分析、热点定位、候选Kernel生成到验证部署的闭环流程图

核心变化不是“会写 Kernel”,而是能把 Kernel 装回去

**ForgeStencil 最值得关注的地方,是它把自动研究和自动部署接成了闭环。**过去的自动调优工具通常专注于一个边界明确的算子:人类先提取问题、准备输入输出、定义搜索空间,工具再寻找更快的参数组合。即使得到了高性能 Kernel,工程师仍要处理接口替换、数据格式、精度误差、构建系统和回归测试。

**自动研究是让 AI 根据编译与运行反馈持续提出并验证性能优化方案。**ForgeStencil 会自动生成大量候选 Kernel,尝试不同的数据读取方式、线程块划分、内存访问策略和计算结构,再通过编译、执行、性能测量与正确性验证筛选更优实现。这种过程更接近一名能够连续做实验的 HPC 工程师,而不是一次生成代码的普通编程助手。

**自动部署是把优化后的底层算子重新集成到原始应用,并保证软件仍能正确运行。**这一步决定了跑分能否变成真实收益,因为独立微基准快,不代表完整应用就会快。数据搬运、格式转换、函数调用和其他未优化模块,都可能吃掉 Kernel 节省下来的时间。

**ForgeStencil 由 Kernel Agent 与 App Agent 两部分协作完成闭环。**Kernel Agent 负责底层算子的生成、编译、测试和性能搜索,目标是逼近特定硬件上的性能上限;App Agent 则面向完整应用,负责分析源码、定位热点函数、提取计算模式、替换算子、验证结果,并把新实现集成回原工程。

**这套双 Agent 结构解决的是“局部优化”与“完整软件”之间长期存在的断层。**可以把 Kernel Agent 理解为不断试验发动机参数的工程师,而 App Agent 更像整车集成团队:前者能把发动机调快,后者要保证发动机真正装得进车里,而且刹车、变速箱和仪表盘都不能失灵。

最高 5.78 倍,但不能只盯着最高数字

**ForgeStencil 当前披露的整体成绩,是 FP32 同精度下几何平均加速 2.35 倍。**几何平均值比挑选单个最佳案例更有参考意义,因为它能降低极端高分对整体结果的影响。对于覆盖 100 余款软件的系统而言,2.35 倍意味着测试集合中的收益并非只来自一两个特殊样本。

**混合精度带来的额外 1.95 倍提速,不应在缺少完整测试说明时简单与 2.35 倍相乘。**混合精度是用较低精度格式承担部分计算或存储,同时保留必要的高精度步骤,以换取更高吞吐量和更低内存压力。不同应用的数值稳定性、误差容忍度和硬件支持并不相同,因此这项数字更适合视为另一层优化空间,而不是所有程序都能获得的固定增益。

**真实工业软件的结果比独立 Kernel 跑分更有说服力。**发布方给出的主要数据如下:

| 应用或计算任务 | 典型领域 | ForgeStencil 披露加速比 | 结果意味着什么 | |---|---|---:|---| | minisweep | 核反应堆中子学计算 | 最高 5.78 倍 | 对规则网格上的中子输运扫描具有显著收益 | | hypre | 通用 CAE、并行线性求解 | 3.86 倍 | 优化进入成熟求解器场景,而非只停留在演示算子 | | FDTD | 电磁仿真 | 2.47 倍 | 电磁波时域迭代耗时可显著缩短 | | 非笛卡尔 MRI 重建 | 医学成像 | 2.45 倍 | 有望加快复杂采样轨迹的图像重建 | | RTM | 油气地震成像 | 1.81 倍 | 缩短反向时间偏移的大规模波场计算 | | DBT 反投影 | 数字乳腺断层成像 | 1.63 倍 | 提升断层图像重建效率 |

**minisweep 的 5.78 倍是最高单项结果,而不是 ForgeStencil 在所有软件上的平均表现。**这一区分很重要:工业客户做容量规划时,更应关注自身工作负载在相同硬件、相同输入规模和相同精度约束下的端到端耗时,而不是直接套用峰值数字。

**CAE 是利用计算机对工程设计进行数值分析和验证的软件体系。**hypre 属于高性能并行求解器基础设施,经常被其他仿真软件调用;它获得 3.86 倍加速,说明 ForgeStencil 瞄准的是工程软件中可复用的计算底座,而非只优化一个封闭的实验程序。

**FDTD 是通过在时间和空间网格上离散麦克斯韦方程来模拟电磁波传播的方法。**它的每一步都需要读取邻近网格点,因此是典型 Stencil 负载。2.47 倍端到端加速如果能在更多网格规模和边界条件下复现,会直接影响雷达、天线、通信和芯片电磁兼容仿真的迭代周期。

它与传统自动调优、编程 Agent 有什么不同

**ForgeStencil 与传统编译器、自动调优器和通用编程 Agent 的差别,主要在系统边界而不是“是否使用 AI”。**传统工具可以在明确搜索空间内做参数探索,编程 Agent 可以阅读和修改仓库代码,但很少有系统同时承担热点发现、Kernel 锻造、真实性能测量、数值验证和应用回填。

| 方案 | 优化对象 | 是否依赖人工提取算子 | 是否依据真实性能反馈迭代 | 是否自动集成回应用 | 主要局限 | |---|---|---:|---:|---:|---| | HPC 专家手工优化 | Kernel 与完整应用 | 否 | 是 | 是 | 效果强,但专家稀缺、周期长,迁移成本高 | | 编译器自动优化 | 中间表示或局部循环 | 通常较少 | 部分支持 | 通常支持 | 搜索空间和跨模块理解能力有限 | | 传统自动调优器 | 预先定义的算子 | 通常是 | 是 | 通常否 | 需要人类准备搜索空间与集成流程 | | 通用编程 Agent | 仓库级代码 | 否 | 不一定 | 可以修改代码 | 未必具备稳定的性能实验与数值验证闭环 | | ForgeStencil | Stencil Kernel 与真实应用 | 官方称无需人工介入 | 是 | 是 | 当前集中于 Stencil,跨硬件与泛化能力仍待社区验证 |

**ForgeStencil 的优势是把性能优化变成可批量执行的流程。**传统模式下,一名专家可能需要数天甚至数周理解一个新应用,随后才能定位热点、设计 Kernel 并做回归测试;ForgeStencil 披露的结果则是一周处理 100 余款软件,平均吞吐量超过每天 14 个项目。当然,项目复杂度并不相同,这个平均数不能等同于每个项目都完成了相同深度的工程改造。

**ForgeStencil 的边界也很明确:它现在首先是 Stencil 专项系统,不是任意软件的通用性能优化器。**数据库查询、图计算、稀疏注意力、动态控制流和分布式通信都有不同的性能瓶颈,不能因为它在规则网格上有效,就推断其能自动优化所有计算密集型软件。

开源之后,最该验证的是可复现性

**开源让 ForgeStencil 从一组发布数据变成了可以被检查的方法与工程系统。**开发者接下来应重点检查候选 Kernel 的生成方式、性能搜索预算、正确性阈值、失败回滚机制、支持的编译链以及应用改写范围,而不只是运行官方准备好的最佳样例。OpenBMB 的公开项目可从其 GitHub 组织主页 继续跟踪。

**硬件与基线信息将决定这些加速数字能否横向比较。**截至 8 月 4 日现有披露中,最需要补齐的是 GPU 或加速卡型号、编译器版本、原始基线实现、输入规模、预热与计时方法、搜索所消耗的总算力,以及不同精度下采用的误差标准。没有这些信息,2.35 倍可以说明系统有潜力,却还不足以与其他自动调优框架做严格排名。

**数值正确性比“程序能运行”更难验证。**科学计算往往允许一定浮点误差,但误差会在数千次时间步中累积;混合精度还可能改变收敛速度,甚至让某些边界条件下的求解失败。真正面向生产部署的系统需要区分逐点误差、统计误差、守恒量误差和最终物理结论,而不是只做一次输出数组比对。

**搜索成本也必须计入 ForgeStencil 的经济账。**如果系统为得到一个快 2 倍的 Kernel 花费数千次编译和运行,那么它更适合会被长期重复执行的仿真任务;如果程序只运行一次,自动搜索本身可能比节省的时间更贵。理想状态是候选实现能够跨网格尺寸、同代硬件或相近应用复用,从而摊薄研究成本。

**端到端加速还受到阿姆达尔定律约束。**阿姆达尔定律是指系统总体加速上限由无法被优化的那部分程序决定。例如某个 Stencil Kernel 原先只占总耗时的 50%,即使把它优化到无限快,完整应用也最多提速 2 倍。因此 hypre 的 3.86 倍和 minisweep 的 5.78 倍,侧面说明被替换的热点在对应测试中占据了相当高的耗时比例,或者系统同时改进了多个关键路径。

从 ForgeTrain 到 ForgeStencil,面壁在押注“AI 造基础设施”

**ForgeStencil 延续了面壁智能今年 5 月提出的 Forge Engineering 路线。**Forge Engineering 是让 AI 承担软件基础设施研究、实现、测试和迭代工作的工程范式,其目标不是让 AI 给人类程序员补几行代码,而是让 AI 对最终可运行系统负责。

**面壁智能此前发布的 ForgeTrain 已把这一思路用于大模型训练框架。**按照发布方数据,ForgeTrain 的生产级代码由 AI 完成,在 H100 环境中的训练速度比英伟达 Megatron 快 10%;ForgeStencil 则把场景从大模型训练基础设施扩展到电磁、核工程、能源和医学成像等科学计算软件。

**两次发布共同强调的不是模型参数规模,而是 AI 能否形成“提出方案—实验—测量—修正—部署”的行动闭环。**代码生成模型早已能写 CUDA 或修改工程文件,但性能工程不能靠代码看起来合理来判断,它必须让程序真正编译、跑出正确结果,并在稳定测量下超过基线。ForgeStencil 的价值,就在于把运行环境的反馈纳入了 Agent 的决策过程。

**这条路线一旦成立,稀缺资源会从 HPC 专家时间转向机器搜索算力与验证基础设施。**企业不再需要为每一款软件手工组织一支底层优化团队,而可以由少量专家定义安全边界、评价标准和验收流程,再让 AI 批量尝试优化。不过,这并不意味着专家消失,而是专家从逐行写 Kernel 转向设计验证体系和处理高风险边界案例。

判断:这是有产业价值的 AI Agent,但还没到“替代 HPC 专家”

**ForgeStencil 比多数编程 Agent 更接近真正的生产力工具,因为它用真实运行时间而不是主观代码评分作为核心反馈。**在工业仿真领域,2 倍加速通常就足以改变成本结构:同样的计算集群可以完成更多设计迭代,或者在相同周期内使用更细的网格与更复杂的模型。最高 5.78 倍则意味着原本接近 6 小时的同类任务,理论上可缩短至约 1 小时,但实际收益仍须按具体基线核算。

**ForgeStencil 目前最有吸引力的用户,是维护长期运行、结构稳定且算力账单高昂的仿真软件团队。**这类团队拥有清晰的正确性测试和大量重复任务,能够承受一次性的自动搜索成本,也最容易把 Kernel 加速转化为集群成本下降。对于缺少测试集、代码高度动态或每次输入结构差异巨大的项目,它的落地难度会高得多。

**“全球首个”应被视为发布方对系统完整性的定义,而不是已经完成第三方认证的行业结论。**自动生成 Kernel、自动调优和仓库级代码修改此前都有独立工具探索,ForgeStencil 的新意主要是把这些环节组合成面向 Stencil 真实应用的无人闭环。它是否真正超越现有方案,最终要看开源社区能否在非官方项目、不同硬件和严格基线下复现结果。

**现阶段更稳妥的结论是:ForgeStencil 展示了 AI 从“写代码助手”升级为“性能实验执行者”的可行路径。**如果 2.35 倍几何平均加速、100 余款软件无人干预改造以及多项真实应用数据经第三方复现,这会是科学计算自动化的重要进展;如果开源版本只能在限定环境和预设模板中运行,它仍是一套有价值的专项自动调优系统,但距离通用的 AI 工程师还有明显距离。

参考来源

  • OpenBMB GitHub 组织主页:OpenBMB 社区公开项目、源码仓库和后续版本更新入口。
  • GitHub 上搜索 ForgeStencil:用于查找 ForgeStencil 相关公开仓库、复现项目与社区实现;具体代码、许可证和硬件支持范围以正式仓库说明为准。

注:本文性能数字均来自面壁智能与 OpenBMB 于 2026 年 8 月 4 日披露的发布信息。由于完整硬件配置、基线版本和测量协议尚需结合开源仓库核验,相关结果暂不等同于独立第三方评测。

相关推荐

查看全部