面壁智能联合OpenBMB开源全球首个Stencil优化AI系统ForgeStencil
面壁智能联合OpenBMB开源社区正式发布并开源全球首个 Stencil(模板计算)优化"自动研究+自动部署"大闭环AI系统ForgeStencil,在通用CAE求解器hypre上加速3.86倍,核反应堆中子学计算最高加速5.78倍。
面壁智能开源全球首个Stencil优化AI系统ForgeStencil,是一套面向工业与科学计算底层Stencil核心算子的AI优化系统,仅需用户提供待优化应用源码,即可全自动完成热点定位、算子生成、性能调优与部署集成全流程,全程无需HPC专家介入优化决策。 实现"自动研究+自动部署"大闭环,实测数据显示在同精度(fp32)下几何平均加速2.35倍,混合精度下额外提速1.95倍。在真实应用场景中,通用CAE求解器hypre加速3.86倍,电磁仿真FDTD加速2.47倍,核反应堆中子学计算minisweep加速最高达5.78倍。该系统有望大幅降低科学计算与工程仿真的时间与成本。
一、发布背景
Stencil计算是大气动力学、地震波场、流体力学等领域工业软件的核心底层模块,直接决定软件整体运行效率。过去这类高难度优化极度依赖稀缺的HPC专家,单应用优化周期长、成本高,行业长期难以实现规模化落地。
二、核心升级
1.传统优化模式
一位资深HPC专家每年最多精调20个Stencil应用,单应用优化周期长达数周,优化经验难以沉淀复用。
2.全流程自动化升级
首次实现从优化思路生成到应用无缝部署的完整闭环,所有优化决策环节完全无需人工介入。
3.优化效率升级
仅用一周时间即可完成100+个真实工业与科学计算软件的自动优化,单应用优化耗时压缩至小时级,研发效率较人类专家提升约100倍。
4.性能指标升级
在同等硬件条件下,对比Halide、Devito等开源最优框架,fp32精度下获得几何平均2.35倍的加速比,混合精度fp16场景下额外实现1.95倍提速,在变系数Stencil全类型场景下,相对最优基线仍保持几何平均1.34倍的性能领先。
5.真实场景落地升级
实测通用CAE求解器hypre实现3.86倍加速,电磁仿真FDTD实现2.47倍加速,核反应堆中子学计算minisweep最高提速达5.78倍。
三、技术原理
系统由两个专用AI Agent协同完成全流程优化:Kernel Agent针对不同Stencil类型、计算维度与数据精度,自主构建专用算子矩阵,自动生成逼近硬件性能极限的底层代码;App Agent面向单个目标应用,独立完成热点定位、GPU性能基线搭建、优化方案集成回源应用,最终通过应用自带测试用例完成端到端正确性与性能评测。 该系统能在当下落地,一方面依托近年大模型在代码生成、逻辑验证任务上的能力突破,解决了传统优化工具无法自主探索多元优化路径的瓶颈;另一方面双Agent分工协作的架构,实现了算子级优化与应用级适配的解耦,让优化经验可以在共享知识库中实时同步、集体进化,突破了人类专家经验无法规模化复用的限制。
四、应用场景
1.工业CAE软件优化
面向流体力学、电磁仿真、结构力学类工业软件厂商,快速完成底层核心算子性能调优,大幅降低国产工业软件的性能追赶门槛。
2.科研超算场景
为大气模拟、地震预测、天体物理等领域的科研团队,快速优化超算应用核心模块,提升超算集群的资源利用效率。
3.算力基础设施适配
帮助不同架构的国产GPU、加速卡快速完成主流Stencil算子生态适配,缩短硬件的软件生态建设周期。
五、定价与开放策略
1.开源渠道
项目已在GitHub平台完全开源
2.技术支持
依托OpenBMB开源社区提供社区级维护与迭代