⚡ 前沿动态

面壁智能联合OpenBMB开源全球首个Stencil优化AI系统ForgeStencil

🕐 2026.08.06 星期四 来源 · 媒体 🔥 5 次点击

面壁智能联合OpenBMB开源社区正式发布并开源全球首个 Stencil(模板计算)优化"自动研究+自动部署"大闭环AI系统ForgeStencil,在通用CAE求解器hypre上加速3.86倍,核反应堆中子学计算最高加速5.78倍。

面壁智能开源全球首个Stencil优化AI系统ForgeStencil,是一套面向工业与科学计算底层Stencil核心算子的AI优化系统,仅需用户提供待优化应用源码,即可全自动完成热点定位、算子生成、性能调优与部署集成全流程,全程无需HPC专家介入优化决策。 实现"自动研究+自动部署"大闭环,实测数据显示在同精度(fp32)下几何平均加速2.35倍,混合精度下额外提速1.95倍。在真实应用场景中,通用CAE求解器hypre加速3.86倍,电磁仿真FDTD加速2.47倍,核反应堆中子学计算minisweep加速最高达5.78倍。该系统有望大幅降低科学计算与工程仿真的时间与成本。

一、发布背景

Stencil计算是大气动力学、地震波场、流体力学等领域工业软件的核心底层模块,直接决定软件整体运行效率。过去这类高难度优化极度依赖稀缺的HPC专家,单应用优化周期长、成本高,行业长期难以实现规模化落地。

二、核心升级

1.传统优化模式

一位资深HPC专家每年最多精调20个Stencil应用,单应用优化周期长达数周,优化经验难以沉淀复用。

2.全流程自动化升级

首次实现从优化思路生成到应用无缝部署的完整闭环,所有优化决策环节完全无需人工介入。

3.优化效率升级

仅用一周时间即可完成100+个真实工业与科学计算软件的自动优化,单应用优化耗时压缩至小时级,研发效率较人类专家提升约100倍。

4.性能指标升级

在同等硬件条件下,对比Halide、Devito等开源最优框架,fp32精度下获得几何平均2.35倍的加速比,混合精度fp16场景下额外实现1.95倍提速,在变系数Stencil全类型场景下,相对最优基线仍保持几何平均1.34倍的性能领先。

5.真实场景落地升级

实测通用CAE求解器hypre实现3.86倍加速,电磁仿真FDTD实现2.47倍加速,核反应堆中子学计算minisweep最高提速达5.78倍。

三、技术原理

系统由两个专用AI Agent协同完成全流程优化:Kernel Agent针对不同Stencil类型、计算维度与数据精度,自主构建专用算子矩阵,自动生成逼近硬件性能极限的底层代码;App Agent面向单个目标应用,独立完成热点定位、GPU性能基线搭建、优化方案集成回源应用,最终通过应用自带测试用例完成端到端正确性与性能评测。 该系统能在当下落地,一方面依托近年大模型在代码生成、逻辑验证任务上的能力突破,解决了传统优化工具无法自主探索多元优化路径的瓶颈;另一方面双Agent分工协作的架构,实现了算子级优化与应用级适配的解耦,让优化经验可以在共享知识库中实时同步、集体进化,突破了人类专家经验无法规模化复用的限制。

四、应用场景

1.工业CAE软件优化

面向流体力学、电磁仿真、结构力学类工业软件厂商,快速完成底层核心算子性能调优,大幅降低国产工业软件的性能追赶门槛。

2.科研超算场景

为大气模拟、地震预测、天体物理等领域的科研团队,快速优化超算应用核心模块,提升超算集群的资源利用效率。

3.算力基础设施适配

帮助不同架构的国产GPU、加速卡快速完成主流Stencil算子生态适配,缩短硬件的软件生态建设周期。

五、定价与开放策略

1.开源渠道

项目已在GitHub平台完全开源

2.技术支持

依托OpenBMB开源社区提供社区级维护与迭代

ForgeStencil把Stencil这类最耗专家资源、最难规模化的底层算力优化工作完全自动化,为工业软件与科学计算领域提供了全新的性能提升路径。标志AI优化从通用代码生成走向特定计算模式(Stencil)的垂直深耕;为国产自主可控科学计算软件生态提供关键性能优化工具。AI for Science基础设施工具链进一步丰富;国产科学计算软件在AI加速赋能下获得性能跃升;航空航天、核能、芯片设计等高端制造领域仿真效率提升。

← 返回 [前沿动态]