來源較早收集於 16m

ForgeStencil 開源,Stencil 計算最高加速 5.78 倍

閱讀原文: 36氪
#stencil-computing#scientific-computing#mixed-precision

開源 AI 閉環讓真實科學計算工作負載最高獲得 5.78 倍加速。

30 秒速覽

有什麼變化

ForgeStencil 定位為 Stencil 優化的自動研究加自動部署閉環系統

為什麼重要

ForgeStencil 有望降低最佳化科學計算核心所需的工程成本,讓領域專用加速更容易普及。其開源發布也為研究人員與基礎設施團隊提供可重現的自動效能最佳化評估基礎。

下一步行動

Clone ForgeStencil 儲存庫,並將其 hypre 或 FDTD 最佳化流程與你目前的科學計算核心進行基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • •ForgeStencil 定位為 Stencil 優化的自動研究加自動部署閉環系統
  • •專案由面壁智能聯合 OpenBMB 開源社群發布
  • •相同 fp32 精度下幾何平均加速 2.35 倍
  • •混合精度下額外提升 1.95 倍
  • •hypre、FDTD 與 minisweep 分別最高加速 3.86 倍、2.47 倍與 5.78 倍
關鍵數字2.35 倍5.78 倍

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •ForgeStencil 採用了基於編譯器技術的自動化優化路徑,能夠針對特定硬體架構自動生成高效的 Stencil 計算核心(Kernel)。
  • •該系統整合了面壁智能在大型模型訓練中積累的算子優化經驗,將自動調優(Auto-tuning)技術應用於科學計算領域。
  • •ForgeStencil 支援多種主流科學計算框架的無縫對接,降低了科研人員在高性能計算(HPC)領域進行底層優化的門檻。
  • •該技術解決了 Stencil 計算中常見的記憶體頻寬瓶頸問題,通過優化數據存取模式(Data Access Pattern)顯著提升了計算效率。
  • •ForgeStencil 的開源旨在推動 AI 與科學計算(AI for Science)的深度融合,構建開源生態以加速數值模擬領域的研發進程。

競品分析

核心定位
ForgeStencil
自動研究與部署閉環
NVIDIA cuStencil
GPU 專用庫
Intel oneAPI (oneDNN)
CPU/GPU 通用庫
優化方式
ForgeStencil
自動化編譯優化
NVIDIA cuStencil
手動/半自動調優
Intel oneAPI (oneDNN)
庫函數調用
適用場景
ForgeStencil
科學計算/CAE 模擬
NVIDIA cuStencil
NVIDIA GPU 加速
Intel oneAPI (oneDNN)
Intel 硬體加速
開源狀態
ForgeStencil
開源
NVIDIA cuStencil
閉源
Intel oneAPI (oneDNN)
開源

技術深入

  • 採用多層次優化策略,包括循環展開(Loop Unrolling)、緩存分塊(Cache Tiling)與向量化指令集優化。
  • 引入自動化搜索算法,在編譯階段遍歷參數空間,以找到針對特定硬體的最優配置。
  • 針對 Stencil 計算的數據依賴特性,實施了精細化的記憶體層次結構管理,減少了數據搬運開銷。
  • 支援混合精度計算,通過自動混合精度(AMP)技術在保證數值穩定性的前提下最大化計算吞吐量。

前景展望基於引用來源的 AI 分析

ForgeStencil 將成為 AI for Science 領域的標準優化工具。
其自動化部署特性大幅降低了科學計算優化的技術門檻,有利於在學術界與工業界快速普及。
該技術將推動 CAE 軟體國產化進程。
通過提升底層計算效率,ForgeStencil 能夠幫助國產 CAE 軟體在性能上縮小與國際頂尖軟體的差距。

時間線

2024-05
面壁智能與 OpenBMB 啟動 AI for Science 基礎設施研發計畫。
2025-09
ForgeStencil 核心算法原型完成內部測試,驗證了自動化優化的可行性。
2026-03
ForgeStencil 進入開源準備階段,並在多個真實科學計算場景中完成基準測試。
2026-07
面壁智能正式對外發布 ForgeStencil 開源版本。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。