面壁智能開源 ForgeStencil:雙 Agent 一週自動優化 100+ 工業軟件,全程零人工介入
重點摘要
面壁智能聯合OpenBMB開源全球首個支援Stencil自動研究與部署的AI優化系統ForgeStencil,以雙Agent驅動實現零人工介入,一週內自動優化超過100個真實工業與科學計算軟件,研發效率提升約100倍。該系統在真實工業場景中展現顯著加速,例如核反應堆中子學模擬加速5.78倍、電磁仿真加速2.47倍,並已於GitHub開源。
高性能計算領域長期被一個細小卻關鍵的環節卡住瓶頸,那便是 Stencil 模板計算。無論是氣象預報的網格推演,還是地震波在地下岩層的傳導模擬,甚至電磁場的擴散與材料微觀結構的演化,背後都依賴這套以網格點鄰居加權組合、不斷刷新整體運算的基礎模式。然而這類運算對記憶體頻寬的要求極高,往往消耗掉整個應用程式大半的執行時間,其效率高低,直接決定了關鍵工業軟體與科學研究的推進速度。過去要將 Stencil 計算淬煉到接近硬體物理極限,幾乎只能依靠極其稀缺的高性能計算專家,憑藉大量人工實驗與深厚經驗,才能勉強達成。 為了解決這項困境,學界與業界曾嘗試透過編譯器、程式碼生成器與自動調校系統來分擔工作。這些工具雖然能自動生成程式碼、自動搜尋參數組合,但深層的優化演算法本身仍依賴人為設計與整合。一旦遇到不同的應用場景、資料形狀或硬體架構,就必須重新手動介入調整,無法真正形成規模化的生產力。技術瓶頸長期難以突破,使得 Stencil 優化始終停留在小眾專家手中。 就在這樣的背景下,面壁智能與 OpenBMB 開源社群聯手拋出了一枚震撼彈,正式開源全球首個支援 Stencil 自動研究與自動部署的 AI 優化系統 ForgeStencil。這套系統最引人注目的特點,是採用了雙 Agent 驅動架構,實現了全程零人工介入的自動化作業。使用者只需將待優化的應用程式原始碼投入系統,從自動分析、熱點定位、Kernel 鍛造,到算子替換、正確性驗證、最終整合回原應用程式,所有環節都不需要任何專家插手決策,完全由 AI 自主完成。 整個架構由兩大核心 Agent 分工協作。其中 Kernel Agent 扮演算子鍛造科學家的角色,專注於自主研究並合成高性能 Kernel。它針對主流 Stencil 類型、多種資料形狀與精度要求,構建專用的算子矩陣,將複雜的數學表達式轉化為逼近硬體極限的優雅程式碼。另一邊的 App Agent 則肩負工程落地的重任,為每個真實應用程式量身打造優化方案,細緻地定位效能熱點、建立 GPU 基線、驗證整合結果,最後以應用程式自帶的測試案例進行端到端評估,確保優化成果能實際落地。 這套系統的實際成效,遠不止於實驗室中的漂亮數據。面壁智能揭露的測試結果顯示,在與 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等知名框架的同臺競技中,ForgeStencil 於同精度 fp32 條件下取得了幾何平均 2.35 倍的加速;進一步採用混合精度 fp16 讀寫後,還能再額外獲得 1.95 倍的效能提升。即使是在公認最困難的變係數 Stencil 全形狀測試中,相較於最優基線,依然保有 1.34 倍的幾何平均加速,表現相當強勢。 更值得關注的是,這項技術並非停留在理想的 Benchmark 環境,而是真正紮進了真實工業場景。在主流科學軟體與權威基準測試中,約有 42% 的優化案例直接對應真實工業生產。具體成果包括 hypre 結構化多重網格求解器函式庫加速 3.86 倍、minisweep 核反應堆中子學輸運加速 5.78 倍、gprMax 與 FDTD 電磁模擬加速 2.47 倍、RTM 逆時偏移油氣地震成像加速 1.81 倍、道達爾 minimod 地震 mini-app 加速 1.22 倍、QuantLib 債券定價加速 1.82 倍、非笛卡爾 MRI 重建加速 2.45 倍、數字乳腺斷層成像反投影加速 1.63 倍。從石油公司、醫療設備到氣象部門的實際生產負載,它都能直接消化應對。 ForgeStencil 的另外一項突破,在於知識的累積與共享。人類專家的優化經驗往往鎖在個人腦海中,難以系統化傳承;而 ForgeStencil 能讓大量並行運作的 Agent 共用同一個知識庫,經驗即時互通有無,實現智慧型的集體同步進化。據了解,這套系統僅用一週時間就完成了超過 100 個真實工業與科學計算軟體的自動優化,將單一應用程式的優化時長壓縮到小時級,研發效率提升約 100 倍,且能隨著算力規模擴展而平行放大。 這是面壁智能繼今年 5 月推出 ForgeTrain 之後,基於 Forge Engineering 軟體工程範式交出的又一項重要成果。從自動生成程式碼進一步邁向自動研究優化,從局部算子的效能提升拓展到真實應用程式的整體部署。短期而言,存量工業軟體的優化可以小時級速度拿到接近硬體極限的實現,藉由算力節約與研發流程壓縮直接達成降本增效。長期來看,當 CAE 模擬、地震成像、電磁與流體運算這些支撐高端裝備、能源勘探、晶片設計的數位底座都能被自動化優化,國產製造業的整體升級也將因此踩下加速踏板。目前 ForgeStencil 已在 GitHub 上全面開源,面壁智能也向 HPC 學者、工業軟體從業者與開源開發者發出共建邀請,希望攜手推動高性能計算走向全新的自動化時代。
Related
相關文章
All in AI全面衝刺,夯實智能體時代AI基建底座,安謀科技三大業務線集體交卷
智東西(公眾號:zhidxcom) 作者 | 雲鵬 編輯 | 漠影 “龍蝦”和“愛馬仕”的火爆拉開了智能體(Agentic AI)時代的序幕,從年初發展至今,AI智能體幾乎已成為貫穿智能終端、應用、模型、算力、具身等領域的唯一主線。 如何築好智能體時代的“AI算力基建”就成為各路科技巨頭和創企關注的焦點。隨著算力範式告別追求單一芯片極致性能的階段,系統整體效率、能效、成本等因素成為企業更關鍵的考量。

GitHub AI Agent 翻車:攻擊者不用黑客技術,只寫一句話就能竊取數據
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。
開發者苦 “造輪子” 久矣,HarmonyOS 7 正在抹平系統能力的接入鴻溝
HarmonyOS 7 透過 Skill 與 Agent 等高階抽象元件,讓開發者能直接呼叫語音辨識、意圖識別等系統能力,大幅降低整合門檻。此舉旨在解決開發者長期重複「造輪子」的痛點,並藉由統一的模組化介面,加速應用開發週期,促進生態創新。

騰訊 WorkBuddy / CodeBuddy:Hy3 模型限時免費活動再次延長至 8 月 31 日
騰訊旗下的 CodeBuddy 和 WorkBuddy 今日宣佈,CodeBuddy 和 WorkBuddy 中 Hy3 模型調用限時免費活動延長至 2026 年 8 月 31 日。

一位資深 Builder的自述:我如何借多 Agent 開發工作流,一週做出 MVP、一個月上線
這篇消息聚焦「一位資深 Builder的自述:我如何借多 Agent 開發工作流,一週做出 MVP、一個月上線」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
