何夕2077其他AI

Frontis邁向自我改進

2026年8月2日 00:00

重點摘要

Frontis AI 發表 Frontis-MA1(35B)模型與 OpenMLE 開源系統,旨在實現機器學習工程中的遞迴自我改進。在 MLE-Bench Lite 測試中,Frontis-MA1 搭配 OpenMLE-Evo 將獎牌平均從 39.39% 提升至 60.61%,表現超越 GPT-5.5 並接近 GPT-5.6 Sol。該研究已釋出模型權重與完整程式碼,以促進可重現的 AI4AI 研究。

站內 AI 整理稿

人工智慧領域近期迎來一項突破性進展——Frontis AI 團隊發表了一篇關於「遞迴自我改進」(Recursive Self-Improvement, RSI)的研究論文,展示了如何讓 AI 系統不僅能完成特定任務,更能自主優化自身建構 AI 的流程。這項研究以機器學習工程(Machine Learning Engineering, MLE)作為具體實驗場域,提出了一套完整的開放全棧系統 OpenMLE,並在此基礎上訓練出 Frontis-MA1 模型,在標準化測試中展現出超越 GPT-5.5 的表現,甚至逼近 GPT-5.6 Sol 與 2.8T 參數的 Kimi K3 等更大規模模型。

遞迴自我改進的核心概念,在於讓 AI 能夠反覆改善自身「建構 AI」的能力。這不只是一般的模型微調,而是讓系統在不斷執行機器學習任務的過程中,學習如何更有效地設計、除錯、改寫程式碼,從而形成一個自動進化的循環。Frontis 團隊認為,機器學習工程提供了具體且可驗證的測試環境,非常適合研究此一能力。因此,他們設計了 OpenMLE 系統,涵蓋三個層面:可驗證的任務環境 OpenMLE-Gym、運算子學習平台 OpenMLE-RL,以及長程搜索機制 OpenMLE-Evo。OpenMLE-Gym 提供一系列可執行的機器學習任務,並能回饋實際執行結果,讓模型學習從錯誤中修正。

OpenMLE-RL 則透過強化學習,讓模型掌握四個原子程式演化運算子:Draft(草稿)、Improve(改進)、Debug(除錯)與 Crossover(交叉)。這些運算子經過執行基礎的監督式微調(SFT)與強化學習訓練,並在資料去重後,進一步組合成長程搜索流程,使學習與演化在單一循環中耦合。基於 OpenMLE 堆疊,團隊後訓練出 Frontis-MA1,這是一個擁有 350 億參數的元演化代理(meta-evolution agent)。

在固定預算條件下——每項任務 12 小時、單張 RTX 4090 顯示卡且 VRAM 上限 12GB——Frontis-MA1 在 MLE-Bench Lite 測試集上的表現極為亮眼。與基礎模型相比,搭配 OpenMLE-Evo 後,其 Medal Average 從 39.39% 提升至 60.61%;若進一步啟用 OpenMLE-Evo-Max(包含基準無關的經驗先驗知識與非同步搜索),則達到 71.21%,一舉超越 GPT-5.5 搭配 Codex 的組合,也逼近 GPT-5.6 Sol 與擁有 2.8T 參數的 Kimi K3。

為了驗證架構與模型各自的貢獻,團隊也在另一個未見過的 NatureBench Lite 測試集上進行消融實驗。結果顯示,當固定框架不變、僅換用訓練後的模型時,Match-SOTA 指標從 50% 提升至 70%;而當固定模型不變、僅換用 OpenMLE-Evo 框架時,Match-SOTA 也從 20% 躍升至 50%。這證明了 OpenMLE 框架與 Frontis-MA1 模型兩者都能獨立帶來顯著增益,且可互相轉移。這項研究的另一個重要特色是開源。Frontis AI 已釋出 Frontis-MA1 的模型權重,以及完整的 OpenMLE 程式碼庫,所有資源均可在 GitHub 上取得。

團隊希望藉此讓學術界與工業界能夠重現並擴展這項研究,進一步推動可執行的 AI4AI(用 AI 建構 AI)研究方向,朝向真正的遞迴自我改進邁進。論文於 7 月 30 日發布在 arXiv 上,隔日由 Kaiyan Zhang 提交至社群平台,隨即獲得大量關注。

Frontis 團隊成員包括 Junlin Yang、Che Jiang、Yu Fu、Tianwei Luo、Can Ren、Weizhi Wang、Kaikai Zhao、Hongyi Liu、Yuxin Zuo、Yuru Wang、Yuchen Fan、Kai Tian、Zhenzhao Yuan、Xiaojian Lin、Li Sheng、Rushi Qiang、Guoli Jia、Xingtai Lv、Ermo Hua、Dianqiao Lei、Youbang Sun、Ning Ding 等二十餘位研究者。

這項成果不僅展示了小規模參數模型在特定工程任務上能夠追趕甚至超越超大規模模型,更為未來自主演化 AI 系統奠定了重要的基礎架構與實證數據。

Related

相關文章

IT之家其他AI

字節 Seedance 2.5 視頻模型 API 上線,原生支持 30 秒視頻直出

首頁 > 智能時代>人工智能 字節 Seedance 2.5 視頻模型 API 上線,原生支持 30 秒視頻直出 2026/8/7 14:20:23 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: 感謝IT之家網友 未央 的線索投遞! IT之家 8 月 7 日消息,字節火山引擎今日宣佈,正式上線 Seedance 2.5 API 服務。相比 Seedance 2.0,Seedance 2.

6 小時前
雷峰網其他AI

汪峰:我現在買衣服,80%都是淘寶

汪峰:我現在買衣服,80%都是淘寶 本文作者: 徐咪 2026-08-07 11:12 導語:日前,汪峰在一檔視頻採訪中提及,孩子愛買奢侈品,他認為這不是他們應該有的消費行為,談及自身,他說到,“我現在挑衣服只希望合適,買衣服 80% 都是淘寶”。&nb 日前,汪峰在一檔視頻採訪中提及,孩子愛買奢侈品,他認為這不是他們應該有的消費行為,談及自身,他說到,“我現在挑衣服只希望合適,買衣服 80% 都是淘寶”。

17 小時前
AIBase其他AI

OpenAI 強硬回擊蘋果竊密訴訟:稱指控毫無根據,斥蘋果借訴訟掩蓋人才短板

AI資訊AI新閒資訊正文OpenAI 強硬回擊蘋果竊密訴訟:稱指控毫無根據,斥蘋果借訴訟掩蓋人才短板發布於AI新閒資訊時間 :Aug 6, 2026閱讀 :1分鐘OpenAI 正要求美國聯邦法官駁回蘋果公司提起的商業機密竊取訴訟,稱蘋果的指控毫無根據且缺乏充分調查。OpenAI 律師在週三晚些時候提交的法院文件中表示,蘋果的訴狀建立在斷章取義的通信記錄和脫離背景的普通行為之上,並直言"借用蘋果自己的說法,這樁訴訟爛透了"。

1 天前6700
鈦媒體其他AI

打官司、挖人,蘋果和OpenAI的硬件大戰才剛開始

蘋果與OpenAI之間的戰火已從軟體領域延燒至硬體戰場。OpenAI 曾公開批評蘋果的產品路線「走錯了路」,但諷刺的是,這家 AI 公司如今卻大舉挖角蘋果的硬體工程師,據傳已網羅近 400 名曾在蘋果任職的資深硬體人才,準備自行開發硬體設備,彷彿要重走蘋果當年從軟體跨入硬體的成功之路。 從檯面上的法律攻防到檯面下的人才爭奪,兩家科技巨頭的對抗正全面升溫。

2 天前
雷峰網其他AI

鴻蒙智行回應「竹知了」事件:針對的是侵權內容;員工因離座9分鐘被開除!公司被判賠償11萬元;疑似梁文鋒早期微博被扒,曾被困無人區7天

要聞提示1.鴻蒙智行回應“竹知了”事件:針對的是侵權內容,並非“竹知了”玩具2.員工上班玩手機被指“摸魚”並開除:法院判決公司賠償 11 萬元3.疑似梁文鋒早期微博被扒,曾單人闖無人區被困一週4.女子山姆40元買披薩吃出108元剪刀,網友調侃:買家薅到羊毛了5.小米第二代AI眼鏡延遲到Q4或明年發佈6.機構:豆包上半年月活超3.8億,躋身全網APP前167.OpenAI 回應商業糾紛案:蘋果對此案處理有誤8.每天淨賺7億!

2 天前