Mistral AI開源數學證明利器:119B參數只激活6B,解題成本僅為競品百分之一

2026年7月6日 09:326500 次瀏覽

重點摘要

AI資訊AI新閒資訊正文Mistral AI開源數學證明利器:119B參數只激活6B,解題成本僅為競品百分之一發布於AI新閒資訊時間 :Jul 6, 2026閱讀 :1分鐘歐洲人工智能企業Mistral AI近日正式推出面向數學形式化證明的專用模型Leanstral 1.5。該模型專為Lean4 程序語言打造,總參數規模達119B,但實際推理時僅激活6B參數,以極低的計算開銷實現了驚人的證明能力,並以Apache-2.

站內 AI 整理稿

歐洲人工智慧新創公司 Mistral AI 近日正式推出專為數學形式化證明設計的專用模型 Leanstral 1,這款模型以 Apache-2.0 開源授權釋出,立即在學術研究與形式驗證社群引發廣泛關注。Leanstral 1 專為 Lean4 程式語言打造,總參數規模達到 119B,但在實際推理過程中僅激活 6B 參數,以極低的計算開銷實現了令人驚豔的證明能力,目標是讓機器能夠自動化處理艱深的數學證明任務。Mistral AI 成立於歐洲,向來以開發高效能且開放的大語言模型著稱。

此次推出的 Leanstral 1 延續了 Mistral 在稀疏專家模型(MoE)或類似架構上的技術路線,透過僅激活極少比例的參數來大幅降低運算成本,同時保持龐大知識容量。這項設計使得模型在面對複雜的數學邏輯問題時,不需要動用全部 119B 參數,而能有效利用 6B 激活參數做出精準推理,從而實現媲美甚至超越更大規模模型的效能。數學形式化證明是將傳統的直覺性數學論證轉換為電腦可嚴格檢查的程式碼,Lean4 是目前最受歡迎的形式化證明語言之一,被頂尖數學家與計算機科學家用來驗證定理的正確性。

然而,撰寫這類證明需要極高的邏輯嚴謹度與專業知識,以往仰賴人力耗費大量時間,Leanstral 1 的出現為自動化證明帶來了突破。在核心基準測試中,Leanstral 1 展現了頂尖的表現。在 miniF2F 形式數學基準的驗證集和測試集上,模型均實現了 100% 的完成率,這意味著它能正確證明該基準內所有題目。在更具挑戰性的 PutnamBench 數學競賽題庫中,共有 672 道 Lean4 問題,Leanstral 1 成功解決了 587 道,覆蓋率高達 87% 以上。

此外,針對抽象代數領域設計的 FATE 系列基準,Leanstral 1 在碩士級別的 FATE-H 上達成 87% 的完成率,在博士級別的 FATE-X 上也達到 34%,兩項成績均為當前所有公開模型中的最佳表現。這些成績的背後,不僅是技術上的突破,更在於實用成本上的巨大優勢。根據 Mistral AI 公布的數據,在 PutnamBench 數據集上,Leanstral 1 平均每道題目的解題開支僅需 4 美元。相比之下,字節跳動開發的 Seed-Prover 1.5 每題成本超過 300 美元,而另一個知名證明器 Aleph Prover 也需要 54 至 68 美元。

換句話說,Leanstral 1 的解題成本僅為主要競品的百分之一左右。這樣的成本差異對於學術機構與研究單位而言意義重大。過去,嘗試大規模自動化數學證明往往因高昂的計算費用而受限,如今 Leanstral 1 以極低門檻提供相同甚至更優秀的證明能力,可能大幅降低形式化驗證的應用門檻,讓更多數學家、工程師與學生能夠使用機器協助驗證複雜的邏輯推導。Mistral AI 選擇以 Apache-2.0 授權開源 Leanstral 1,使全球開發者與研究人員可以自由使用、修改與部署該模型。這一做法延續了 Mistral 一貫的開放策略,也回應了學術界對可複現性的高度需求。

形式化證明領域長期以來缺乏開源且高效的專用模型,Leanstral 1 的發布補足了這塊空白。模型本身採用的稀疏激活機制也是亮點之一。傳統上,一個 119B 參數的模型若需完整運行,對記憶體與算力要求極高,難以在消費級硬體上操作。但由於 Leanstral 1 在推理時僅激活 6B 參數,使用者可以在更低的硬體規格下運行,這使得更多研究團隊能夠自行測試與改進,而不必依賴大型雲端算力集群。

從技術層面來看,Leanstral 1 在 miniF2F 上的 100% 完成率說明了它對基本形式數學證明的掌握已經相當純熟;PutnamBench 的高通過率則展現了模型處理高難度競賽題目的能力,這類題目往往需要跳脫常規解題思路,涉及組合數學、數論與幾何等多元領域。FATE 系列的博士級水準表現更顯示出模型在抽象代數這一理論性極強的領域同樣具備競爭力。對於 AI 輔助數學發現的趨勢而言,Leanstral 1 的出現不僅僅是一個模型的發布,更代表著自動化證明工具從昂貴的事業走向平價化的轉折點。

過去,類似字節跳動 Seed-Prover 的模型雖然表現不俗,但成本高昂,難以廣泛部署;而 Aleph Prover 雖有一定效率,但成本仍遠高於 Leanstral 1。現在,一個每題僅需 4 美元的方案,讓大規模驗證數學猜想或教科書定理成為可能。業界分析認為,Mistral AI 此舉可能加速形式化證明在學術與工業領域的普及。數學家可以將 Leanstral 1 當作輔助工具,快速檢驗推導過程中的漏洞;軟體工程師則可以將其應用於關鍵系統的邏輯驗證;教育機構也能用較低成本讓學生練習撰寫形式化證明。開源授權更進一步鼓勵社群貢獻改進,形成正向循環。

值得留意的是,Leanstral 1 雖然在靜態證明任務上表現優異,但目前仍屬於專用模型,需要預先將待證命題轉化為 Lean4 語言格式。這意味著使用者仍需具備一定的形式化程式設計基礎,不過 Mistral AI 也提供了詳細的文件與範例,降低入門障礙。隨著 Leanstral 1 的開源釋出,形式數學證明領域的競爭格局正在改變。Mistral AI 以不到競品百分之一的成本達成頂尖成績,這不僅是效率的勝利,更可能重新定義自動化證明工具的發展方向。未來,我們或許會看到更多結合稀疏激活與專業領域知識的模型問世,讓機器逐步成為人類數學探索中不可或缺的夥伴。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前