梁文鋒狙擊戰:深扒那些梁文鋒署名的論文有多牛

2026年9月25日 18:48
梁文鋒狙擊戰:深扒那些梁文鋒署名的論文有多牛
站內 AI 整理稿

本文作者: 高允毅 2026-09-25 18:48 導語:過去三年,梁聖署名了11篇論文,每篇都幾乎震動世界。過去三年,梁聖署名了11篇論文,每篇都幾乎震動世界。作者丨高允毅 編輯丨岑 峰 當 RSI 的風吹到了 DeepSeek,這次討論的是一個新話題“自動化沙箱”。9 月 19 日,arXiv 更新了一篇 DeepSeek 新論文《DSec:面向大規模智能體訓練的高效沙箱基礎設施》,論文長達 31 頁,首次展示了 DeepSeek 自動化沙箱系統 —— DSec(DeepSeek Elastic Compute)。

它是專門應用於其內部超大規模智能體(Agent)強化學習與評測體系的生產級底座,能為每一次訓練任務秒級創建獨立的虛擬“新考場”。DSec 的工程能力十分驚人。每日可自動運行 300 萬個沙箱環境,單生產單元橫跨 160 個 CPU 節點。通過嚴苛的權限隔離,DSec 不僅能防止 AI 作弊,還能對 AI 在沙箱內每一步環境反饋的精準復現。這篇論文是這輪 RSI 革命在工程深水區的探尋,在Agent強大到頻頻失控,甚至意識到自己被“監控”,隱藏起思維鏈的2026年,沙箱不再是附庸的安全配件,它既是AI進化的訓練場,也是鎖死 AI 破壞力的關鍵防線。

而擁有這樣前沿意識的,正是通訊作者欄裡那個熟悉的名字 —— 梁文鋒。過去三年,梁文鋒極少以第一作者或通訊作者身份,出現在 V3.2、V4、V4.1-Flash 這些動輒上百人署名的旗艦模型整體報告中;卻始終把名字簽在 MLA 注意力、MoE 路由機制、mHC 拓撲流形、DSpark 推理算子、DSec 智能體沙盒這些最底層的原子技術論文上。整整 11 篇梁文鋒署名的論文,串起的是一部精準瞄準行業核心痛點、直擊底層內核的技術狙擊史。1.《DeepSeek LLM: Scaling Open-Source Language Models with Longtermism》2.

《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》3.《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》4.《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》5.《DeepSeek-V3 Technical Report》6.

《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》7.《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 8.《Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures》9.

《mHC: Manifold-Constrained Hyper-Connections》10《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》11.《DSec: An Efficient Sandbox Infrastructure for Large-Scale Agent Training》012024 年初的破局之戰:買不起一萬張顯卡,那就打效率戰2024年初的大模型行業,深陷算力規模的軍備競賽。

稠密模型的縮放定律幾乎等同於 "燒錢定律",整個賽道被萬卡集群、數億美金的投入門檻圈成了一個巨頭專屬的 “頂級俱樂部”。能坐在牌桌上的玩家屈指可數:OpenAI、Google、Anthropic、Meta。像OpenAI的GPT-4 級別模型需要上萬張高端 GPU,單次訓練物料成本超過 6300 萬美元,訓練成本動輒數億美元。算力資源直接決定了模型能力的天花板。對所有初創公司而言,沿著巨頭定下的稠密模型路線追趕,永遠只能活在對方的陰影裡。

像 Stability AI 這樣的明星開源公司 ,2024 年因無力承擔高昂的 GPU 雲租賃費用,資金鍊斷裂,CEO 黯然離職;Inflection AI 同樣扛不住稠密模型持續翻倍的訓練成本,2024 年 3 月核心團隊被微軟反向併購,退出了通用大模型內卷。國內一眾曾在 2023 年喊出 “百模大戰” 口號的初創團隊,到 2024 年初直面 “萬卡集群” 的硬件門檻時,僅憑几百、上千張卡的作坊式訓練規模,直接遭遇降維打擊,紛紛掉隊。梁文鋒的第一波狙擊,直接打在了 "算力與能力線性綁定" 這個底層規則上。

《DeepSeek LLM》、《DeepSeekMoE》、《DeepSeek-V2》正是這段時間的作品。《DeepSeek LLM》2024 年 1 月 5 日,梁文鋒團隊發佈《DeepSeek LLM》,這是 DeepSeek在全球開源社區的首秀,直接給浮躁的“參數軍備競賽”潑了一盆冷水。經過嚴密的數學推導與驗證,他們發現在算力固定的前提下,盲目擴大模型參數並非最優解,提升數據質量與數據密度的配比,反而能帶來更強的模型能力。在這套思路下,團隊在 2 萬億優質中英雙語 Token 上訓練出 DeepSeek LLM 7B 與 67B 兩個版本。

其中僅 67B 參數的版本,就在代碼、數學與推理基準測試中全面反超當時的開源標杆 Llama-2 70B,更在開放對話測試中擊敗 GPT-3.5。這是梁文鋒技術路線打響的第一槍,“我可以用更少、更精密的算力,訓出比你更聰明的開源模型。”《DeepSeekMoE》《DeepSeek-V2》隨後,就是大眾熟知的經典之作《DeepSeekMoE》《DeepSeek-V2》,直接重構了傳統 Transformer 架構。DeepSeekMoE 架構通過細粒度專家動態路由與共享專家隔離,讓每個 Token 僅調用少量專家參與計算,直接將訓練開銷降低 42.5%。

首創的 MLA 多頭潛在注意力機制,精準擊破了長上下文推理的“成本黑洞”,利用低秩潛在向量壓縮,將 KV Cache 的體積極限壓縮了 93.3%。基於這兩項技術突破誕生的 DeepSeek-V2 ,憑藉比肩 GPT-4 的性能和極低的成本震驚世界。它把千 token 推理成本打到了此前的幾十分之一,直接引爆了國內大模型 API 的價格戰。這不僅讓 DeepSeek 擠進核心牌桌,成為性價比代名詞,更把一大批買不起算力門票、瀕臨出局的邊緣玩家,連同整個開源社區,重新拉回賽場。

022024 年到 2025 年的能力擊穿戰:衝擊閉源模型的智力高地如果說第一階段解決了 "用低成本做出可用模型" 的問題,那麼第二階段的梁文鋒,把這條低成本路線推到極致,追趕閉源模型的頂級水平。《DeepSeek-Coder-V2》2024 年 6 月,DeepSeek 發佈《DeepSeek-Coder-V2》,率先向閉源模型壟斷最深的代碼垂直領域痛下殺手。在大模型行業發展的早期,開源模型在複雜代碼生成、前沿數學推理等領域,始終無法趕超閉源模型,這背後的原因,既有高質量代碼數據的稀缺,也因為老架構算力效率低下。

而閉源廠商有幾萬張 H100 ,可以不計成本地依靠豐富的物理硬件資源,強行堆砌出高端的代碼與推理能力,形成商業壟斷。而梁文鋒在新架構基礎上,額外注入了 6 萬億高質量中英代碼與數學數據進行持續預訓練。將支持的編程語言從 86 種擴充至 338 種,上下文窗口直接拉滿至 128K。最終, DeepSeek-Coder-V2,在 HumanEval、Codeforces、LiveCodeBench 等主流代碼基準上,首次全面超越 GPT-4 Turbo、Claude 3 Opus 等閉源頂級模型。這次嘗試既驗證了新 MoE 架構的高端能力,還把推理價格打了下來。

其每百萬 Token 的輸入價格僅為 0.14 美元,輸出價格僅為 0.28 美元。作為對比,當時閉源世界的霸主 GPT-4 Turbo 每百萬 Token 輸入需要 10.00 美元,輸出高達 30.00 美元。在提供同等甚至更強代碼智能的前提下,DeepSeek 的價格僅為 OpenAI 的約百分之一。這直接把高端代碼智能的調用成本打至近乎可忽略的 “水電費” 級別,讓不少中小企業或獨立開發者可以構建自己的 Agent 團隊。《DeepSeek-V3》隨後,2024 年底,DeepSeek團隊做了新 MoE 架構的超大規模嘗試。

在不到2個月的時間,他們僅憑 2048 塊 H800 顯卡,就從頭開始訓出頂級模型 DeepSeek-V3。它的參數高達671B ,總成本才 560 萬美元,這個數字直接讓硅谷破防。當時,同等能力級別的閉源模型,訓練成本通常是它的數倍甚至十倍。當時不少人戲稱,“中國團隊在用自行車的預算造火箭”。雖然,科技分析機構 SemiAnalysis 等在覆盤時調侃道,這 560 萬美元只是“純 GPU 燒電訓練的最淺層賬單”,不包括前面的研發虧損、卡群折舊和高達 13 億美元的基礎硬件大總賬。但這並不妨礙大家拿這張“漂亮的收據”去羞辱那些動輒要募資 1000 億美元的硅谷大佬。

560 萬美元成為全行業拿來公開處刑的標尺。而這一切的奧秘藏在了《DeepSeek-V3》論文裡,梁文鋒團隊做了三件事,把每一分算力都榨到極致。一是用無輔助損失的專家負載均衡策略,讓所有專家均勻分配任務;二是用更精簡的 FP8 數值精度做訓練,讓顯卡的計算效率直接拉滿;三是訓練大模型時,讓“數值計算” 和 “數據傳輸”並行啟動,把硬件的空閒時間壓到幾乎為零。這一戰徹底證明了, 新 MoE 架構不僅能進行超大規模訓練,還能以極低的成本穩定地訓練完成。《DeepSeek-R1》真正奠定 DeepSeek 行業一哥地位的,來自 2025 那場春節。

在此之前,硅谷牢牢把持著 “深度推理” 的話語權,將其塑造成萬卡集群、海量名校博士手工標註才能堆出來的昂貴特權,OpenAI 的 o1 更是被奉為閉源推理的標杆。DeepSeek-R1 的橫空出世,直接斬落了閉源推理王牌 o1。而整個強化學習階段僅耗資 29.4 萬美元,這在動輒需要數千萬、數億美元“強化學習預算”的硅谷面前,無異於降維打擊。在《DeepSeek-R1》論文中,其核心突破在於團隊提出的組相對策略優化(GRPO)算法。

首次嚴謹證明無需大規模監督微調(SFT),僅通過純強化學習,大模型就能自主湧現出鏈式思考能力;其中 R1-Zero 版本,完全從零冷啟動,不依賴任何人工標註數據,僅憑 RL 訓練就達到了接近閉源頂級推理模型的水平。這項成果的影響力迅速突破行業圈層。它後來登上《Nature》雜誌封面,成為首個獲此權威認可的主流大模型成果。《麻省理工科技評論》《紐約時報》《華盛頓郵報》、CNBC、英國《金融時報》等西方主流媒體密集報道,驚呼美國對中國人工智能領域的限制,根本無法阻止中國在這一領域取得進步。國內更是掀起了 R1 熱潮。

無數科技從業者連夜研讀技術報告,科技媒體扎堆跟進報道,DeepSeek 從 “性價比黑馬” 搖身一變,成為 “全球 AI 底層範式定義者” ,走進大眾視野。梁文鋒也被請到了政府座談會上,分享中國 AI 的發展。梁文鋒還順手把 R1 的硬核邏輯‘蒸餾’給了全球所有開源小模型,直接解構硅谷資源霸權。《Native Sparse Attention》《Insights into DeepSeek-V3》拿下推理能力的高地之後,這一階段,梁文鋒的狙擊範圍還在向更底層延伸,把成本戰下沉到芯片的微觀訪存邏輯裡,解決長文本訓練與推理的物理成本問題。

此前業內解決超長上下文,都愛用 “稀疏注意力”,這是個紙上談兵的技術,真跑在 GPU 上就水土不服,並沒有省很多算力。2025 年 2 月,團隊提交《Native Sparse Attention(原生稀疏注意力,NSA)》論文,沒有停在應用層做小修小補,直接用 Triton 語言重寫了最底層的硬件計算算子。NSA 創造性地設計出分層動態稀疏策略,讓稀疏計算的訪問節奏,精準對齊 NVIDIA GPU Tensor Core 的微觀電路結構,這相當於給算法量身定做了適配硬件的 “跑道”,讓稀疏計算能在硬件上全速跑起來。

而且,NSA 是從預訓練第一天起就把稀疏性刻進模型裡的原生技術,全程不損失模型精度。這直接讓模型前向傳播速度提升 9 倍,長序列解碼速度直接拉高 11.6 倍。NSA 斬獲 ACL 2025 最佳論文獎,也成為了下一代長上下文大模型公認的標配技術方向。2025 年 6 月發表於 ISCA 的《Insights into DeepSeek-V3》,從計算機體系結構視角,拆解了大規模 MoE 訓練的內存牆、通信牆瓶頸,分析了 MLA、MoE 路由、FP8 精度與 GPU 硬件的協同關係,甚至給出了下一代 AI 加速芯片的設計建議。相當於把中國大模型的工程經驗,變成了全球芯片行業的可參考的指南。

這一波把 DeepSeek 的技術影響力,從算法層延伸到了硬件層。2025 年末的深水區攻堅戰:當 AI 衝進無人區,用數學重構底座。032025 年末的深水區攻堅戰:當 AI 衝進無人區,用數學重構底座當模型規模衝到千億級、網絡層數突破上百層,行業徹底進入了無經驗可循的 “無人區”。大模型的競爭,也從參數規模的比拼,悄然變成了深層網絡拓撲的數學命題。大模型由上百層網絡堆疊而成,訓練時信號與梯度要在層間反覆傳遞。過去十年,全行業都沿用經典的殘差連接,也就是著名的 x + F (x) 範式。它像一條保留了直通車道的公路,前一層的信號可以原封不動地流向深層,以此緩解梯度消失,讓深層網絡得以訓練。

但當模型做到極深、極寬,這條範式就觸到了天花板:數值穩定性不足,梯度很容易在百層傳遞中逐漸消散或者失控暴漲,訓練中頻繁出現 Loss Spike(損失突增),一次失控就可能讓數千萬的算力投入付諸東流。學界此前提出過超連接架構,相當於把單車道升級成多線並行的高架立交橋,允許多路信號同時交叉、融合,理論上能大幅提升網絡的表達能力。但這種架構缺少數值邊界約束,信號越傳越偏,深層訓練極易發散,始終停留在實驗室階段,無法大規模落地。2025 年 12 月 31 日,梁文鋒團隊在《mHC》論文中,給出了一個極其優雅的數學解法 —— 流形約束超連接(mHC)。

mHC 相當於在立交橋的所有出入口架起了一道透明的 “數值護欄”:它強制要求所有層間的交互映射矩陣,必須嚴格落在由雙隨機矩陣構成的特定數學區域 ,即Birkhoff 多面體流形之內。這樣一來,無論多路信號在層間怎麼交叉、融合、傳遞,整體的數值尺度始終保持守恆,從數學底層解決了超深層模型訓練不穩定的根源問題。這一步,梁文鋒已經在解決 “規模堆上去之後會不會崩” 的底層數學問題,從拓撲層面,重新定義了深層網絡的連接規則,也為千億甚至萬億參數的極限模型,打下了穩固的數學地基。

042026 年的終局卡位戰:把戰火燒到 Agent 基礎設施層進入 2026 年,全行業都已認準下一個主戰場:智能體(Agent)。幾乎所有廠商的注意力,都集中在模型的推理能力、工具調用能力、任務完成率這些顯性指標上。而梁文鋒已經開始注意到更底層的東西,Agent 訓練的基礎設施。《DSpark》2026 年 6 月,DeepSeek在《DSpark》中提出一個“推理加速”工具——DSpark,它解決的是大模型生成回答的速度問題。大模型生成回答時,越到後面越慢;當很多人同時用 AI 時,速度就更拉跨。

DSpark 讓 AI 生成回答時,不再壓榨單個算子的計算速度,而是動態調整生成節奏:有把握的地方就提速,容易出錯的地方就慢下來。從根本上避免“猜錯要回滾重算”的浪費,把“事後補救”變成了“事前規避”。在多人同時使用的高併發場景下,DSpark 能讓每個人的生成速度提升 60%–85%。DSpark 之所以重要,是因為它把推理效率的比拼,從“誰的芯片更快”拉到了“誰的調度更聰明”這個層面。現在的大模型正從“答一次題”走向“全天候幫人幹活”。當所有人同時發起請求,對基礎設施的考驗完全不同。這套思路,正是在為“百萬人同時用 AI 幹活”的未來提前打好地基。

《DSec》另一方面,底層的沙箱基礎設施,可能會是大規模 Agent 訓練的關鍵瓶頸。Agent 的強化學習需要在可執行環境中反覆試錯,百萬級的交互迭代就需要百萬級的沙箱環境。傳統沙盒方案啟動慢、密度低、成本高、安全隔離差,根本支撐不起日均百萬級的生產級訓練任務。它們是為“驗證代碼”設計的,不是為“培養智能”設計的。9 月,DeepSeek 發佈自動化沙箱 DSec,每天可運行約 300 萬個沙箱,併發承載 38 萬個實例。同時內置完整防作弊機制,保證訓練交互數據的真實性。在此之前,各家廠商的 Agent 沙盒都是內部定製的黑盒,沒有統一標準,也沒有公開的生產級參考方案。

DSec 的發佈,相當於第一次把 Agent 大規模訓練的基礎設施標準化、公開化。更關鍵的是,這是一次典型的 "提前卡位"。當同行還在打磨單個 Agent 的任務能力時,梁文鋒已經在搭建能支撐百萬級 Agent 並行訓練的基礎設施。05技術狙擊手的哲學回望三年,梁文鋒署名的這 11 篇技術論文,從成本戰出發,專挑最底層、最硬核的地方下手。從 MoE 重構算力成本,到 MLA、NSA 擊穿長上下文瓶頸;從 R1 顛覆推理範式,到 mHC 築牢數學底座;從 DSpark 榨乾推理效率,到 DSec 卡位 Agent 基礎設施。

梁文鋒之所以被尊稱為“梁聖”,正是在於他的每一步都精準踩在了技術演進的節點上,他的每一槍都解決了行業的致命痛點,最終完成了 AI 的技術普惠。真正的狙擊手,從不炫耀槍支的口徑,也不比拼彈藥的數量。他只關心一件事:用最精準的打擊,完成最致命的突破。而這條 "底層擊穿" 的技術路線,或許正是中國大模型在全球競爭中,最有價值的差異化路徑。上車,(公眾號:)帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。

0人收藏 分享: 相關文章 DeepSeek DSec 梁文鋒 《AGI市場觀察》發佈:四款國產模型周用量破10萬億t ...深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯 ...規模要追平智譜!DeepSeek今年將擴招到1000人;繼姚 ...俞敏洪:我這幾年特別不安分,弄得名聲比較大;傳De ...高允毅 編輯 發私信 當月熱門文章 深度解讀:關於 Jev 的幾大疑問 GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!

GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?深度解讀:智譜為什麼要在 Infra 層搞 RSI?最新文章 GPT-6 Sol 降價 50% 的秘密:消失的 Terra,一場模型梯隊平移 深度解讀:關於 Jev 的幾大疑問 深度解讀:智譜為什麼要在 Infra 層搞 RSI?工作流可以自我進化了,英偉達開源 SoL-Pi,每小時省13.5刀!深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?

熱門搜索 微軟 IBM 淘寶 電動車 裁員 微信支付 Verizon Path Lyft 任正非 東芝

Related

相關文章

鈦媒體生成式AI

Edge AI Daily 早報(9月26日)

Edge AI Daily2026.09.26 07:59 · 來自北京全文8142字00:00 / 22:15Meta推AI掛件繞過模型大戰,OpenAI醞釀500美元套餐。Runway發佈WorldPrompt,Cursor推Project模式。

剛剛
鈦媒體生成式AI

Meta 已經想清楚 Muse 靠什麼賺錢

AGI-Signal2026.09.26 07:53 · 來自河南全文4239字00:00 / 11:34眼鏡、鑰匙扣、電腦、手機的入口,可能都是同一個智能體。美東時間週五收盤,Meta 報751.66美元,單日下跌3.3%,總市值約1.9萬億美元。

剛剛
何夕2077生成式AI

本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態

導航SecureDoc // EncryptionActive本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態。" AI資訊 | 每日早讀 | 全網數據聚合 | 前沿科學探索 | 行業自由發聲 | 開源創新力量 | AI與人類未來 | 訪問網頁版↗️ | 進群交流🤙 今日摘要 谷歌Gemini 4進入細化階段擬提前發佈 小米MiMo登頂開源權重榜首成本僅為對手零頭 美團龍貓2.

3 小時前
IT之家生成式AI

暢銷小說被指用 AI 創作,法國最有名文學獎龔古爾獎將其移出初選名單

作者:清源 責編:清源 評論: 9 月 25 日消息,據路透社報道,當地時間 25 日,法國最負盛名的文學獎項 —— 龔古爾獎主辦方宣佈,將海地裔加拿大作家泰利森 · 奧雷利安的暢銷小說《C'etait Ca ou Mourir(要麼就這樣,要麼死)》移出初選名單,原因是有人指控奧雷利安使用 AI 創作該書。

3 小時前
量子位生成式AI

“AlphaGo”殺進足球場!自我對弈140年,機器人成“梅西終結者”

美國具身智能獨角獸Skild AI推出人形機器人Messinator,其核心是旗艦機器人基礎模型S1,透過自我對弈的方法在虛擬環境中訓練了140年,成功學會帶球、護球和射門等足球技巧。該機器人能透過觀看影片示範來理解任務並執行,顯示AlphaGo的自我對弈策略在物理世界中也獲得了成功驗證。

5 小時前