Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?

2026年9月30日 15:46
Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?
站內 AI 整理稿

本文作者: 李娜 2026-09-30 15:45 導語:大模型 Attention 路線變遷:從分流到重組。大模型 Attention 路線變遷:從分流到重組。作者丨李娜 編輯丨岑峰 一張大模型架構圖裡,同時出現了 Kimi 和 DeepSeek 的影子。GLM-5.3-Flash項目配置文件:45層架構中,34層採用Kimi路線的KDA線性注意力,另外11層採用DeepSeek路線的KPool-DSA稀疏注意力今年以來,大模型架構裡出現了一條越來越清晰的變化:一些混合注意力架構中原本由全局Attention承擔的角色,開始被Sparse Attention(稀疏注意力)接替。

要理解這個變化,得先回到 Attention 本身。Attention解決的是一個基礎問題:模型處理當前token時,能不能在越來越長的歷史裡,找到真正有用的信息。大致來看,目前常見的Attention機制可以理解成三類:全局注意力(Full / Global Attention)直接讀取完整的token歷史,信息保留最充分,但計算和緩存成本也最高;線性注意力(Linear Attention)把歷史壓縮進更緊湊的狀態,以降低長序列的計算成本;稀疏注意力(Sparse Attention)則保留更完整的歷史,只選擇其中一部分重要信息參與計算。

過去幾年出現的很多高效注意力(Efficient Attention),主要就在後兩種方向上繼續演化。最開始,經典 Transformer 主要使用 Full Attention,Full Attention讓模型可以直接訪問完整的token級歷史,代價是計算和KV Cache隨上下文迅速增長。連帶著訓練和推理成本也隨之大幅增加。過去幾年,大家對 Attention 的改造,本質上都是在能力和成本之間找平衡。於是,作為折中方案的混合注意力架構逐漸流行起來:不同機制被放進同一套模型裡分工,高效Attention負責降低成本,少量全局Attention保留直接訪問完整歷史的機會。

從不同Attention路線,看大模型公司的選擇到了今年,很多混合注意力架構裡由全局Attention承擔的角色,開始出現被Sparse Attention接替的跡象。8月發佈的Qwen3.8-Flash-Next就是一個很清楚的例子。它延續此前三層 Gated DeltaNet 配一層 Attention 的結構,但那一層原本負責全局精確讀取的 Attention,被進一步改造成了 Qwen Sparse Attention這樣的高效注意力機制。(此前,我們也對 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 做過詳細實測,可參見https://mp.weixin.

qq.com/s/HxJhiH0O1etsHoH_X1J5VQ) (公眾號:) Qwen3.8-Flash-Next 架構圖:每四層裡,三層是 GDN,一層是 QSA為什麼那層一直被認為無法替代的全局 Attention,也開始有人嘗試用另一種高效機制接替?如果具體的 Attention 技術正在變成可以流動和重組的零件,我們今天所謂一家模型公司的“技術路線”,到底還指什麼?

01MiniMax最後還是留下了Full Attention要回答這個問題,可以看看MiniMax過去幾年的架構變化,幾乎完整經歷了這一輪反覆:從押注線性注意力,到保留少量全局注意力做混合注意力,再回到全局注意力,後來又轉向稀疏注意力。每一次變化背後,都對應著模型Scale以後新暴露出來的問題。2023年底,後來主導過MiniMax-01網絡架構設計的鐘怡然正在給Linear Attention找一家願意真正把它Scale Up的公司。他從2021年開始研究這條路線,此前最大的實驗模型已經做到15B。

在他看來,Linear Attention在建模效果和運行效率上的幾個主要問題已經基本解決,真正剩下的問題只有一個:它被放大到幾百B參數以後,還能不能成立?這個問題已經不是研究團隊自己可以回答的了。預訓練一個幾百B參數的大模型,架構一旦確定,數據、算法、訓練系統和工程資源都會跟著轉向。鍾怡然此前也接觸過其他公司,最終在2023年底和閆俊傑的一次交流後,MiniMax決定把這條還沒有經過大規模驗證的路線接下來。雙方對這件事的把握其實並不一樣。鍾怡然後來回憶,作為長期研究Linear Attention的人,他當時覺得成功概率接近99%;但站在閆俊傑的位置上,他估計這個數字只有大約一半。

一旦把Linear作為下一代主模型的架構,MiniMax超過80%的研發資源都會被捲進來。一家大模型公司要用絕大多數研發資源,去驗證一件只有五成把握的事。MiniMax創始人閆俊傑,圖源網絡早期實驗一度讓這場下注顯得沒有那麼危險。團隊曾經訓練過一版15B左右的純Linear模型,效果已經可以接近Transformer,似乎說明這條路線可以繼續往上Scale。但模型進一步放大後,問題開始暴露出來。Linear Attention為了降低長上下文的計算成本,會把歷史信息壓縮進更緊湊的狀態裡,而在檢索這類需要從很長文本中準確找回某個細節的任務上,這種壓縮會出現問題。

Linear Attention省下計算的關鍵,在於它不會一直保存並重新讀取每個歷史token,而是把過去的信息不斷壓縮進有限的狀態裡。這樣做很像把一本書邊讀邊做筆記:記住主題和大意很高效,但如果幾百頁以後突然問“第37頁某句話具體寫了什麼”,壓縮過的筆記未必還能完整還原。MiniMax原本希望把Linear做得更徹底,最後還是把Full Attention加了回來。後來MiniMax-01採用的7:1 混合注意力架構由此出現:每7層Lightning Attention之後,加入1層傳統SoftMax Attention。

大部分計算交給更便宜的Linear Attention,但模型隔一段仍然獲得一次直接讀取完整上下文的機會。這個比例是在不同層數和組合之間反覆實驗後找到的折中。鍾怡然後來把混合注意力形容成一種“保底方案”。可是,15B模型給出的信號仍不足以支撐一輪4560億參數的正式訓練。在真正開跑MiniMax-01之前,團隊做了大約3700次預訓練實驗,不斷改變模型大小、架構和參數組合,再從這些相對便宜的小實驗中判斷Scaling Law是否還能繼續成立。2024年中,MiniMax最終開始訓練4560億參數的MiniMax-01。

到2025年1月模型發佈時,7層Lightning Attention加1層Full Attention的架構被正式保留下來,上下文長度也被推到了400萬token。MiniMax花了數千次實驗和一輪大規模預訓練,最後仍然沒有把那層Full Attention拿掉。它恰恰解釋了為什麼在後來很長一段時間裡,混合注意力 Attention雖然越來越常見,卻往往仍要保留少量全局Attention。而MiniMax很快還會第二次碰到這個問題。02Scale之後,混合注意力又暴露了新問題模型繼續Scale以後,第二輪問題出現了。這一次是更復雜的多跳推理問題。

當模型需要經過多箇中間步驟,把前面的條件、推導和結論重新串起來時,混合注意力開始出現比Full Attention更明顯的能力損失。問題暴露以後,團隊重新設計測試和訓練方法,小規模實驗裡,混合注意力又可以追上Full Attention。真正讓MiniMax猶豫的也因此不再是這個具體缺陷,而是另一件事:這次的問題可以找到、可以修,下一次還沒有被發現的問題在哪裡?Text-01時期使用的Benchmark,並沒有提前暴露後來的多跳推理差距。即使團隊為這個問題補上新的測試,也無法證明在更大的模型和更復雜的任務上,不會繼續出現新的能力缺口。這意味著,混合注意力真正的風險是未知能力損失無法被提前窮盡。

MiniMax官網技術博客截圖所以到了M2,MiniMax重新採用了Full Attention。相比繼續押注一個可能在更大Scale上暴露新問題的架構,Full Attention雖然更貴,但它的能力邊界和工程行為更可預期。這也是Full Attention長期很難從混合注意力架構裡徹底消失的原因:它留下來的價值,很大一部分來自對未知能力風險的兜底。但到了下一階段,Agent又重新改變了這筆賬。03Agent重新放大了Full Attention的成本M2回到Full Attention之後,MiniMax並沒有在那裡停太久。

2026年6月發佈的M3重新離開Full,轉向自研的MiniMax Sparse Attention(MSA)。這一次,變化來自於模型要處理的任務。Text-01時期,長上下文更多意味著一次性讀進更多材料:一本書、一份報告,或者幾十萬token的文檔。到了Agent階段,上下文開始變成一段不斷增長的工作歷史。搜索結果、網頁、代碼、工具返回、報錯和中間結果,會隨著任務一輪輪執行不斷累積。一個Agent可能工作幾十輪甚至更久,前面發生過的事情又不能輕易丟掉。這讓Full Attention的另一面越來越難忽視。

M2時期,MiniMax最擔心的是高效Attention可能帶來的未知能力損失,因此寧願接受Full Attention更高的成本。但到了M3,長程Agent開始把這筆成本不斷放大:歷史越長,每一輪需要處理的信息越多,計算和KV Cache都會繼續增長。MiniMax在M3發佈時把“Context Scaling”直接列為解決複雜Agent任務的核心問題,並重新從Attention架構動手。最終採用的MSA不再讓每一步都處理完整歷史,而是先從長上下文中篩出真正需要參與Attention計算的部分。官方數據顯示,在100萬token上下文下,M3單token計算量約為上一代模型的1/20。

於是,MiniMax幾年的路線看起來像是繞了一圈:Text-01用Linear降低長上下文成本,同時留下Full Attention兜底;M2因為Scale後暴露出的能力風險,重新回到Full;到了M3,Agent又把長上下文成本推到前臺,於是團隊再次尋找Full Attention之外的方案,只是這一次選擇了Sparse。M2時,MiniMax願意用更高的計算成本換能力上的確定性;到了M3,Agent讓這份“確定性保險”的價格變得越來越高。04Linear和Sparse被放進同一個模型MiniMax重新走向Sparse時,類似的變化已經開始在其他模型裡出現。

過去很多混合注意力架構雖然引入了更高效的Attention,最後仍會保留少量全局Attention。到了2026年,這個結構開始鬆動。2月發佈的MiniCPM-SALA直接把Lightning Attention和Sparse Attention放到了一起;到了8月,Qwen3.8-Flash-Next延續此前三層Gated DeltaNet配一層Attention的結構,卻把負責精確檢索的那部分進一步改成了Qwen Sparse Attention。這個變化在Qwen身上尤其清楚。三比一的結構沒有變,變的是那一層“兜底”的方式。

過去由全局Attention直接讀取完整歷史,現在開始交給Sparse Attention,從長上下文中篩出真正需要的信息。到了GLM-5.3-Flash,類似的組合再次出現:45層模型中,34層採用KDA,另外11層採用KPool-DSA。過去分別由Kimi和DeepSeek推進的Linear與Sparse路線,被放進了同一套模型。Linear和Sparse之所以能夠放在一起,恰好因為兩者解決的是不同的問題。Linear擅長用較低成本維持一段很長的歷史,卻不擅長隨時恢復其中某個具體細節;Sparse保留token級歷史,但每次只讀取其中一小部分。

前者更像負責“記住整體狀態”,後者負責“需要時回去查具體內容”。這也是為什麼兩種過去看起來彼此競爭的方案,後來開始出現在同一套架構裡。三個模型的實現並不相同,但它們指向了一個共同變化:Attention架構正在從尋找一種更好的機制,走向讓不同機制承擔不同的工作。Linear或Recurrent Attention負責以更低成本維持長曆史,Sparse Attention負責在需要時從中找回更具體的信息。過去被當作不同路線討論的Linear、Sparse和Full,正在變成同一個架構設計空間裡的不同選項。05技術開始越過公司的邊界這種組合越來越容易發生,也和過去幾年技術擴散的方式有關。

2024年,長期研究線性注意力的楊松琳開始維護線性注意力開源社區FLA。她後來回憶,FLA從一開始就不只是為了發佈論文,而是希望把Linear Attention變成真正可以複用的基礎設施:算法之外,接口、kernel和具體實現也一起開放。後來Kimi推進KDA時,也從這個社區吸收了核心貢獻者。技術因此不再只跟著論文流動。代碼、社區和研究人員,把一項架構創新帶出了最初提出它的團隊。到2025年底,楊松琳在討論Linear Attention下一步時,已經提出過一個當時還很激進的方向:既然Linear在精確檢索上仍有缺口,是否可以直接和Sparse結合,讓兩種機制各自處理不同的問題。

她當時舉出的例子,就是Kimi的KDA和DeepSeek的DSA。不到一年,這種設想已經出現在真實模型裡。這也讓“技術路線”越來越難簡單地和某一種Attention機制綁定。過去人們習慣說MiniMax做Linear、DeepSeek做Sparse、Kimi做KDA;但當代碼可以開源、人員可以流動、已經被驗證過的技術可以迅速進入另一家公司的模型,這些標籤的有效期會越來越短。真正拉開差距的,也越來越不是“有沒有某項技術”,而是什麼時候採用它、怎樣和其他技術組合,以及願意在能力、成本和工程風險之間做什麼取捨。

06尾聲:路線沒有消失再回到開頭那張架構圖,Kimi和DeepSeek的名字同時出現在GLM-5.3-Flash裡,已經沒有那麼反常了。過去幾年,人們習慣用Linear、Sparse、Full Attention來區分不同公司的技術路線。但MiniMax幾次看似反覆的選擇,其實已經說明,這種劃分越來越難解釋真實的大模型研發。做Text-01時,MiniMax最先看到的是長上下文帶來的成本,於是押注Linear;模型繼續Scale以後,未知的能力損失變得更危險,M2因此重新回到Full;到了Agent階段,不斷增長的工作歷史又把計算成本推到前臺,M3再次轉向Sparse。

技術沒有突然變好或變壞,變化的是每個階段最先撞到的約束。這也解釋了為什麼今天很難再用一種Attention機制定義一家公司的路線。真正決定選擇的,是模型下一步要處理什麼任務,什麼成本已經不能繼續接受,以及團隊願意為能力上的確定性付出多少代價。GLM-5.3-Flash裡KDA和DSA同時出現,記錄下來的也不是哪一條路線最終贏了。它更像一個結果:當具體技術越來越容易被驗證、吸收和重新組合,所謂“路線”正在從對某一種架構的長期押注,變成一家公司對約束變化的持續判斷。技術會擴散,也會被重新組合。真正沒有那麼容易被複制的,是一家團隊判斷下一堵牆會出現在哪裡。參考資料:1.

晚點聊 LateTalk 104:《我給線性注意力找“金主”,字節 say No,MiniMax say Yes》2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。

0人收藏 分享: 相關文章 ai 大模型 attention 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...從 Dreamore 到 CreaXene:AI 生成工具正在走向創作 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.

1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!最新文章 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題 GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!

我們讓 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一臺機器人:誰真的把活幹完了?拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是同一種產品 熱門搜索 安防 App Store 智能汽車 工信部 Nest itunes 槽點 AI教育 創客馬拉松 吉利 東芝

Related

相關文章

鈦媒體生成式AI

Muse爆火,大廠急了

定焦One2026.09.30 16:10 · 來自北京全文5358字00:00 / 15:54中國版Muse,是不是妄想? 文 | 定焦One(dingjiaoone),作者 | 王璐,編輯 | 魏佳Muse的挑戰者,還在不斷增加。北京時間9月30日凌晨,OpenAI在開發者大會上發佈了個人Agent產品Dots,每個Dot運行在獨立雲端電腦上,通過ChatGPT的插件生態接入4000多款應用,能在後臺主動跟進任務,還能通過短信、Slack、Teams觸達用戶。業界普遍把這看作是OpenAI對Meta的正面回應。

剛剛
雷峰網生成式AI

從海拉魯到現實世界:視頻模型如何理解「變化」

本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。

剛剛