Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?

本文作者: 李娜 2026-09-30 15:45 導語:大模型 Attention 路線變遷:從分流到重組。大模型 Attention 路線變遷:從分流到重組。作者丨李娜 編輯丨岑峰 一張大模型架構圖裡,同時出現了 Kimi 和 DeepSeek 的影子。GLM-5.3-Flash項目配置文件:45層架構中,34層採用Kimi路線的KDA線性注意力,另外11層採用DeepSeek路線的KPool-DSA稀疏注意力今年以來,大模型架構裡出現了一條越來越清晰的變化:一些混合注意力架構中原本由全局Attention承擔的角色,開始被Sparse Attention(稀疏注意力)接替。
要理解這個變化,得先回到 Attention 本身。Attention解決的是一個基礎問題:模型處理當前token時,能不能在越來越長的歷史裡,找到真正有用的信息。大致來看,目前常見的Attention機制可以理解成三類:全局注意力(Full / Global Attention)直接讀取完整的token歷史,信息保留最充分,但計算和緩存成本也最高;線性注意力(Linear Attention)把歷史壓縮進更緊湊的狀態,以降低長序列的計算成本;稀疏注意力(Sparse Attention)則保留更完整的歷史,只選擇其中一部分重要信息參與計算。
過去幾年出現的很多高效注意力(Efficient Attention),主要就在後兩種方向上繼續演化。最開始,經典 Transformer 主要使用 Full Attention,Full Attention讓模型可以直接訪問完整的token級歷史,代價是計算和KV Cache隨上下文迅速增長。連帶著訓練和推理成本也隨之大幅增加。過去幾年,大家對 Attention 的改造,本質上都是在能力和成本之間找平衡。於是,作為折中方案的混合注意力架構逐漸流行起來:不同機制被放進同一套模型裡分工,高效Attention負責降低成本,少量全局Attention保留直接訪問完整歷史的機會。
從不同Attention路線,看大模型公司的選擇到了今年,很多混合注意力架構裡由全局Attention承擔的角色,開始出現被Sparse Attention接替的跡象。8月發佈的Qwen3.8-Flash-Next就是一個很清楚的例子。它延續此前三層 Gated DeltaNet 配一層 Attention 的結構,但那一層原本負責全局精確讀取的 Attention,被進一步改造成了 Qwen Sparse Attention這樣的高效注意力機制。(此前,我們也對 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 做過詳細實測,可參見https://mp.weixin.
qq.com/s/HxJhiH0O1etsHoH_X1J5VQ) (公眾號:) Qwen3.8-Flash-Next 架構圖:每四層裡,三層是 GDN,一層是 QSA為什麼那層一直被認為無法替代的全局 Attention,也開始有人嘗試用另一種高效機制接替?如果具體的 Attention 技術正在變成可以流動和重組的零件,我們今天所謂一家模型公司的“技術路線”,到底還指什麼?
01MiniMax最後還是留下了Full Attention要回答這個問題,可以看看MiniMax過去幾年的架構變化,幾乎完整經歷了這一輪反覆:從押注線性注意力,到保留少量全局注意力做混合注意力,再回到全局注意力,後來又轉向稀疏注意力。每一次變化背後,都對應著模型Scale以後新暴露出來的問題。2023年底,後來主導過MiniMax-01網絡架構設計的鐘怡然正在給Linear Attention找一家願意真正把它Scale Up的公司。他從2021年開始研究這條路線,此前最大的實驗模型已經做到15B。
在他看來,Linear Attention在建模效果和運行效率上的幾個主要問題已經基本解決,真正剩下的問題只有一個:它被放大到幾百B參數以後,還能不能成立?這個問題已經不是研究團隊自己可以回答的了。預訓練一個幾百B參數的大模型,架構一旦確定,數據、算法、訓練系統和工程資源都會跟著轉向。鍾怡然此前也接觸過其他公司,最終在2023年底和閆俊傑的一次交流後,MiniMax決定把這條還沒有經過大規模驗證的路線接下來。雙方對這件事的把握其實並不一樣。鍾怡然後來回憶,作為長期研究Linear Attention的人,他當時覺得成功概率接近99%;但站在閆俊傑的位置上,他估計這個數字只有大約一半。
一旦把Linear作為下一代主模型的架構,MiniMax超過80%的研發資源都會被捲進來。一家大模型公司要用絕大多數研發資源,去驗證一件只有五成把握的事。MiniMax創始人閆俊傑,圖源網絡早期實驗一度讓這場下注顯得沒有那麼危險。團隊曾經訓練過一版15B左右的純Linear模型,效果已經可以接近Transformer,似乎說明這條路線可以繼續往上Scale。但模型進一步放大後,問題開始暴露出來。Linear Attention為了降低長上下文的計算成本,會把歷史信息壓縮進更緊湊的狀態裡,而在檢索這類需要從很長文本中準確找回某個細節的任務上,這種壓縮會出現問題。
Linear Attention省下計算的關鍵,在於它不會一直保存並重新讀取每個歷史token,而是把過去的信息不斷壓縮進有限的狀態裡。這樣做很像把一本書邊讀邊做筆記:記住主題和大意很高效,但如果幾百頁以後突然問“第37頁某句話具體寫了什麼”,壓縮過的筆記未必還能完整還原。MiniMax原本希望把Linear做得更徹底,最後還是把Full Attention加了回來。後來MiniMax-01採用的7:1 混合注意力架構由此出現:每7層Lightning Attention之後,加入1層傳統SoftMax Attention。
大部分計算交給更便宜的Linear Attention,但模型隔一段仍然獲得一次直接讀取完整上下文的機會。這個比例是在不同層數和組合之間反覆實驗後找到的折中。鍾怡然後來把混合注意力形容成一種“保底方案”。可是,15B模型給出的信號仍不足以支撐一輪4560億參數的正式訓練。在真正開跑MiniMax-01之前,團隊做了大約3700次預訓練實驗,不斷改變模型大小、架構和參數組合,再從這些相對便宜的小實驗中判斷Scaling Law是否還能繼續成立。2024年中,MiniMax最終開始訓練4560億參數的MiniMax-01。
到2025年1月模型發佈時,7層Lightning Attention加1層Full Attention的架構被正式保留下來,上下文長度也被推到了400萬token。MiniMax花了數千次實驗和一輪大規模預訓練,最後仍然沒有把那層Full Attention拿掉。它恰恰解釋了為什麼在後來很長一段時間裡,混合注意力 Attention雖然越來越常見,卻往往仍要保留少量全局Attention。而MiniMax很快還會第二次碰到這個問題。02Scale之後,混合注意力又暴露了新問題模型繼續Scale以後,第二輪問題出現了。這一次是更復雜的多跳推理問題。
當模型需要經過多箇中間步驟,把前面的條件、推導和結論重新串起來時,混合注意力開始出現比Full Attention更明顯的能力損失。問題暴露以後,團隊重新設計測試和訓練方法,小規模實驗裡,混合注意力又可以追上Full Attention。真正讓MiniMax猶豫的也因此不再是這個具體缺陷,而是另一件事:這次的問題可以找到、可以修,下一次還沒有被發現的問題在哪裡?Text-01時期使用的Benchmark,並沒有提前暴露後來的多跳推理差距。即使團隊為這個問題補上新的測試,也無法證明在更大的模型和更復雜的任務上,不會繼續出現新的能力缺口。這意味著,混合注意力真正的風險是未知能力損失無法被提前窮盡。
MiniMax官網技術博客截圖所以到了M2,MiniMax重新採用了Full Attention。相比繼續押注一個可能在更大Scale上暴露新問題的架構,Full Attention雖然更貴,但它的能力邊界和工程行為更可預期。這也是Full Attention長期很難從混合注意力架構裡徹底消失的原因:它留下來的價值,很大一部分來自對未知能力風險的兜底。但到了下一階段,Agent又重新改變了這筆賬。03Agent重新放大了Full Attention的成本M2回到Full Attention之後,MiniMax並沒有在那裡停太久。
2026年6月發佈的M3重新離開Full,轉向自研的MiniMax Sparse Attention(MSA)。這一次,變化來自於模型要處理的任務。Text-01時期,長上下文更多意味著一次性讀進更多材料:一本書、一份報告,或者幾十萬token的文檔。到了Agent階段,上下文開始變成一段不斷增長的工作歷史。搜索結果、網頁、代碼、工具返回、報錯和中間結果,會隨著任務一輪輪執行不斷累積。一個Agent可能工作幾十輪甚至更久,前面發生過的事情又不能輕易丟掉。這讓Full Attention的另一面越來越難忽視。
M2時期,MiniMax最擔心的是高效Attention可能帶來的未知能力損失,因此寧願接受Full Attention更高的成本。但到了M3,長程Agent開始把這筆成本不斷放大:歷史越長,每一輪需要處理的信息越多,計算和KV Cache都會繼續增長。MiniMax在M3發佈時把“Context Scaling”直接列為解決複雜Agent任務的核心問題,並重新從Attention架構動手。最終採用的MSA不再讓每一步都處理完整歷史,而是先從長上下文中篩出真正需要參與Attention計算的部分。官方數據顯示,在100萬token上下文下,M3單token計算量約為上一代模型的1/20。
於是,MiniMax幾年的路線看起來像是繞了一圈:Text-01用Linear降低長上下文成本,同時留下Full Attention兜底;M2因為Scale後暴露出的能力風險,重新回到Full;到了M3,Agent又把長上下文成本推到前臺,於是團隊再次尋找Full Attention之外的方案,只是這一次選擇了Sparse。M2時,MiniMax願意用更高的計算成本換能力上的確定性;到了M3,Agent讓這份“確定性保險”的價格變得越來越高。04Linear和Sparse被放進同一個模型MiniMax重新走向Sparse時,類似的變化已經開始在其他模型裡出現。
過去很多混合注意力架構雖然引入了更高效的Attention,最後仍會保留少量全局Attention。到了2026年,這個結構開始鬆動。2月發佈的MiniCPM-SALA直接把Lightning Attention和Sparse Attention放到了一起;到了8月,Qwen3.8-Flash-Next延續此前三層Gated DeltaNet配一層Attention的結構,卻把負責精確檢索的那部分進一步改成了Qwen Sparse Attention。這個變化在Qwen身上尤其清楚。三比一的結構沒有變,變的是那一層“兜底”的方式。
過去由全局Attention直接讀取完整歷史,現在開始交給Sparse Attention,從長上下文中篩出真正需要的信息。到了GLM-5.3-Flash,類似的組合再次出現:45層模型中,34層採用KDA,另外11層採用KPool-DSA。過去分別由Kimi和DeepSeek推進的Linear與Sparse路線,被放進了同一套模型。Linear和Sparse之所以能夠放在一起,恰好因為兩者解決的是不同的問題。Linear擅長用較低成本維持一段很長的歷史,卻不擅長隨時恢復其中某個具體細節;Sparse保留token級歷史,但每次只讀取其中一小部分。
前者更像負責“記住整體狀態”,後者負責“需要時回去查具體內容”。這也是為什麼兩種過去看起來彼此競爭的方案,後來開始出現在同一套架構裡。三個模型的實現並不相同,但它們指向了一個共同變化:Attention架構正在從尋找一種更好的機制,走向讓不同機制承擔不同的工作。Linear或Recurrent Attention負責以更低成本維持長曆史,Sparse Attention負責在需要時從中找回更具體的信息。過去被當作不同路線討論的Linear、Sparse和Full,正在變成同一個架構設計空間裡的不同選項。05技術開始越過公司的邊界這種組合越來越容易發生,也和過去幾年技術擴散的方式有關。
2024年,長期研究線性注意力的楊松琳開始維護線性注意力開源社區FLA。她後來回憶,FLA從一開始就不只是為了發佈論文,而是希望把Linear Attention變成真正可以複用的基礎設施:算法之外,接口、kernel和具體實現也一起開放。後來Kimi推進KDA時,也從這個社區吸收了核心貢獻者。技術因此不再只跟著論文流動。代碼、社區和研究人員,把一項架構創新帶出了最初提出它的團隊。到2025年底,楊松琳在討論Linear Attention下一步時,已經提出過一個當時還很激進的方向:既然Linear在精確檢索上仍有缺口,是否可以直接和Sparse結合,讓兩種機制各自處理不同的問題。
她當時舉出的例子,就是Kimi的KDA和DeepSeek的DSA。不到一年,這種設想已經出現在真實模型裡。這也讓“技術路線”越來越難簡單地和某一種Attention機制綁定。過去人們習慣說MiniMax做Linear、DeepSeek做Sparse、Kimi做KDA;但當代碼可以開源、人員可以流動、已經被驗證過的技術可以迅速進入另一家公司的模型,這些標籤的有效期會越來越短。真正拉開差距的,也越來越不是“有沒有某項技術”,而是什麼時候採用它、怎樣和其他技術組合,以及願意在能力、成本和工程風險之間做什麼取捨。
06尾聲:路線沒有消失再回到開頭那張架構圖,Kimi和DeepSeek的名字同時出現在GLM-5.3-Flash裡,已經沒有那麼反常了。過去幾年,人們習慣用Linear、Sparse、Full Attention來區分不同公司的技術路線。但MiniMax幾次看似反覆的選擇,其實已經說明,這種劃分越來越難解釋真實的大模型研發。做Text-01時,MiniMax最先看到的是長上下文帶來的成本,於是押注Linear;模型繼續Scale以後,未知的能力損失變得更危險,M2因此重新回到Full;到了Agent階段,不斷增長的工作歷史又把計算成本推到前臺,M3再次轉向Sparse。
技術沒有突然變好或變壞,變化的是每個階段最先撞到的約束。這也解釋了為什麼今天很難再用一種Attention機制定義一家公司的路線。真正決定選擇的,是模型下一步要處理什麼任務,什麼成本已經不能繼續接受,以及團隊願意為能力上的確定性付出多少代價。GLM-5.3-Flash裡KDA和DSA同時出現,記錄下來的也不是哪一條路線最終贏了。它更像一個結果:當具體技術越來越容易被驗證、吸收和重新組合,所謂“路線”正在從對某一種架構的長期押注,變成一家公司對約束變化的持續判斷。技術會擴散,也會被重新組合。真正沒有那麼容易被複制的,是一家團隊判斷下一堵牆會出現在哪裡。參考資料:1.
晚點聊 LateTalk 104:《我給線性注意力找“金主”,字節 say No,MiniMax say Yes》2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。
0人收藏 分享: 相關文章 ai 大模型 attention 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...從 Dreamore 到 CreaXene:AI 生成工具正在走向創作 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.
1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!最新文章 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題 GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!
我們讓 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一臺機器人:誰真的把活幹完了?拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是同一種產品 熱門搜索 安防 App Store 智能汽車 工信部 Nest itunes 槽點 AI教育 創客馬拉松 吉利 東芝
Related
相關文章

OpenAI與紅帽等聯合推進OCE1.0研發,打造面向AI代理的“企業級Kubernetes”
該項目最初由 OpenAI 內部發起,現已捐贈給 OpenClaw 基金會統籌。OpenClaw 最初由開發者 Peter Steinberger 創建,是最早利用大模型實現郵件分析回覆與日程預約等自動化任務的代表性個人 AI 代理工具,Steinberger 此後也加入 OpenAI 負責個人代理項目。

對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回
本文作者: 李娜 2026-09-30 16:13 導語: AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。作者丨吳海明 曹PP 編輯丨李 娜 免費的 AI Coding Agent,能不能和付費 Codex 在真實工程任務裡打得有來有回?

Muse爆火,大廠急了
定焦One2026.09.30 16:10 · 來自北京全文5358字00:00 / 15:54中國版Muse,是不是妄想? 文 | 定焦One(dingjiaoone),作者 | 王璐,編輯 | 魏佳Muse的挑戰者,還在不斷增加。北京時間9月30日凌晨,OpenAI在開發者大會上發佈了個人Agent產品Dots,每個Dot運行在獨立雲端電腦上,通過ChatGPT的插件生態接入4000多款應用,能在後臺主動跟進任務,還能通過短信、Slack、Teams觸達用戶。業界普遍把這看作是OpenAI對Meta的正面回應。

從海拉魯到現實世界:視頻模型如何理解「變化」
本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。

GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!
本文作者: 李娜 2026-09-30 15:50 導語:網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。作者丨李娜 編輯丨岑峰 北京時間9月4日凌晨,OpenAI正式發佈了新一代旗艦模型GPT-6 Astra。

虧損超80億、算力承諾546億:Anthropic招股書揭開大模型頂流的真實賬本
數據顯示,公司2025年營收同比增長12倍至近46億美元,近三分之二來自美國市場,但同期運營虧損亦翻倍突破80億美元。在商業化結構上,Claude模型以用量計費為主導,貢獻約38億美元收入,訂閱業務僅實現7.89億美元(佔比不足20%)。招股書清晰顯現出其對頭部科技巨頭的深度綁定:2025年,Anthropic通過亞馬遜和谷歌雲平臺斬獲21.