像素級對標?智譜、Kimi 底層參數「撞衫」背後,藏著線性注意力的黃金窗口
國產大模型內捲到算子底層。作者丨高允毅 編輯丨岑 峰 昨晚,智譜 AI 認領了最近一週在 OpenRouter 盲測榜上風頭最盛的“牛來”模型,正式命名GLM-5.3-Flash。這款上線首日就登頂 OpenRouter 調用量榜單,刷新全網長文本性價比斬殺線的國產模型,在底層架構上展現出“集百家之長”的特質。它採用了混合架構,將 DeepSeek 的稀疏注意力機制(NSA) 與 Kimi 賴以成名的線性注意力機制結合 ,再疊加DeepSeek的流形約束超連接(mHC)技術,可以大幅降本提效。今天早上,月之暗面核心研究員、“注意力殘差”論文作者陳廣宇,仔細研究了 GLM-5.
3-Flash 的模型配置文件後,貼出一張 Kimi K3 和 GLM-5.3-Flash 的底層代碼對比圖。他發現兩者不僅都採用了 KDA 線性注意力,排布邏輯高度重合,連核心參數“遺忘門下界”(gatelowerbound) 同樣是 - 5。從 Kimi K3 公開技術報告到智譜上新,還不到一個月。有人感嘆:哪怕是參考了 Kimi 的公開參數,短短 20 天內就能推出這麼強的模型,也太驚人了。這背後其實是一種技術必然。在大模型長文本的深水區,KDA,尤其是它的核心參數,一直是實現“長記憶”和“訓練穩定性”的關鍵。線性注意力發展到今天,數值穩定的最優區間本就極度狹窄。
即便是頂尖團隊各自獨立試錯,最終也往往會收斂到同一個數值。-5數值背後,既是Kimi K3在開源領域的巨大輻射力,也揭開了中國最頂尖的大模型團隊,正不約而同邁進了同一個底層算子優化的技術深水區。01KDA的核心參數,為什麼都選擇-5?為什麼兩家頂尖大模型團隊,會不約而同地把 KDA 的核心參數設為 -5?要解答這個問題,得先搞懂大模型在長文本賽道經歷了什麼。過去,傳統 Transformer 架構用的是 Softmax 注意力機制,它保留了大模型的完整記憶。
大模型會把每一個 Token 都存進 KV 緩存,隨著對話拉長,計算量會呈平方級()暴漲,KV 緩存的顯存佔用也隨上下文長度線性攀升,當上下文拉到百萬級別,光 KV 緩存就能吃掉幾十 GB 顯存,推理成本高到無法商業化。為了把成本打下來,行業開始轉向“線性注意力”路線。月之暗面的 KDA 正是其中代表。它不再保存全量 KV 緩存,而是用一塊固定大小的狀態矩陣壓縮歷史信息,模型一邊寫入新內容,一邊用一個名為 “遺忘門” 的組件來控制舊信息的衰減。這樣無論後續湧入多少文本,佔用的顯存基本保持恆定。這也是近期百萬級長文本 API 能賣出“白菜價”的底層邏輯。
但這套 “壓縮記憶”的模式 也有自己的天然缺陷,那就是數值溢出。線性注意力靠循環乘法來更新狀態,當它每處理一個新 Token,舊狀態就要乘一次遺忘門係數。當上下文越來越長,乘法次數多了,數值要麼不斷變小直到徹底歸零,要麼反向暴漲成無窮大。這個過程,只要算出一個錯誤結果(NaN),訓練直接崩潰,千萬級算力直接打水漂。這就是線性注意力過去沒有被廣泛使用的原因。這個瓶頸卡了很多年,直到一個名叫楊松霖的哈佛博士生,發表門控線性注意力(GLA)論文,系統提出門控狀態衰減方案,這一問題才有了系統性的學術解決思路。他首次系統提出必須給狀態衰減設一個“下限”,不允許它無限趨近於 0。
但從學術成果到大規模工業落地,仍有不少問題。當月之暗面(Kimi)團隊基於 GLA 演進出自研的 KDA 架構,試圖將上下文推向 100 萬字時,直接撞上了底層芯片的物理極限。在大規模預訓練中,萬卡集群普遍使用的是 fp16 或 bf16 半精度浮點數,其數值動態範圍極其狹窄。而線性注意力需要對超長序列進行數萬次循環累乘,在這種遞推計算中,任何微小的數值發散,都會在半精度芯片的反覆乘法中被迅速放大。最終觸發 NaN(非數)崩潰,導致高昂的訓練算力成本折損。
為了規避這種因數值不穩定帶來的算力風險,Kimi 的底層架構團隊直接下潛到硬件算子層,在自研的 FlashKDA CUDA 內核裡,設定 gatelowerbound = -5。-5 經過激活函數轉換後,大約對應 0.67% 的留存率。這意味著,哪怕模型決定遺忘某段信息,也會被強制保留 0.67% 的舊信息。至於為何是 - 5 這個數值,這是靠海量工程試錯找出的黃金平衡點。如果設得太高,比如設在 - 3,對應的留存比例約為 5%,舊信息在矩陣中過度堆積,會導致網絡過載、梯度爆炸或上下文混雜幻覺。如果數值太低,比如設在 - 8,對應留存比例僅約 0.
03%,模型會出現嚴重的 “健忘症”,長文本讀到後面就忘記前面的關鍵信息,在長代碼調試、長財報分析等需要精準召回的任務直接失效。-5 恰好卡在中間。在預訓練中,它為算子底層的穩定性“保駕護航”;在推理端,它則是性價比之王,讓線性注意力機制得以在極低的顯存開銷下穩住長文本召回率,使百萬級長文本的商業化落地真正成為可能。02同樣是 -5,Kimi和智譜又走出不同的路但同樣選擇 - 5 的遺忘門下界,對於Kimi 和智譜又是不同的意味。
對於Kimi K3而言,它採用的是混合注意力架構,用線性注意力承接長上下文的記憶壓縮,把顯存和推理成本打下來;同時,它也用傳統 Softmax 注意力,處理複雜邏輯推理,保證核心能力不打折。在這套架構裡,gatelowerbound=-5從預訓練啟動的第一天就已嵌入,是原生設計的一部分。這個數值是 Kimi 團隊在自身萬卡級預訓練中,通過大量試錯踩出來的穩定解。這些都在Kimi K3公開技術報告裡體現了出來,底層算子怎麼實現、配置怎麼設、工程上踩過哪些坑,全部公開。而智譜 GLM-5.
3 Flash 的配置文件中,雖然出現了完全一致的 gatelowerbound=-5,但陳廣宇猜測這很有可能是“中途注入”。這種操作在工程邏輯上完全成立,甚至是很高明的策略。在預訓練中後期追加門控約束,再用調低後的學習率續訓一段時間,不需要推倒重來重置權重,就能讓一個原本就在相近區間摸索的模型,快速對齊行業驗證過的最佳實踐。這種打法省下的是動輒數億的底層試錯算力,體現的是智譜極強的工程落地效率。
當然這並不意味著僅靠改一個數字就能迭代出新模型,智譜本身在線性注意力方向已有數月研發積累,更合理的邏輯是,團隊原本就在相近區間內做實驗,看到 Kimi 報告明確驗證了 - 5 在大參數量級下的穩定性後,直接採用了這一經過工業驗證的最佳實踐,省去了大量重複試錯的成本。那麼,中途加入這樣一個底層約束,到底會不會影響模型的實際表現?評論區有一位開發者Oliver Sieberling認為,這屬於 “非侵入式改動”。遺忘門本身是模型自適應學習的結果,加一個下限只是卡住了極端取值,並不會改變遺忘門本身的學習目標,對模型主體的擾動極小,更像加了一道安全護欄,性價比很高。
但這一取捨也有一定的風險,比如隱性分佈偏移的危害。模型經過幾千萬步預訓練,已經形成了 “遺忘門可以調到極低” 的內在行為模式,中途突然鎖死下限,相當於半路修改了底層運行規則。表面上看訓練損失、公開基準跑分都正常,但模型內部的記憶分佈其實已經悄悄發生了偏移。這種偏移很難通過常規測試發現,但在 50 萬字以上的超長代碼、超長文檔這類極端長尾場景中,可能會因為殘留信息持續累積出現 “慢性中毒”,產生一些邏輯錯誤。事實上,在長文本底層優化這條賽道上,並非只有這一條路線。國內另一家頂尖玩家 DeepSeek,就走出了完全獨立的技術路徑。
他們沒有采用 Delta Rule 譜系下的 - 5 門控方案,而是沿著自研的 MLA(混合潛在注意力)與 NSA(原生稀疏注意力)持續演進,通過低秩壓縮和硬件級算子優化,在另一套數學框架裡實現了長序列的數值穩定。為什麼中國最頂尖的大模型團隊,都集體下潛到算子層,死磕長文本的底層計算瓶頸?答案藏在大推理模型時代的算力賬本里。自 o1 與 DeepSeek-R1 開啟強化學習大推理時代以來,模型在後臺進行深度推導時需要自主生成幾十萬字的“思維鏈(CoT)”Token。如果還固守傳統 Transformer 平方級增長的算力成本,超長思維鏈帶來的顯存黑洞,會直接吞掉任何一家公司的商業毛利。
誰能用線性的成本守住長文本的體驗底線,誰就能在推理時代拿到最高的利潤空間。而當行業都在相近的模型規模、相近的訓練框架下做超參搜索時,基於 Delta Rule 的線性注意力,其數學收斂的物理極限區間,天然就指向這個窄小的黃金帶。從這個角度看,參數 “撞衫” 從來不是抄襲的佐證,而是行業集體挺進技術深水區時,必然會出現的技術趨同。03參數戰之後,是品味、效率與創新的真正較量回到最初的問題:智譜有沒有“參考”Kimi的參數?在“exe文件比txt文件重要”的工業界,這個問題其實已經不重要。
大語言模型的技術日新月異,如果一直固守傳統Transformer架構,在強調只講究數學規律和商業ROI的產業界完全行不通。-5這個參數,不是屬於誰的專利,而是在攀登技術高峰中,目前唯一一條被探明、不會摔得粉身碎骨的安全道路。當大模型公司的競爭下沉到算子優化、數值邊界、訓練工程細節這些看不見的底層功夫。參數戰之外,還有品味戰、效率戰、創新之戰。這本身就是行業成熟的信號。任何經受住萬卡集群實戰檢驗的“最佳實踐”,都會在最短的時間內淪為行業的通用基建。這也解釋了為什麼國產大模型在長文本處理與超低成本推理上,能在極短時間內逼近甚至斬落國際頂尖閉源模型的身位。
因為在極致的算力壓迫下,中國最頂尖的頂尖大腦,正在以一種驚人的敏捷度,最終都會不約而同地攀上統一做山峰的極頂,向物理極限不斷髮起挑戰。參考鏈接:https://x.com/nathancgy4/status/2092626984362725877https://x.com/Zai_org/status/2092616204787626030上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

OpenAI 將向印度 ChatGPT 免費及 Go 套餐用戶投放廣告
作者:清源 責編:清源 評論: 8 月 27 日消息,OpenAI 宣佈,即日起將在印度向 ChatGPT Free 和 Go 套餐用戶投放廣告。本月早些時候,OpenAI 修改了服務條款,明確說明用戶在使用 ChatGPT 時可能看到廣告。

谷歌推出全球首個雙盲 AI 評估技術,基於加密環境保障基準測試公正性
作者:小泵 責編:小泵 評論: 8 月 27 日消息,谷歌宣佈推出全球首個針對前沿專有 AI 模型的雙盲評估,將外部評估限制在加密“黑箱”環境中,避免模型提前獲取測試信息來優化性能。就像學生考前不能提前看到試題才能真實反映水平一樣,當前 AI 模型評估也面臨同樣問題:如果模型提前接觸測試題目(注:也就是所謂的“基準汙染”),評估結果的可信度就會大打折扣。

ChatGPT報警後:誰有權審判你的對話框?
ChatGPT等生成式AI若在對話中偵測到潛在威脅,是否應主動通報執法單位,引發各界討論。支持者認為AI應承擔社會責任即時阻止憾事,反對者則擔憂語言模型易誤判玩笑與反諷,恐侵犯隱私和言論自由。目前缺乏明確法律框架界定AI舉報義務與責任歸屬,未來或需建立分級制度,由人類專業人員最終判斷。

HBM正在被重新定義
半導體產業縱橫2026.08.27 18:25 · 來自北京全文3679字00:00 / 11:37新一代HBM4將成為技術轉折點。文 | 半導體產業縱橫隨著AI大模型訓練與推理需求持續爆發,算力芯片的性能瓶頸已從計算單元轉向存儲帶寬,HBM高帶寬內存成為制約高端AI硬件迭代的核心關鍵。在HotChips 2026國際高端芯片技術大會上,全球兩大存儲龍頭三星、SK海力士集中披露了HBM4下一代技術演進路線,打破了行業沿用多年的HBM迭代邏輯。

Day-0 支持:摩爾線程官宣完成智譜 GLM-5.3-Flash 極速適配
作者:歸瀧 責編:歸瀧 評論: 感謝網友 Autumn_Dream 的線索投遞!8 月 27 日消息,智譜近日上線並開源 GLM-5.3-Flash (320B-A18B)。摩爾線程官方今日宣佈,基於 AI 訓推一體智算卡 MTT S5000 及 MUSA 軟件棧,Day-0 支持,實現了對該模型的極速適配與高效運行。

泰康發佈養醫大模型1.0:以人工智能賦能養老產業發展
廣角觀察2026.08.27 18:06 · 來自北京全文1667字讓科技更好服務人民健康、服務美好生活、服務健康中國建設。2026年8月22日,在泰康保險集團成立30週年之際,泰康正式發佈養醫大模型1.0。面向長壽時代日益增長的健康養老需求,泰康依託多年醫養產業實踐,推動人工智能與醫療、養老、康復、護理、健康管理等真實場景深度融合,探索以科技創新提升養醫服務質量和效率,為健康中國建設貢獻產業實踐。