至知研究院提出大模型可解釋性新路線:拆權重,數據成本不到1%

一個已經訓練好的模型,研究者往往需要先訓練一套新的稀疏表示。Transcoder、稀疏特徵模塊等方法會學習一組新的內部單元,用它們近似原模型某一層或某個模塊的計算,再通過保留、移除這些單元來尋找任務迴路。這些方法推動了機制可解釋性的發展,但也帶來了一筆不小的額外成本:新的表示需要數據和優化,而且一旦替代模塊沒有充分復現原模塊,後續分析就可能同時解釋模型行為和替換誤差。說白了,研究者想打開一個黑箱,卻往往需要先訓練另一個“小黑箱”。問題不只是訓練成本。任務迴路需要找到一組可以獨立干預的內部計算:只保留它們時,相關能力仍然存在;移除它們時,模型表現則明顯下降。
訓練型替代表示通常還需要針對不同模型、層和checkpoint分別擬合,使大規模、系統性的迴路分析更加困難。更理想的方案應當同時保持原模型行為、提供可獨立干預的單元,並能以較低成本直接從已有權重中構造。至知創新研究院(IQuest Research)與Safe AI Forum、牛津大學、斯坦福大學、清華大學的合作者提出了一條更直接的路線: 不再訓練一套獨立替代網絡,而是從現有的預訓練權重中直接“拆”出可干預單元。這套方法名為稀疏權重分解(Sparse Weight Decomposition,SWD)。
它把一個稠密權重矩陣分解為兩個稀疏矩陣,並把二者共享的中間維度變成可獨立評分、選擇和消融的瓶頸單元。研究者由此可以直接在權重上抽取任務迴路。論文給出了三個值得關注的結果: 在匹配替換保真度的單矩陣實驗中,SWD使用的數據不到Transcoder等訓練型基線的1%; 在GPT-2、Qwen2.5和Qwen3.5-27B的任務迴路實驗中,SWD通常以更少的瓶頸單元和活躍連接達到相同的充分性、必要性目標; 方法不僅擴展到了27B模型,還覆蓋了GPT-2 Small全部48個注意力和MLP權重矩陣,並提供了完全不需要校準文本的zero-data版本。論文地址:https://arxiv.
org/abs/2608.03913 △SWD方法概覽。預訓練模型中的稠密權重被分解為兩個稀疏因子,共享中間座標成為可獨立評分、選擇和消融的瓶頸單元。直接把權重拆成“稀疏路徑” SWD的出發點很簡單。對於預訓練模型中的稠密權重矩陣W,尋找兩個稀疏矩陣A和B,使得 W ≈ AB.A和B共享m箇中間維度。第i個維度先通過A的第i列從輸入中讀出一個標量,再通過B的第i行寫向輸出。這樣,一列和一行共同構成一個瓶頸單元,也就是一條固定的rank-one讀寫路徑。可以把它想象成在一張極其密集的交通網絡中增加一組“中轉站”:每個中轉站只連接少量入口和出口。
研究者不僅可以看到一條路徑從哪裡讀取、向哪裡寫入,還可以單獨關閉它,觀察模型行為會發生什麼變化。真正困難的地方,是如何在大幅減少連接的同時,仍然保留原權重對模型激活的作用。SWD使用少量校準文本產生的層輸入,優化分解前後的輸出誤差;求解過程中交替更新兩個因子,通過硬閾值維持非零預算,並重新擬合保留下來的權重值。分解完成後,每個瓶頸單元都可以像稀疏特徵一樣參與任務歸因、排序和消融,但不需要再訓練一套獨立的神經替代網絡。△從權重分解到迴路抽取。Step 1將稠密權重分解為稀疏因子A和B;Step 2按任務歸因對瓶頸單元排序,並選擇top-k單元組成任務迴路。已經有SVD,為什麼還需要SWD?
既然目標是直接分解權重,一個自然的問題是:為什麼不直接使用奇異值分解(SVD)?SVD同樣可以把一個矩陣表示為rank-one成分之和,而且不需要訓練數據。近期的NaNA等方法也已經證明,SVD成分可以用於任務排序和干預。但對迴路分析而言,單元數量少,並不等於真正的計算路徑少。SVD成分的讀方向和寫方向通常都是稠密的。即使只保留少數成分,它們仍可能連接幾乎所有輸入和輸出維度。SWD則進一步把稀疏性施加到每個單元的讀寫連接上:少量單元對應的同時也是少量活躍連接。
團隊還構造了兩個能夠精確還原GPT-2原權重的稠密對照:保留全部奇異值的full-rank SVD,以及採用隨機正交基的Random-B。兩種分解都能在數值上精確復現原矩陣,但在相同的歸因和消融流程下,需要更多活躍連接才能達到與SWD相同的任務表現。這組對照表明,SWD的優勢並不是“把矩陣拆開”這麼簡單,真正關鍵的是每個單元都具有稀疏的讀寫結構。△精確稠密分解對照。Full-rank SVD與Random-B都能精確還原原始權重,但需要比SWD更多的活躍連接才能達到相同的充分性或必要性要求。
不到1%的數據,仍能保持模型行為 在進行迴路分析之前,首先要回答一個更基礎的問題:把原權重換成稀疏分解之後,模型還是原來的模型嗎?團隊使用留出文本上的交叉熵差值(CE delta)衡量替換保真度,並使用KL散度和替換位置的激活重構誤差進行補充驗證。CE delta越接近0,說明替換後的模型行為越接近原模型。在GPT-2 Small第8層mlp.cproj的單矩陣實驗中,SWD僅使用數千個校準token就進入低CE誤差區間;Transcoder和VPD-Recon-CI等訓練型基線則需要約10⁶量級的optimizer-replay token才能接近這一替換質量。
同樣的趨勢隨後出現在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上。綜合論文中的單矩陣比較,在達到匹配替換保真度時,SWD使用的數據不到訓練型替代表示的1%。這意味著,大量數據和長時間替代模塊訓練並不是獲得高保真迴路單元的必要前提。直接從預訓練權重出發,也可以構造足夠忠實的干預表面。△GPT-2 Small單矩陣替換的CE delta隨數據量變化。SWD使用少量校準數據即可進入低誤差區域。△Qwen2.5-3B與Qwen3.5-27B的單矩陣替換結果。橫軸為構造替換表示所使用的token數,縱軸為相對稠密模型的CE delta。
保留時能支撐任務,移除時會破壞任務 高保真地復現原矩陣,只能說明所有瓶頸單元合在一起能夠工作。真正的迴路還必須滿足兩個更嚴格的條件:只保留少量選中單元時,任務行為仍然存在;只移除這些單元時,任務表現會明顯下降。前者是充分性測試,後者是必要性測試。團隊先在獨立訓練劃分上使用一階任務歸因對候選單元排序,再構造從top-1、top-2到top-k的嵌套迴路,並在留出測試集上評估。迴路成本同時使用兩種口徑衡量:選中了多少瓶頸單元,以及這些單元實際包含多少非零讀寫連接。
在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四項任務上,SWD達到相同充分性或必要性要求時,通常需要比Transcoder和VPD-Recon-CI更少的單元和活躍連接。把平均激活消融替換為零消融之後,這一優勢依然保持。這一結果也擴展到了Qwen2.5和Qwen3.5-27B。換句話說,SWD得到的不只是一種低誤差矩陣近似,而是一組真正能夠接受因果檢驗的任務迴路單元。△GPT-2 Small的任務迴路結果。曲線越低,表示達到相同充分性或必要性要求所需的活躍連接越少。△Qwen3.5-27B的任務迴路結果。
SWD在大模型上仍能以較少活躍連接達到相應的因果測試要求。從單矩陣擴展到27B、全模型和zero-data SWD的驗證並未停留在GPT-2的單個矩陣上。在模型規模上,團隊將相同的單矩陣替換和迴路抽取流程擴展到Qwen2.5-0.5B、1.5B、3B,最終進一步驗證至Qwen3.5-27B。在27B模型的第31層mlp.downproj上,SWD依然以顯著更少的數據達到低CE delta,並以更少的活躍連接達到相當的充分性和必要性目標。
在替換範圍上,團隊進一步把GPT-2 Small 12個Transformer block中全部48個注意力和MLP權重矩陣替換為稀疏分解,同時保留embedding、LayerNorm、非線性函數和輸出頭。由於局部近似誤差會跨層累積,團隊將SWD作為稀疏初始化,固定所有非零位置,只微調已經保留下來的因子值。得到的SWD-FT在連接數量不變的情況下,將模型CE從3.90降至3.44,略優於相近非零參數預算下稀疏預訓練基線的3.45。更值得注意的是,SWD-FT總計使用約2,060萬個token,而稀疏預訓練基線達到相近CE使用了28.84億個token,前者同樣不到後者的1%。
這使得從現有稠密checkpoint出發構造全模型稀疏干預表面,成為一條極具吸引力的路線。SWD還提供了一個更徹底的zero-data版本。在GPT-2 Small單矩陣實驗中,它完全不使用校準文本,直接最小化原權重與分解權重之間的Frobenius誤差。結果顯示,zero-data SWD在權重空間中更接近原矩陣;使用激活校準的SWD則在高稀疏度下更能保持典型文本上的模型行為。即使完全不使用校準激活,zero-data SWD得到的瓶頸單元仍然能夠抽取出有效任務迴路。這為逐checkpoint、逐訓練階段追蹤大模型內部結構提供了新的可能性。△GPT-2 Small全模型替換。
固定稀疏結構並微調保留的非零值後,模型CE從3.90降至3.44,同時保持活躍連接數量不變。△Zero-data SWD。Zero-data SWD在權重空間中更接近原矩陣;activation-calibrated SWD在高稀疏度下更能保持典型文本上的模型行為。從曲線走向具體單元:它們到底在做什麼?迴路曲線證明了這些單元在因果測試中有效,但機制可解釋性還關心另一個問題:這些單元能否呈現出可理解的模式?團隊在GreaterThan任務上,對GPT-2 Small全部9,208個候選mlp.c_proj瓶頸單元進行歸因排序,並從第6、8、10層展示六個高排名單元。
隨後,他們在獨立的WikiText-2文本上收集每個單元的高激活上下文,並由GPT-5.5總結重複出現的語義模式。六個單元中,有四個集中響應數字、年份、數量或度量信息,另外兩個更多對應標點、句法和命名實體。這些語義模式並未參與單元選擇,卻與GreaterThan所需的數值比較能力形成了明顯呼應。團隊還進行了一個獨立的定向編輯實驗。他們篩選出瓶頸單元c205,並將該單元讀方向誘導的rank-one更新施加到原始稠密GPT-2權重上。在提示詞The opposite of up is中,正確答案down相對干擾答案left的logit margin提高了0.
216;在七條無關事實提示上,平均末token KL僅為4.02×10⁻⁵。在相近的正向目標變化下,這個單單元方向測得的副作用低於隨機單元和rank-4 LoRA對照。一個從權重分解中得到的瓶頸方向,因此不僅可以被觀察和消融,還能夠成為精確操控模型行為的編輯手柄。△GreaterThan迴路的語義審計。六個高歸因瓶頸單元中,四個與數字、數量或度量模式相關;語義假設來自獨立文本中的高激活上下文。△單個SWD方向的定向編輯。縱軸為目標答案相對干擾答案的logit margin變化,橫軸為無關提示上的平均末token KL。
直接從預訓練權重中尋找大模型迴路 過去,機制可解釋性往往需要先學習一套新的特徵字典或替代模塊,再對這些新單元進行歸因和干預。SWD展示了另一種可能:預訓練權重本身就可以被重新組織成稀疏、可尋址、可因果檢驗的計算路徑。從不到1%的數據成本,到更少的瓶頸單元和活躍連接;從GPT-2、Qwen2.5到Qwen3.5-27B;從單矩陣、整個Transformer主幹到完全不依賴校準文本的zero-data分解,SWD正在把權重側機制可解釋性變成一條更輕量、也更容易擴展的技術路線。更重要的是,這些稀疏路徑不只存在於數值曲線中:它們能夠響應具體語義模式、通過充分性和必要性測試,並被用於定向改變模型行為。
隨著模型規模不斷增長,直接從已有checkpoint中抽取和追蹤迴路,或許將成為理解大模型內部計算的一條重要路徑。
論文信息 論文標題:Sparse Weight Decomposition for Efficient Circuit Extraction 作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu 機構:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University 論文:https://arxiv.org/abs/2608.03913 代碼:https://github.
com/Veri-Safe/SWD 模型:https://huggingface.co/veri-safe/SWD 交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。