無Key注意力緩存減半
重點摘要
無Key注意力緩存減半。 新機制直接移除傳統Key表示。僅保留數值緩存���降低內存開銷。五款模型多數達到相當或更優表現。高效注意力研究論文解釋路由設計。長文本解碼吞吐有望明顯提高。
大型語言模型在推論階段最耗費資源的環節之一,莫過於處理長文本時的注意力緩存占用。近期一項名為「無Key注意力」的機制研究引起學界關注,研究人員提出一個顛覆傳統框架的做法:直接移除注意力機制中的Key向量,僅保留數值緩存,便能讓注意力緩存的規模一口氣縮減約一半。這項設計從根源上降低了記憶體的開銷,對於長文本解碼場景來說,可望帶來顯著的吞吐量提升,為高效率注意力機制的發展開啟新的方向。在過去的標準注意力架構中,系統需要為每個Token同時維護Query、Key與Value三種向量,其中Key與Value組成了所謂的KV Cache,成為大型模型在生成過程中記憶體消耗的主要來源。
當處理的文本長度越來越長,這份緩存的占用也隨之快速膨脹,不僅限制了單次可處理的上下文長度,也成為提升服務吞吐量的主要瓶頸。為了突破這道限制,許多研究都試圖以壓縮或剪枝的方式減輕KV Cache的負擔,但「無Key注意力」選擇了更徹底的路徑——讓Key角色直接缺席。這份研究論文中解釋了背後的「路由設計」邏輯。傳統的注意力機制之所以需要Key,是因為模型必須透過Query與Key的比對來決定資訊的分配權重,這中間牽涉到複雜的路由判斷。然而,研究團隊發現,模型不一定需要為每個Token都維護一組完整的Key向量,才能達成同樣的目標。
透過更精簡的數值緩存設計,模型依然能夠傳遞必要的訊息量,並且在沒有Key輔助的情況下,維持注意力分佈的有效性。換句話說,這套機制的核心思路在於重新思考注意力資訊的傳遞方式。在原本的架構中,Key扮演的是查詢的索引角色,用於確認「哪些過去的資訊與當前Token相關」;一旦移除Key,這項任務就必須以其他形式完成。論文提出的解法是讓數值緩存本身承擔起更多的資訊負荷,以更經濟的編排方式直接承載可用的語意內容,使得模型在解碼時,即使缺少了明確的Key索引,依然能大致掌握應該關注哪些先前位置的內容。這項機制的可行性並非僅止於理論推導。
研究團隊在論文發布的實測中,涵蓋了五款主流的大型語言模型,結果顯示多數模型在移除Key之後,整體表現不僅沒有明顯衰退,部分模型甚至達到與原始版本相當或更優的水準。這樣的结果具有相當的指標性意義,因為它說明了無Key注意力的有效性並非僥倖,也不是僅限於特定模型架構的偶然情況,而是具有一定的普遍適用性。這項結果也進一步凸顯出,移除Key並非為了節省資源而做出的犧牲式妥協,而是一條實際可行的效率最佳化方向。過去對於注意力機制的瘦身,往往需要在性能與占用之間取捨,但從實驗數據看來,無Key注意力有機會突破這種零和框架,在縮減一半緩存規模的同時,維持甚至改善輸出的品質。
這使得它不再是單純的「省資源方案」,而是具備潛力的模型架構改進選項。整體而言,這項進展讓高效注意力研究獲得了全新的思考切入點。長久以來,KV Cache的規模幾乎與模型層數、注意力頭數以及序列長度綁定,想要降低記憶體負擔往往得從這些參數下手,但無Key注意力證明了直接移除以知元件同樣可行。這也讓「無Key」正式成為緩存瘦身的重要候選方案,未來若能在更大規模的長文本任務上驗證其穩定性與泛化能力,將有望加速實際應用的落地。目前這項研究仍處於學術驗證階段,距離商業化部署還有一段路要走,但它的出現已經為大語言模型的效率優化提供了值得追蹤的脈絡。
正如先前多項高效率注意力研究的發展軌跡,任何一次對核心機制的大膽簡化,都可能帶動整套推論框架的連鎖演進,而無Key設計能否成為下一波主流,值得持續關注。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。