緩存修復更看鄰近

2026年9月18日 00:00
站內 AI 整理稿

:從「重算整段」到「只補鄰近」的預算思維轉向 在長上下文模型日益普及的今天,KV 緩存(KV Cache)的修復策略正出現一道關鍵轉折。過去,只要上下文被改動,模型往往必須從頭重算整段前綴,代價高昂;如今的新思路則不再追求全量重來,而是把「編輯後的重算」重新定義成一道預算問題——只在真正受影響的鄰近區間內補算,讓有限資源精準落在必要之處。這項轉變的核心,在於對「重算範圍」的重新劃分。傳統做法視上下文為一條必須整體維護的長鏈,任何一處插入或刪除,都會牽動後續所有位置的緩存失效,於是整段前綴被迫重跑。新的方法則承認一個事實:改動的影響其實具有局部性,距離編輯點越遠的區塊,其緩存往往仍然有效。

既然如此,就沒有必要為了一處小修改而犧牲全部已算好的成果。換句話說,修復的目標從「修得多完整」轉為「修得多近」。系統不再試圖把每一段緩存都還原到完美狀態,而是沿著編輯位置向兩側圈出一個必要鄰域,僅在此範圍內重新計算。這個鄰域的邊界怎麼劃、要往前覆蓋多少、往後延伸多遠,本質上是一道預算分配的題目——在延遲與精度之間,找出最划算的那筆邊際。效果具體體現在兩個數字上。其一是連續窗口的設計,能追回大約 0.94 的邊際,幾乎補平了重算所帶來的落差,意味著局部補算在品質上已相當接近全量重算。其二是速度,整體比全量預填充(full prefill)快上 13 到 21 倍。

當精度幾乎不掉、速度卻提升一個量級,過往「品質與成本二選一」的取捨,也就不再成立。這樣的特性,讓它特別適合 RAG(檢索增強生成)與智能體的長上下文場景。這兩類工作負載的共同特徵,是內容被頻繁插入、裁剪與重組:檢索結果不斷更新,對話記憶持續增減,工具回傳的片段來來去去。在這種反覆編輯的節奏下,快取命中區塊經常被打斷,若每次都退回全量重算,成本將迅速失控。鄰近修復恰好對上了這種節奏。從系統設計的角度看,這也代表緩存管理的重心正在位移。以往工程師關注的是「命中率」這個單一指標,盡可能讓更多前綴被重複利用;但當上下文持續變動,單純追求命中率已不足以描述真實開銷。

真正決定效能的,是每次失效之後,需要補算的區間有多大。命中率再高,若一有改動就得全盤重來,實際延遲依然難看。因此,「鄰近性」成為新的競爭維度。誰能把重算範圍收得越貼近改動處,誰就越能在延遲與精度之間拿到那筆邊際。這不只是一項工程優化,更是一種成本模型的轉換:把不可控的全量開銷,拆解成可估算、可調配的局部預算,讓開發者能依場景需求決定要保守一點還是激進一點。值得注意的是,這種思路並非要否定全量重算的正確性,而是承認多數情況下並不需要它。全量重算像是每次都把整棟房子重建,穩妥卻昂貴;鄰近修復則像是只修補受損的那面牆,前提是能準確判斷損害範圍。

這個判斷本身,就成了技術的關鍵——圈得太大則浪費,圈得太小則失真,連續窗口的設計正是為了在兩者間取得平衡。對 RAG 應用而言,這意味著檢索到的文件可以在變動時被更便宜地重新納入上下文,而不必讓整個提示重新計算。對智能體而言,長達數十輪的對話與工具調用紀錄,也能在每次新增內容後以更低代價延續,而不至於因為上下文膨脹而拖垮回應速度。這些都是過去難以兼顧、如今開始鬆動的瓶頸。歸根結底,緩存修復比拼的已經不是「修得多完整」,而是「修得多近」。當局部補算能在品質上追回 0.94 的邊際、在速度上取得 13 到 21 倍的優勢,過去被視為必然的全量重算,就從預設選項降格為最後手段。

這場轉向的意義,在於它讓長上下文的成本結構變得更可控、更貼近真實使用情境。展望未來,隨著上下文長度持續增長、編輯頻率持續提高,這種以鄰近區間為單位的修復策略,可能成為長上下文系統的標準配置。真正拉開差距的,將不再只是模型本身的規模,而是誰能把重算預算花得最精準——在最靠近改動的地方,用最少的力氣,換回最接近完整的結果。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

2 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

4 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

8 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

8 小時前