Skill Following:模型“搜到了Skill”,不等於最終答案真的從中受益

2026年9月14日 06:45
Skill Following:模型“搜到了Skill”,不等於最終答案真的從中受益
站內 AI 整理稿

在大型語言模型的實際應用場景中,一個關鍵問題正引發學術界與產業界的關注:模型從外部檢索到相關技能或知識後,是否真的能將這些資訊有效轉化為最終答案?這個過程並非「搜到即用」那樣簡單,而是一條涉及檢索、理解、脈絡解析與結果寫入的完整鏈路。研究團隊將其命名為「Skill Following(SF)」,並指出鏈路中任何一個環節的偏差,都可能導致最終輸出品質大打折扣。所謂「Skill Following」,指的是大型語言模型從接收檢索資訊、解讀內容、判斷脈絡,再到將結果整合進最終回覆的完整流程。過去許多評估方式往往只關注模型是否成功檢索到相關技能,卻忽略了後續是否真正「使用」了這些技能。

事實上,模型就算在檢索階段表現優異,若無法在生成階段正確應用這些資訊,最終答案依然無法反映檢索成果。為了解決這個評估盲點,研究團隊提出了「RAE(Retrieval-Invoked Actual-Use Effect,檢索觸發後的實際使用效應)」概念。RAE 的核心目的,是精準判斷模型是否從檢索到的技能中實際獲益,而不僅僅是檢索成功。RAE 的評估方式採用配對比較:僅針對那些模型確實執行了檢索、並回傳至少一條技能資料的問題,將有檢索行為的模型(以 SE 表示)與無檢索行為的模型(以 SD 表示)進行表現差異比對。透過這種配對設計,研究團隊能夠區分出「檢索本身」與「檢索後實際使用」的貢獻。

簡單來說,如果 SE 的表現顯著優於 SD,就代表模型不只搜到了技能,更成功將這些技能寫入答案,產生正面效益。反之,若兩者表現相近甚至 SE 更差,則意味著檢索到的技能可能淪為無效的資訊雜訊,甚至干擾模型的正確判斷。這項發現對於大型語言模型的優化方向具有重要啟示。目前許多系統強調提升檢索召回率,確保模型能夠找到更多相關資料,但 RAE 的觀點提醒我們:檢索只是起點,真正影響使用者體驗的是後續的整合與應用能力。模型若無法正確解讀檢索到的技能,或者無法將技能與當下問題的脈絡有效對齊,那麼再豐富的檢索結果都難以轉化為高品質答案。從實務角度看,RAE 提供了一個更細緻的診斷工具。

開發者可以透過比較 SE 與 SD 的差距,找出模型在哪一類問題上容易「撿到卻用不到」,進而針對性地調整提示設計、訓練資料或檢索策略。例如,若發現模型在需要多步驟推理的問題上,檢索技能的實際使用率偏低,就可能需要強化模型的脈絡理解或步驟規劃能力。此外,RAE 的提出也反映了業界對大型語言模型評估方法的持續演進。過去評估往往過於簡化,只衡量最終答案的準確性,卻忽略了內部認知過程。而 Skill Following 框架與 RAE 指標,正是試圖打開這個「黑箱」,讓研究人員與開發者能更清晰地看到模型從輸入到輸出的完整思考路徑,以及每個環節的價值。

值得注意的是,這項研究並非否定檢索的重要性,而是強調「檢索與使用」必須被視為兩個獨立卻緊密相扣的階段。模型若能真正受益於檢索到的技能,才能發揮外部知識庫的輔助效果;若不能,龐大的檢索成本與延遲就可能成為無謂的負擔。未來,如何在提升檢索品質的同時,強化模型的技能跟隨能力,將成為大型語言模型技術突破的關鍵方向。學者也指出,RAE 的配對比較方法具有廣泛的適用性,不限於特定模型或任務。無論是問答系統、程式碼生成還是多輪對話,只要模型涉及檢索外部資訊,都可以透過 RAE 來評估其實際使用效益。這使得該指標有潛力成為業界標準化的評估工具之一。

總而言之,大型語言模型從「搜到技能」到「真正受益」之間,存在一條需要精密調校的鏈路。RAE 為這條鏈路提供了一面精準的鏡子,讓模型開發者能更清楚地看到哪些檢索成果被有效利用,哪些則只是徒增雜訊。隨著相關研究持續深入,未來我們有望看到更聰明、更高效的大型語言模型,能夠真正做到「學以致用」,而非僅僅是「記憶庫存」。

Related

相關文章

IT之家AI Agent

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人

作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

1 小時前
量子位AI Agent

具身智能技術路線尚未定型,基礎設施卻先收斂

具身智能技術路線尚未成形,但基礎設施需求已開始收斂,重點從製造機器人轉向持續迭代機器人能力。百度集團沈抖指出,智能體能力邊界快速擴展,進入規模化部署階段,但機器人學習新任務與跨環境適應性仍待突破。

2 小時前

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”

AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。

3 小時前
智東西AI Agent

Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽

作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

9 小時前
AIbaseAI Agent

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題

吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

9 小時前
IT之家AI Agent

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢

作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。

11 小時前