雷峰網生成式AI

WWW 2026 唯一最佳長文|大模型該信「查到的」還是「記得的」?|GAIR Paper 110

2026年7月27日 02:25

重點摘要

MEDRGAG 框架通過"檢索-補全-選擇"的知識組織流程,融合外部檢索與內部參數知識,破解了醫療問答“檢索缺失與生成幻覺”的二元對立。 作者丨張 璐 編輯丨齊鋮湧 The ACM Web Conference 2026(WWW 2026)在線上閉幕式上揭曉本屆 Best Paper Awards。其中,唯一最佳長文獎授予了一篇看起來很「垂直」的工作:一篇關於醫學問答的論文。

站內 AI 整理稿

好的,這是一篇基於您提供的資料,重新組織、擴寫並符合新聞稿格式與長度要求的完整報導。 ---

### WWW 2026 唯一最佳長文獎揭曉!中國學者提出 MedRGAG 框架,破解大模型「信檢索還是信記憶」的終極難題

**導語**

在人工智慧領域,大型語言模型(LLM)的應用正面臨一個根本性的兩難:當需要回答一個專業問題時,模型究竟應該相信從外部資料庫「查到的」事實,還是應該信任自己參數中「記住的」知識?這個看似哲學性的問題,在極度重視準確性的醫學領域被放大到了極致。日前,在線上閉幕的 The ACM Web Conference 2026(WWW 2026)上,唯一的最佳長文獎(Best Paper Award)頒給了一篇看似「垂直」卻觸及此核心命題的論文——關於醫學問答(Medical QA)的研究。這項由中國人民大學高瓴人工智慧學院與騰訊天衍實驗室合作完成的工作,提出了名為 **MedRGAG** 的統一檢索與生成範式,為大模型知識組織提供了全新的解題思路,一舉奪得大會最高榮譽。 #### 醫考高壓下的終極考場

WWW 大會向來是網路、搜索、數據挖掘與人工智慧領域的頂級舞臺,一篇醫學問答論文能在此脫穎而出,其價值顯然超越了特定領域。評審團認為,這篇論文觸及了當前知識增強系統中最普遍的難題:當外部檢索不完整、模型記憶不可靠,且二者可能相互衝突時,模型該如何圍繞問題需求有效組織知識?醫學場景正是檢驗這一能力的高壓考場。在這裡,檢索少一條關鍵證據,模型可能無法排除干擾診斷;生成多一句不實背景,則可能將推理導向致命錯誤。正因如此,醫學問答成為了檢驗大模型能否「可靠組織知識」的終極試金石,而 MedRGAG 給出的答案,對於任何需要高可靠性知識應用的領域都具有深遠啟發。 #### 跳脫「二元對立」:從「相信誰」到「需要什麼」

過去,為了給大模型補充知識,主流路線主要分為兩派:**RAG(檢索增強生成)** 與 **GAG(生成增強生成)**。RAG 讓模型先查外部資料再回答,雖能壓制幻覺,但若檢索遺漏關鍵證據,模型便只能「看圖說話」;GAG 則讓模型內部生成背景知識,雖內容貼題,但生成的背景若本身有誤,幻覺就會像滾雪球一樣放大。過去也有嘗試合併兩者的研究,但重點多放在如何融合、化解衝突。MedRGAG 的核心突破在於它徹底轉換了提問方式。論文通訊作者、中國人民大學周驍副教授團隊與騰訊天衍實驗室主任吳賢團隊共同意識到,問題不在於「該信檢索還是該信生成」,而在於「回答這個問題,到底還缺什麼知識?」。

這一「知識需求驅動」的思路,讓 MedRGAG 跳脫了傳統的二元對立,將檢索、生成與選擇重新組織成一個「查漏補缺式」的知識增強閉環:先讓檢索提供外部事實錨點,再讓生成圍繞缺口補充背景,最後篩選出真正能支撐答案的「證據組合」。這不是簡單的疊加,而是讓兩股力量圍繞同一份問題需求協同作戰。#### 兩大核心模塊:先「查漏」再「拼圖」

為了實現這一目標,MedRGAG 框架設計了兩個核心模塊,分別解決「缺什麼知識」和「選什麼證據」兩個關鍵問題。第一個模塊名為 **KGCC(知識引導的上下文補全)**,它解決了「生成什麼」的難題。與普通 GAG 自由發揮不同,KGCC 首先要求模型總結已有的檢索文檔,提煉出與問題相關的知識點;接著,它會主動追問:「要徹底回答這個問題,還缺哪些關鍵信息?」,並找出最重要且不重複的「知識缺口」;最後,才圍繞這些缺口,有針對性地生成背景文檔來補全。這就像是讓模型先盤點庫存(檢索結果),再列出購物清單(知識缺口),最後才出門採購(生成),確保新增的知識都是「精準補貨」,而非重複建設。

第二個模塊是 **KADS(知識感知的文檔選擇)**。當檢索來的 N 篇文檔和生成的 N 篇文檔一同湧入時,傳統的排序器(Reranker)往往會偏愛那些「看起來最像問題」的文本,而大模型生成的文檔因天生貼題,很容易在相似度評分中勝出,從而擠掉了那些雖然表述樸素但包含關鍵事實的檢索文檔。KADS 的設計顛覆了這一邏輯。它將文檔選擇變成一場「證據拼圖」:先拆解問題需要哪些知識塊,然後逐一評估每篇候選文檔具體補上了哪一塊,最終選出一組**知識覆蓋最完整、冗餘最少**的「證據組合」。它不問誰最像問題,只問誰最能拼出答案。#### 即插即用的穩健提升

更令人驚豔的是,MedRGAG 並非一個需要重新訓練醫學大模型的「巨無霸」框架。論文中的閱讀器(回答問題的模型)包括 Qwen2.5-7B、LLaMA-3.1-8B 等通用模型,而生成、總結、選擇等環節也主要由通用模型完成。這意味著 MedRGAG 是一個**無需訓練、即插即用**的知識組織方法,其提升完全來自於更合理地組織知識。實驗結果證明,在 MedQA-US、MedMCQA 等五個權威醫學問答基準測試上,MedRGAG 在三種不同閱讀器上均取得了最優或接近最優的表現。彙總來看,相比純檢索方法(MedRAG),平均相對提升約 12.5%;相比純生成方法(MedGENIE),提升約 4.

5%;而相較於不提供任何外部知識的直接作答,提升幅度更是高達 15.3%。這一系列數據有力地證明了,知識的「組織方式」有時比「知識來源」本身更為重要。#### 真實案例:一次完美的「查漏、補缺、排雷」

論文中提供了一個關於「NF2 基因突變」的真實病例,完美展示了 MedRGAG 的運作流程。問題是:一位攜帶 NF2 突變的患者,其患哪類疾病的風險升高?在傳統 RAG 下,模型檢索到「NF2 與 22 號染色體突變有關」,但這不足以區分答案。MedRGAG 的 KGCC 模塊首先總結檢索信息,然後識別到缺口:缺少對 NF2 典型腫瘤譜系的描述,以及與其他類似綜合徵(如 VHL)的鑑別診斷。於是,它有針對性地生成了補全這兩方面知識的文檔。隨後,KADS 模塊沒有被生成文檔的「貼題」屬性迷惑,反而精準地保留了一篇包含「NF2 患者易發腦膜瘤」這一關鍵事實的檢索文檔,並搭配兩篇至關重要的生成文檔。

最終,這一套「證據組合」成功引導模型給出了正確答案:B.腦膜瘤。在這個案例中,檢索提供了事實錨點,生成補上了鑑別知識,而 KADS 則負責「排雷」,將最有價值的證據篩選出來,三者缺一不可。#### 對話作者:關於「自戀偏好」與未來落地

雷峰網AI科技評論團隊在論文獲獎後,與第一作者李磊進行了對話。李磊指出,他們很早就注意到一個現象:當檢索和生成文檔混合時,常規的排序器會對大模型生成的內容表現出一種「自戀偏好」,這啟發他們設計了基於知識覆蓋度而非相似度的 KADS 方法。 對於外界關心的落地延遲問題,李磊坦言,MedRGAG 鏈路較長,延遲確實是需要優化的方向。但他認為,這些步驟可以並行化,也可以通過緩存和蒸餾出專注於問題拆解、知識缺口識別的「專用小模型」來解決,從而降低部署成本。他同時強調,框架對執行 KGCC 和 KADS 的輔助模型有一定能力要求,未來在資源受限環境的部署,需要依賴更高效的專用模型。 #### 結語:從「擁有知識」到「會用知識」

WWW 2026 的唯一最佳長文獎,並非僅僅授予一個高效的醫學問答系統。它表彰的是一種更為根本的思想轉變:在追求大模型可靠性的道路上,我們不應再糾結於「查到的」與「記得的」孰優孰劣,而應專注於如何讓模型學會判斷「還缺什麼」以及「該如何組織」。MedRGAG 的貢獻在於,它將一個困擾行業已久的難題,轉化為一套清晰、可操作且有效的工程框架。它證明了,從「擁有知識」到「會用知識」,中間的鴻溝,或許正需要一次以「需求」為名的組織革命來填補。這不僅是醫學問答的進步,更是所有可信 AI 應用邁向成熟的重要一步。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前