雷峰網生成式AI

WWW 2026 唯一最佳長文|大模型該信「查到的」還是「記得的」?|GAIR Paper 110

2026年7月27日 02:25

重點摘要

MEDRGAG 框架通過"檢索-補全-選擇"的知識組織流程,融合外部檢索與內部參數知識,破解了醫療問答“檢索缺失與生成幻覺”的二元對立。 作者丨張 璐 編輯丨齊鋮湧 The ACM Web Conference 2026(WWW 2026)在線上閉幕式上揭曉本屆 Best Paper Awards。其中,唯一最佳長文獎授予了一篇看起來很「垂直」的工作:一篇關於醫學問答的論文。

站內 AI 整理稿

好的,這是一篇基於您提供的資料,重新組織、擴寫並符合新聞稿格式與長度要求的完整報導。 ---

### WWW 2026 唯一最佳長文獎揭曉!中國學者提出 MedRGAG 框架,破解大模型「信檢索還是信記憶」的終極難題

**導語**

在人工智慧領域,大型語言模型(LLM)的應用正面臨一個根本性的兩難:當需要回答一個專業問題時,模型究竟應該相信從外部資料庫「查到的」事實,還是應該信任自己參數中「記住的」知識?這個看似哲學性的問題,在極度重視準確性的醫學領域被放大到了極致。日前,在線上閉幕的 The ACM Web Conference 2026(WWW 2026)上,唯一的最佳長文獎(Best Paper Award)頒給了一篇看似「垂直」卻觸及此核心命題的論文——關於醫學問答(Medical QA)的研究。這項由中國人民大學高瓴人工智慧學院與騰訊天衍實驗室合作完成的工作,提出了名為 **MedRGAG** 的統一檢索與生成範式,為大模型知識組織提供了全新的解題思路,一舉奪得大會最高榮譽。 #### 醫考高壓下的終極考場

WWW 大會向來是網路、搜索、數據挖掘與人工智慧領域的頂級舞臺,一篇醫學問答論文能在此脫穎而出,其價值顯然超越了特定領域。評審團認為,這篇論文觸及了當前知識增強系統中最普遍的難題:當外部檢索不完整、模型記憶不可靠,且二者可能相互衝突時,模型該如何圍繞問題需求有效組織知識?醫學場景正是檢驗這一能力的高壓考場。在這裡,檢索少一條關鍵證據,模型可能無法排除干擾診斷;生成多一句不實背景,則可能將推理導向致命錯誤。正因如此,醫學問答成為了檢驗大模型能否「可靠組織知識」的終極試金石,而 MedRGAG 給出的答案,對於任何需要高可靠性知識應用的領域都具有深遠啟發。 #### 跳脫「二元對立」:從「相信誰」到「需要什麼」

過去,為了給大模型補充知識,主流路線主要分為兩派:**RAG(檢索增強生成)** 與 **GAG(生成增強生成)**。RAG 讓模型先查外部資料再回答,雖能壓制幻覺,但若檢索遺漏關鍵證據,模型便只能「看圖說話」;GAG 則讓模型內部生成背景知識,雖內容貼題,但生成的背景若本身有誤,幻覺就會像滾雪球一樣放大。過去也有嘗試合併兩者的研究,但重點多放在如何融合、化解衝突。 MedRGAG 的核心突破在於它徹底轉換了提問方式。論文通訊作者、中國人民大學周驍副教授團隊與騰訊天衍實驗室主任吳賢團隊共同意識到,問題不在於「該信檢索還是該信生成」,而在於「回答這個問題,到底還缺什麼知識?」。這一「知識需求驅動」的思路,讓 MedRGAG 跳脫了傳統的二元對立,將檢索、生成與選擇重新組織成一個「查漏補缺式」的知識增強閉環:先讓檢索提供外部事實錨點,再讓生成圍繞缺口補充背景,最後篩選出真正能支撐答案的「證據組合」。這不是簡單的疊加,而是讓兩股力量圍繞同一份問題需求協同作戰。 #### 兩大核心模塊:先「查漏」再「拼圖」

為了實現這一目標,MedRGAG 框架設計了兩個核心模塊,分別解決「缺什麼知識」和「選什麼證據」兩個關鍵問題。 第一個模塊名為 **KGCC(知識引導的上下文補全)**,它解決了「生成什麼」的難題。與普通 GAG 自由發揮不同,KGCC 首先要求模型總結已有的檢索文檔,提煉出與問題相關的知識點;接著,它會主動追問:「要徹底回答這個問題,還缺哪些關鍵信息?」,並找出最重要且不重複的「知識缺口」;最後,才圍繞這些缺口,有針對性地生成背景文檔來補全。這就像是讓模型先盤點庫存(檢索結果),再列出購物清單(知識缺口),最後才出門採購(生成),確保新增的知識都是「精準補貨」,而非重複建設。 第二個模塊是 **KADS(知識感知的文檔選擇)**。當檢索來的 N 篇文檔和生成的 N 篇文檔一同湧入時,傳統的排序器(Reranker)往往會偏愛那些「看起來最像問題」的文本,而大模型生成的文檔因天生貼題,很容易在相似度評分中勝出,從而擠掉了那些雖然表述樸素但包含關鍵事實的檢索文檔。KADS 的設計顛覆了這一邏輯。它將文檔選擇變成一場「證據拼圖」:先拆解問題需要哪些知識塊,然後逐一評估每篇候選文檔具體補上了哪一塊,最終選出一組**知識覆蓋最完整、冗餘最少**的「證據組合」。它不問誰最像問題,只問誰最能拼出答案。 #### 即插即用的穩健提升

更令人驚豔的是,MedRGAG 並非一個需要重新訓練醫學大模型的「巨無霸」框架。論文中的閱讀器(回答問題的模型)包括 Qwen2.5-7B、LLaMA-3.1-8B 等通用模型,而生成、總結、選擇等環節也主要由通用模型完成。這意味著 MedRGAG 是一個**無需訓練、即插即用**的知識組織方法,其提升完全來自於更合理地組織知識。 實驗結果證明,在 MedQA-US、MedMCQA 等五個權威醫學問答基準測試上,MedRGAG 在三種不同閱讀器上均取得了最優或接近最優的表現。彙總來看,相比純檢索方法(MedRAG),平均相對提升約 12.5%;相比純生成方法(MedGENIE),提升約 4.5%;而相較於不提供任何外部知識的直接作答,提升幅度更是高達 15.3%。這一系列數據有力地證明了,知識的「組織方式」有時比「知識來源」本身更為重要。 #### 真實案例:一次完美的「查漏、補缺、排雷」

論文中提供了一個關於「NF2 基因突變」的真實病例,完美展示了 MedRGAG 的運作流程。問題是:一位攜帶 NF2 突變的患者,其患哪類疾病的風險升高? 在傳統 RAG 下,模型檢索到「NF2 與 22 號染色體突變有關」,但這不足以區分答案。MedRGAG 的 KGCC 模塊首先總結檢索信息,然後識別到缺口:缺少對 NF2 典型腫瘤譜系的描述,以及與其他類似綜合徵(如 VHL)的鑑別診斷。於是,它有針對性地生成了補全這兩方面知識的文檔。隨後,KADS 模塊沒有被生成文檔的「貼題」屬性迷惑,反而精準地保留了一篇包含「NF2 患者易發腦膜瘤」這一關鍵事實的檢索文檔,並搭配兩篇至關重要的生成文檔。最終,這一套「證據組合」成功引導模型給出了正確答案:B. 腦膜瘤。在這個案例中,檢索提供了事實錨點,生成補上了鑑別知識,而 KADS 則負責「排雷」,將最有價值的證據篩選出來,三者缺一不可。 #### 對話作者:關於「自戀偏好」與未來落地

雷峰網AI科技評論團隊在論文獲獎後,與第一作者李磊進行了對話。李磊指出,他們很早就注意到一個現象:當檢索和生成文檔混合時,常規的排序器會對大模型生成的內容表現出一種「自戀偏好」,這啟發他們設計了基於知識覆蓋度而非相似度的 KADS 方法。 對於外界關心的落地延遲問題,李磊坦言,MedRGAG 鏈路較長,延遲確實是需要優化的方向。但他認為,這些步驟可以並行化,也可以通過緩存和蒸餾出專注於問題拆解、知識缺口識別的「專用小模型」來解決,從而降低部署成本。他同時強調,框架對執行 KGCC 和 KADS 的輔助模型有一定能力要求,未來在資源受限環境的部署,需要依賴更高效的專用模型。 #### 結語:從「擁有知識」到「會用知識」

WWW 2026 的唯一最佳長文獎,並非僅僅授予一個高效的醫學問答系統。它表彰的是一種更為根本的思想轉變:在追求大模型可靠性的道路上,我們不應再糾結於「查到的」與「記得的」孰優孰劣,而應專注於如何讓模型學會判斷「還缺什麼」以及「該如何組織」。MedRGAG 的貢獻在於,它將一個困擾行業已久的難題,轉化為一套清晰、可操作且有效的工程框架。它證明了,從「擁有知識」到「會用知識」,中間的鴻溝,或許正需要一次以「需求」為名的組織革命來填補。這不僅是醫學問答的進步,更是所有可信 AI 應用邁向成熟的重要一步。

Related

相關文章

OpenAI 和 Anthropic,正在砸錢搶這個市場

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作決戰8月,Anthropic甩出Fable 5.1,奧特曼攜GPT-6連夜彙報新智元·2026年07月27日 16:01八月的模型戰場,硝煙已經點燃 GPT-6和Fable 5.1,已經準備就位,很可能8月上線。 據悉,本週奧特曼已經突降華盛頓,展示了OpenAI有史以來的最強大模型——GPT-6。 據外媒Axios爆料,GPT-6 已經具備了進行原創科學研究的能力,並在內部測試中通過不休不眠的智能體集群(Agent Swarms),展現出危險的長程規劃與自主滲透能力。 而就在同一時刻,Anthropic這邊也有消息洩露:Fable 5.1 已經就位,瞄準 8 月,加量不加價,試圖以田忌賽馬戰術,在GPT-6落地前完成狙擊。 這個8月,註定不平靜,一場肉搏戰即將打響,目標直指ASI的奇點時刻。 Anthropic的暗中狙擊:Fable 5.1已準備好,等待一擊斃命 Anthropic 顯然已經嗅到奇點逼近的氣息。 業內爆料證實,Anthropic 籌備已久的 Fable 5.1 已經完成內部測試,瞄準 8 月發佈。 並且,它的定價將維持與Fable 5完全相同(輸入 $10 / 輸出 $50 每百萬 Token)。

剛剛

Claude Code狂刪80%提示詞,Opus 5反手加回去了

Anthropic 在 Claude Code 中刪除了 80% 的提示詞,但隨著更強大的 Opus 5 模型推出,這些提示詞不僅被全數恢復,還新增了更多規範,導致「模型越強、規矩越多」的現象。業界分析認為,這反映出 Anthropic 在提升模型能力與維持使用行為可控性之間的反覆權衡,後續提示工程反而走向更嚴謹複雜的路徑。

剛剛