2026 CVPR | RAG 分塊還在"按字數硬切"?M3DocDep:先給文檔算清"家譜

2026年9月17日 09:24
2026 CVPR | RAG 分塊還在"按字數硬切"?M3DocDep:先給文檔算清"家譜
站內 AI 整理稿

在檢索增強生成(RAG)的實際應用中,文件該如何進行有效分塊,始終是影響檢索品質的核心挑戰之一。傳統做法大多依賴「按字數硬切」的原則,也就是根據固定的 token 數或字元數來切割文件。這種方式雖然簡單直接,卻經常讓同一段落被攔腰截斷,或讓圖表與其說明文字分別落入不同區塊,導致語意連貫性嚴重受損。尤其在處理結構複雜的文件時,這種「一刀切」的做法往往讓後續的檢索模型抓取到破碎、不完整的資訊,最終影響問答與生成任務的準確度。針對這項長期困擾產業界的痛點,即將在 2026 年電腦視覺與模式識別大會(CVPR)上發表的論文《M3DocDep》提出了一套截然不同的解決思路。

研究團隊認為,與其在不了解文件結構的情況下強行切割,不如先幫文件建立一份完整的「家譜樹」,還原其內在的層級組織。這份家譜樹的核心目標,是讓所有元素之間的主從與從屬關係一目了然——誰屬於哪一章節、哪一段落由哪個子標題管轄、插圖與表格究竟歸屬於哪一段文字說明。換句話說,M3DocDep 在進行分塊之前,會先將整份文件解析成一棵全局合法的樹狀圖譜。這棵樹不僅記錄了標題、段落、圖表等基本元素的位置,更清楚標示出它們之間的邏輯歸屬。例如,一張產品示意圖可能屬於某一節的技術說明,而該節又上層歸屬於某個章節;透過這棵樹,所有元素的上下文邊界都被重新界定。

研究人員強調,這種「先理解文件格局,再決定如何下刀」的設計思路,從根本改變了過去盲目切割的做法。在完成樹狀圖譜的建構後,M3DocDep 會沿著這棵樹的枝幹進行切割。每一個分塊本身就是語意上完整、邏輯上自足的單位——不會再出現「一段話的上半身在 A 區、下半身在 B 區」的窘境。這意味著,無論是文字段落、表格說明,還是圖片註解,都能被保留在同一個分塊中,維持其原本的敘述脈絡。對於需要處理大量技術文件、學術論文或產品手冊的 RAG 系統來說,這項改進將顯著提升檢索的精準度。傳統固定長度分塊之所以為人詬病,在於它完全不考慮文件的內在結構。

一份文件可能包含多層次的標題、附註、引用、圖表等,這些元素之間的關聯往往跨越固定的字數邊界。以一份技術白皮書為例,某個章節的圖表說明可能只有短短幾行,卻被硬生生分到兩個不同的檢索區塊;模型在檢索時,只能抓到其中一半的資訊,導致生成的回答出現斷裂或誤解。M3DocDep 則透過先建立層級關係,確保這類情況不再發生。值得注意的是,M3DocDep 的解決方案並非單純依賴版面分析,而是結合了文件內容的邏輯理解。研究團隊在論文中描述了如何利用文檔中的標題層級、字體大小、列表格式、圖表編號等線索,自動推導出完整的樹狀結構。

這個過程類似於人類在閱讀文件時,會不自覺地根據章節標題、段落縮排、圖表位置來建立心智模型。M3DocDep 嘗試將這個認知過程量化,讓機器也能具備類似的「文件格局感」。從實務角度來看,M3DocDep 的出現為 RAG 系統的文件預處理環節提供了全新的選擇。過去,開發者往往需要在分塊大小與語意完整性之間妥協——塊切得太大,檢索效率下降;塊切得太小,資訊破碎嚴重。如今,藉由先建立家譜樹再切割,系統可以在不犧牲檢索速度的前提下,獲得語意更加完整的分塊。這對於需要即時回應大量查詢的企業級應用,如客服機器人、內部知識庫、學術搜索平台等,將帶來直接效益。

論文作者進一步指出,M3DocDep 的設計不僅適用於純文字文件,也能處理包含大量圖表、公式、註解的複合型文檔。在實際測試中,該方法對包含多欄排版、浮動圖片的 PDF 文件同樣表現穩定。研究團隊特別強調,這套方法的通用性來自於它對文件「層級合法性」的堅持——只要文件存在明確的結構線索,M3DocDep 就能重建其完整的樹狀關係。當然,M3DocDep 並非全無挑戰。對於結構極度混亂、缺乏明確標題層級的文件(例如某些網頁或掃描品質不佳的 PDF),家譜樹的建構準確度可能會受到影響。不過研究團隊表示,他們在論文中設計了多項容錯機制,能夠在部分線索不明確的情況下,仍維持一定的分塊品質。

未來也將持續優化演算法,以應對更多樣化的文件格式。整體而言,M3DocDep 為文件預處理領域帶來了一股新思維:與其被動地依照字數切割,不如主動還原文件的「家譜」結構,讓分塊回歸到語意連貫的本質。這項研究預計在 2026 年 CVPR 大會上正式亮相,屆時將公開詳細的演算法與評測數據。對於正在尋找更優雅分塊策略的開發者與研究人員來說,M3DocDep 無疑提供了一個值得關注的方向。隨著 RAG 技術在各行各業的滲透率持續提高,文件預處理的品質將直接影響最終應用成效。從固定長度切割到結構感知分塊,M3DocDep 的出現標誌著這個領域正從「粗放管理」邁向「精細理解」的階段。

未來,當更多文件能夠被正確解析成語意完整的區塊,檢索增強生成的表現也將更貼近人類的閱讀與思考模式。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

1 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

3 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

7 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

7 小時前