MarkTechPost AI模型更新

Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput

2026年7月25日 02:14
Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput

重點摘要

Datalab 正式發布了開源文件轉換管線 Marker 2,這是該工具從底層進行的全面重寫。新版不僅在準確度上大幅躍進,更在處理吞吐量上寫下新標竿,讓開源文件解析領域的競爭態勢為之一變。在第三方基準測試 olmOCR-bench 上,Marker 2 以 76.0% 的整體分數、同時保持數倍於主要競爭對手 MinerU 的處理速度,成為當前兼顧品質與效率的最強開源管線之一。 這次改版的核心,在於 Marker 2 將過去單一的轉換流程,拆解為三條截然不同的路徑。

站內 AI 整理稿

Datalab 正式發布了開源文件轉換管線 Marker 2,這是該工具從底層進行的全面重寫。新版不僅在準確度上大幅躍進,更在處理吞吐量上寫下新標竿,讓開源文件解析領域的競爭態勢為之一變。在第三方基準測試 olmOCR-bench 上,Marker 2 以 76.0% 的整體分數、同時保持數倍於主要競爭對手 MinerU 的處理速度,成為當前兼顧品質與效率的最強開源管線之一。這次改版的核心,在於 Marker 2 將過去單一的轉換流程,拆解為三條截然不同的路徑。第一條是「balanced」(平衡)模式:由 Surya VLM 負責版面布局分析,並在內嵌文字品質不足時對整個頁面進行重新 OCR。

這條路徑專為 GPU 設計,鎖定最高輸出品質,在 olmOCR-bench 上拿下 76.0% 的整體分數,其中原生數位 PDF 的表現更達到 83.5%。第二條是「fast」(快速)模式:改採輕量級的 rf-detr/onnx 布局偵測器與 pdftext 搭配,只有在必要時才動用 VLM,大幅降低計算成本。此模式得分為 66.6%,適合對延遲敏感的場景。第三條是「--disable_ocr」模式:完全繞過 VLM,僅依賴 PDF 本身的文字層,可在純 CPU 環境下運行,得分為 43.6%,但速度可達每秒 23.7 頁。這些路徑如今的切換也變得更智慧。

系統預設會根據裝置自動選擇模式:在 GPU 上採用 balanced,在 CPU 或 MPS 上則自動降為 fast,使用者也可透過 --mode 參數手動覆蓋。這項設計讓 Marker 2 在各種硬體環境下都能發揮最佳表現,不再需要使用者手動調整複雜的設定。效能上的突破來自架構面的重大革新。Datalab 團隊讓多個輕量 CPU 工作者共享同一個 Surya 推論伺服器,上層進程統一調度 VLM 並發數,使吞吐量不再受限於個別行程的 VRAM 容量,而是依照伺服器整體承載能力線性擴展。報告指出,balanced 模式在單顆 B200 GPU 上可維持每秒約 2.

9 頁的持續吞吐量,而過去在同一硬體上串流處理的速率僅有每秒 0.3 頁,效率提升接近十倍。在與競爭對手的直接比對中,Marker 2 展現了壓倒性的綜合優勢。MinerU 的管線後端在架構上最為接近——同樣是先讀取 PDF 文字層再選擇性 OCR——但其整體分數為 72.7%,吞吐量僅有每秒 0.54 頁。這意味著 Marker 2 的 balanced 模式在分數領先 3.3 個百分點的同時,速度還快了 5.4 倍。即使在原生數位 PDF 這類任務上,兩者分數雖近乎打平(83.5% 對 83.3%),但速度差距依然巨大。

若採用 Marker 2 的 fast 模式,吞吐量更可拉開到 MinerU 的 13.7 倍,雖然代價是分數略低 6.1 個百分點。對比 Docling 的差距則更為懸殊。在同樣的基準測試框架下,Docling 的整體分數為 50.3%,原生數位 PDF 分數為 64.0%,而吞吐量是每秒 2.1 頁。Marker 2 的 balanced 模式無論在準確度(76.0% 對 50.3%)還是速度(2.9 pg/s 對 2.1 pg/s)上都全面勝出。

不過 Docling 的優勢在於其治理架構與格式廣度:程式碼採用 MIT 授權、源自 IBM 研究院、目前由 LF AI & Data 基金會託管,輸入格式更涵蓋音訊與電子郵件,在企業合規與多模態需求上有其獨特地位。LiteParse 則展示了極端的速度與準確度取捨。這套來自 LlamaIndex 團隊的 Rust 解析器,在關閉 OCR 的模式下可達到每秒 1721 頁的吞吐量,是 Marker 2 CPU 模式的 73 倍。然而,其整體分數僅有 22.4%,而 Marker 2 的 CPU-only 模式在同樣條件下得分為 43.6%,兩倍有餘。

關鍵差異在於 LiteParse 完全沒有布局模型,一旦文件排版非線性就會崩潰;而 Marker 2 即使在最輕量的設定下,仍搭載了 20M 參數的布局模型在 CPU 上運作,得以保留欄位、表格與標題的結構資訊。值得注意的是,Datalab 團隊強調 Marker 2 是一套管線而非 VLM,兩者屬於不同層級的工具。在其生態中,頂尖的 VLM 方案如託管的 Chandra 2 分數達 85.8,Gemini Flash 3.5 為 76.4,Ai2 的 olmOCR 2 為 82.4。然而,Marker 2 的 balanced 模式與 Gemini Flash 3.

5 的整體分數差距僅有 0.4 個百分點,在原生數位 PDF 上甚至以 83.5% 壓過對手的 79.1%,且完全不需要逐頁呼叫外部 API。這顯示出一條經過精心優化的管線,能在成本與品質之間找到極具競爭力的甜蜜點。不同的轉換路徑也決定了各自的錯誤特性。在 olmOCR-bench 的八個類別中,數學類別是最鮮明的分水嶺:fast 模式直接從 PDF 文字層讀取方程式,而非進行 VLM OCR,導致 arXiv 數學的分數從 balanced 的 83.9% 驟降至 23.4%,而 --disable_ocr 模式更因為設計限制在此類別掛零。

另一方面,舊掃描文件類別則是所有模式共同的弱點,分數最高僅達 43.2%,凸顯了老舊掃描件對任何管線的挑戰。授權條款的差異,則是商業團隊在選型時不可忽視的環節。Marker 2 的程式碼採用 Apache 2.0,但模型權重使用修改版的 AI Pubs OpenRAIL-M 授權:研究、個人用途以及營收低於 500 萬美元的新創公司可免費使用,超出此範圍的商用部署則需要付費授權。MinerU 則採用基於 Apache 2.0 但附加條件的 MinerU 開源授權,當月活躍用戶超過 1 億或月營收超過 2000 萬美元時必須另購商用授權,且線上服務必須揭露使用事實。

Docling 採用寬鬆的 MIT 授權,而 LiteParse 雖為開源,但其背後 LlamaIndex 團隊主推的付費雲端服務 LlamaParse 才是處理複雜文件的商業路徑。綜合來看,Marker 2 在開源文件轉換領域樹立了新的效率與品質標竿,尤其適合需要大規模批次處理、且硬體資源充足的團隊。然而,正如 Datalab 團隊所提醒,任何基準測試的數字都只是特定文件組合與硬體配置下的快照,真正的選擇必須回歸到自身的工作負載:文件的類型分布、可用的運算資源、授權成本的敏感度、以及對輸出格式與結構保留的要求。

團隊應利用 Marker 儲存庫中開放的測試框架,在自己的文件集上實際跑過一輪,才能準確判斷這套管線是否符合真實生產環境的需求。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

47 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

48 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前