MarkTechPost AI模型更新

Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput

2026年7月25日 02:14
Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput

重點摘要

Datalab 正式發布了開源文件轉換管線 Marker 2,這是該工具從底層進行的全面重寫。新版不僅在準確度上大幅躍進,更在處理吞吐量上寫下新標竿,讓開源文件解析領域的競爭態勢為之一變。在第三方基準測試 olmOCR-bench 上,Marker 2 以 76.0% 的整體分數、同時保持數倍於主要競爭對手 MinerU 的處理速度,成為當前兼顧品質與效率的最強開源管線之一。 這次改版的核心,在於 Marker 2 將過去單一的轉換流程,拆解為三條截然不同的路徑。

站內 AI 整理稿

Datalab 正式發布了開源文件轉換管線 Marker 2,這是該工具從底層進行的全面重寫。新版不僅在準確度上大幅躍進,更在處理吞吐量上寫下新標竿,讓開源文件解析領域的競爭態勢為之一變。在第三方基準測試 olmOCR-bench 上,Marker 2 以 76.0% 的整體分數、同時保持數倍於主要競爭對手 MinerU 的處理速度,成為當前兼顧品質與效率的最強開源管線之一。 這次改版的核心,在於 Marker 2 將過去單一的轉換流程,拆解為三條截然不同的路徑。第一條是「balanced」(平衡)模式:由 Surya VLM 負責版面布局分析,並在內嵌文字品質不足時對整個頁面進行重新 OCR。這條路徑專為 GPU 設計,鎖定最高輸出品質,在 olmOCR-bench 上拿下 76.0% 的整體分數,其中原生數位 PDF 的表現更達到 83.5%。第二條是「fast」(快速)模式:改採輕量級的 rf-detr/onnx 布局偵測器與 pdftext 搭配,只有在必要時才動用 VLM,大幅降低計算成本。此模式得分為 66.6%,適合對延遲敏感的場景。第三條是「--disable_ocr」模式:完全繞過 VLM,僅依賴 PDF 本身的文字層,可在純 CPU 環境下運行,得分為 43.6%,但速度可達每秒 23.7 頁。 這些路徑如今的切換也變得更智慧。系統預設會根據裝置自動選擇模式:在 GPU 上採用 balanced,在 CPU 或 MPS 上則自動降為 fast,使用者也可透過 --mode 參數手動覆蓋。這項設計讓 Marker 2 在各種硬體環境下都能發揮最佳表現,不再需要使用者手動調整複雜的設定。 效能上的突破來自架構面的重大革新。Datalab 團隊讓多個輕量 CPU 工作者共享同一個 Surya 推論伺服器,上層進程統一調度 VLM 並發數,使吞吐量不再受限於個別行程的 VRAM 容量,而是依照伺服器整體承載能力線性擴展。報告指出,balanced 模式在單顆 B200 GPU 上可維持每秒約 2.9 頁的持續吞吐量,而過去在同一硬體上串流處理的速率僅有每秒 0.3 頁,效率提升接近十倍。 在與競爭對手的直接比對中,Marker 2 展現了壓倒性的綜合優勢。MinerU 的管線後端在架構上最為接近——同樣是先讀取 PDF 文字層再選擇性 OCR——但其整體分數為 72.7%,吞吐量僅有每秒 0.54 頁。這意味著 Marker 2 的 balanced 模式在分數領先 3.3 個百分點的同時,速度還快了 5.4 倍。即使在原生數位 PDF 這類任務上,兩者分數雖近乎打平(83.5% 對 83.3%),但速度差距依然巨大。若採用 Marker 2 的 fast 模式,吞吐量更可拉開到 MinerU 的 13.7 倍,雖然代價是分數略低 6.1 個百分點。 對比 Docling 的差距則更為懸殊。在同樣的基準測試框架下,Docling 的整體分數為 50.3%,原生數位 PDF 分數為 64.0%,而吞吐量是每秒 2.1 頁。Marker 2 的 balanced 模式無論在準確度(76.0% 對 50.3%)還是速度(2.9 pg/s 對 2.1 pg/s)上都全面勝出。不過 Docling 的優勢在於其治理架構與格式廣度:程式碼採用 MIT 授權、源自 IBM 研究院、目前由 LF AI & Data 基金會託管,輸入格式更涵蓋音訊與電子郵件,在企業合規與多模態需求上有其獨特地位。 LiteParse 則展示了極端的速度與準確度取捨。這套來自 LlamaIndex 團隊的 Rust 解析器,在關閉 OCR 的模式下可達到每秒 1721 頁的吞吐量,是 Marker 2 CPU 模式的 73 倍。然而,其整體分數僅有 22.4%,而 Marker 2 的 CPU-only 模式在同樣條件下得分為 43.6%,兩倍有餘。關鍵差異在於 LiteParse 完全沒有布局模型,一旦文件排版非線性就會崩潰;而 Marker 2 即使在最輕量的設定下,仍搭載了 20M 參數的布局模型在 CPU 上運作,得以保留欄位、表格與標題的結構資訊。 值得注意的是,Datalab 團隊強調 Marker 2 是一套管線而非 VLM,兩者屬於不同層級的工具。在其生態中,頂尖的 VLM 方案如託管的 Chandra 2 分數達 85.8,Gemini Flash 3.5 為 76.4,Ai2 的 olmOCR 2 為 82.4。然而,Marker 2 的 balanced 模式與 Gemini Flash 3.5 的整體分數差距僅有 0.4 個百分點,在原生數位 PDF 上甚至以 83.5% 壓過對手的 79.1%,且完全不需要逐頁呼叫外部 API。這顯示出一條經過精心優化的管線,能在成本與品質之間找到極具競爭力的甜蜜點。 不同的轉換路徑也決定了各自的錯誤特性。在 olmOCR-bench 的八個類別中,數學類別是最鮮明的分水嶺:fast 模式直接從 PDF 文字層讀取方程式,而非進行 VLM OCR,導致 arXiv 數學的分數從 balanced 的 83.9% 驟降至 23.4%,而 --disable_ocr 模式更因為設計限制在此類別掛零。另一方面,舊掃描文件類別則是所有模式共同的弱點,分數最高僅達 43.2%,凸顯了老舊掃描件對任何管線的挑戰。 授權條款的差異,則是商業團隊在選型時不可忽視的環節。Marker 2 的程式碼採用 Apache 2.0,但模型權重使用修改版的 AI Pubs OpenRAIL-M 授權:研究、個人用途以及營收低於 500 萬美元的新創公司可免費使用,超出此範圍的商用部署則需要付費授權。MinerU 則採用基於 Apache 2.0 但附加條件的 MinerU 開源授權,當月活躍用戶超過 1 億或月營收超過 2000 萬美元時必須另購商用授權,且線上服務必須揭露使用事實。Docling 採用寬鬆的 MIT 授權,而 LiteParse 雖為開源,但其背後 LlamaIndex 團隊主推的付費雲端服務 LlamaParse 才是處理複雜文件的商業路徑。 綜合來看,Marker 2 在開源文件轉換領域樹立了新的效率與品質標竿,尤其適合需要大規模批次處理、且硬體資源充足的團隊。然而,正如 Datalab 團隊所提醒,任何基準測試的數字都只是特定文件組合與硬體配置下的快照,真正的選擇必須回歸到自身的工作負載:文件的類型分布、可用的運算資源、授權成本的敏感度、以及對輸出格式與結構保留的要求。團隊應利用 Marker 儲存庫中開放的測試框架,在自己的文件集上實際跑過一輪,才能準確判斷這套管線是否符合真實生產環境的需求。

Related

相關文章

鈦媒體模型更新

賽馬結束,大廠各尋Agent主心骨

賽馬結束,大廠各尋Agent主心骨市象2026.07.25 19:11 · 來自河南全文4460字00:00 / 13:18大廠Agent,不再養蠱。文 | 市象重複造輪時代過了。“之前(智能體)最大風險是押錯方向,現在是重複建設。”一位接近AI行業人士向「市象」表示:“資金和算力太大了,賽馬也不可能是長久之計。”過去,國內大廠面對龍蝦熱潮大幹快上,將一批換殼龍蝦拋入市場。如今,面對滿地“龍蝦殼”,大廠準備收網。7月2日,阿里巴巴宣佈融合QoderWork、悟空與MuleRun,升級為全新產品千問辦公,由釘釘CEO陳宇森統管。7月20日,騰訊將QClaw產品中心的相關業務和團隊,調整至WorkBuddy所屬的雲產品六部。這兩場變動,也成了龍蝦潮的收尾。大廠辦公智能體矩陣,是在OpenClaw火箭上升後的恐慌應激反應。今年3月,OpenClaw火速登頂GitHub歷史星標榜後,騰訊Qclaw、字節火山ArkClaw、阿里JVS Claw迅速跟上。短時間內,基於OpenClaw封裝或兼容的套殼龍蝦被批量產出。倉促上線的代價是,一家公司內各產品功能高度重疊,均集中在白領辦公場景,只是入口和流量不同。比如MuleRun從阿里雲切入,QoderWork從桌面端切入,悟空從釘釘協同切入。在騰訊,WorkBuddy和Qclaw一個是騰訊雲做的,一個是騰訊電腦管家做的,用戶自己都難以分清。在字節,內部做了至少四款智能體——飛書妙搭OpenClaw、火山引擎ArkClaw、釦子OpenClaw、Trae Work,多個團隊分別對OpenClaw產品化改裝。多產品線賽馬,優點是想法多,創意多,缺點是資源太分散,只適合防守,打不了大仗。OpenClaw曾用三天迭代三個版本,以一個退休程序員的週末項目擊穿了大廠防線。騰訊WorkBuddy與Qclaw的整合,阿里整合千問辦公,本質上都帶有止損意味。

2 小時前
MarkTechPost AI模型更新

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

本教學介紹如何使用TileLang這個高階Python領域專用語言,透過TVM設計與編譯高效能GPU核心,涵蓋向量加法、張量核心矩陣乘法、融合Softmax與FlashAttention等實作。過程中直接操作TileLang的共享記憶體區塊、暫存器片段、管線迴圈等抽象,並讓編譯器管理執行緒映射與低層CUDA指令生成,最後與PyTorch及cuBLAS基準比較,並使用自動調優找出架構相依的核心配置。

3 小時前

黃仁勳站在 AI 產業的十字路口吶喊:力挺開源

# 黃仁勳站在 AI 產業的十字路口吶喊:力挺開源 7月24日,英偉達創始人兼CEO黃仁勳做了一件他從未做過的事情——在社交平台X上發布了人生第一條帖子。沒有皮衣照,沒有新產品預告,甚至沒有任何寒暄。他直接甩出了一封由25家頂級科技公司聯名簽署的公開信,標題為「開放權重與美國AI領導力」。配文擲地有聲:「AI將改變每一個行業、驅動每一家公司、被每一個國家所構建。世界需要前沿的閉源模型,也需要前沿的開源模型。」 這條推文迅速引爆了全球科技圈。截至發稿,該帖子已獲得超過2500萬次瀏覽和11萬次點讚。

9 小時前