阿里開源 0.8B 文檔解析模型 OvisOCR2,端到端模型首次超越流水線方法

重點摘要
首頁 > 智能時代>人工智能 阿里開源 0.8B 文檔解析模型 OvisOCR2,端到端模型首次超越流水線方法 2026/7/24 14:48:19 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 Domado 的線索投遞! IT之家 7 月 24 日消息,今日,阿里雲開源發佈文檔解析模型 OvisOCR2。該模型以 96.58 的綜合得分刷新 OmniDocBench v1.
阿里雲於今日正式開源全新文檔解析模型 OvisOCR2,這款僅有 0.8B 參數的輕量級模型,在 OmniDocBench v1.6 榜單上以 58 分的綜合得分刷新紀錄,成為首個在該評測中超越傳統流水線方法的端到端模型。官方表示,這項成果標誌著文檔解析領域的技術路線迎來重大突破,也為大模型落地應用提供了更高效、更穩定的基礎設施選項。 文檔解析是當前大規模語言模型落地的關鍵環節之一,無論是企業知識庫建置、RAG(檢索增強生成)系統,還是智慧問答與文件自動化處理,都需要將 PDF、掃描件等非結構化資料轉換為結構化文字。過去,業界普遍採用「流水線方法」來處理這項任務,流程上通常先由版面分析模型辨識文件的佈局結構,再交由內容識別模型分別處理文字、公式、表格等元素,最後將各區塊的結果拼接輸出。 這種多階段串聯的做法雖然經過多年發展已相當成熟,但隨著應用場景日益複雜,其固有缺點也逐漸浮現。首先,流水線方法需要維護多個獨立模型,部署與升級成本高;其次,前端版面分析的誤差會不斷累積到後續的內容識別階段,導致最終輸出品質不穩定;此外,不同模型之間的通訊與協調也增加了系統的複雜度,對於需要快速迭代的企業用戶來說,往往成為效率瓶頸。 OvisOCR2 的推出則從根本上改變了這項遊戲規則。它採用端到端技術路線,使用者在輸入一張文檔圖像後,模型能夠在一次生成過程中直接輸出符合自然閱讀順序的 Markdown 表示,涵蓋文字、公式、表格以及視覺區域等所有元素,無需再經過版面分析與內容識別兩個獨立步驟。這種簡潔的架構不僅大幅降低了維護與部署的門檻,也有效避免了誤差累積的問題。 根據阿里雲公布的測試結果,OvisOCR2 在 OmniDocBench v1.6 的綜合評分達到 58 分,超越所有現有流水線方法,成為該榜單上的第一名。OmniDocBench 是業界公認的文檔解析評測基準,涵蓋多種文件類型與複雜排版,能夠全面評估模型的解析能力。OvisOCR2 的勝出,說明了端到端路線在實際應用中已具備足夠的競爭力。 值得注意的是,OvisOCR2 的參數量僅為 0.8B,相較於許多動輒數十億參數的模型來說,體積極為輕巧,卻能實現超越傳統流水線方法的表現。這也反映出阿里雲在模型設計上對於效率與精準度的平衡考量,讓更多中小型企業也能在有限資源下導入高品質的文檔解析能力。 阿里雲本次開源 OvisOCR2,延續了其在 AI 開源社群的一貫策略,讓開發者與研究人員能夠自由下載、使用與改進模型。開源不僅有助於加速技術普及,也能透過社群回饋進一步優化模型表現。對於正在進行企業知識庫建置或 RAG 系統開發的團隊來說,這款模型提供了一個可直接部署的端到端解決方案,省去自行搭建流水線的繁瑣過程。 在技術細節上,OvisOCR2 的輸入輸出格式也相當直觀。使用者只需將文檔頁面轉為圖像,模型便會自動擷取所有文字、數學公式、表格結構以及圖片等視覺元素,並以標準的 Markdown 語法排列輸出,保留原始文件的閱讀順序。這意味著後續的資料處理與索引工作可以無縫銜接,大幅提升整體流程的自動化程度。 從應用場景來看,OvisOCR2 的潛力十分廣泛。例如,企業可以將大量歷史合約、報告或掃描文件快速轉換為可搜尋的結構化資料;學術機構能夠自動解析論文中的公式與表格,加速知識挖掘;金融與法律領域則可利用其高精度的表格辨識能力,進行資料比對與風險分析。每一次文檔解析的提速,都能直接轉化為業務效率的提升。 業界分析指出,OvisOCR2 的出現可能預示著文檔解析技術路線的轉折點。過去端到端模型雖有概念上的優勢,但實際表現常不如精心調校的流水線組合。如今阿里雲以 0.8B 的小模型證明,端到端路線不僅可行,而且在綜合評分上已經能夠領先。這將激勵更多研究團隊投入端到端架構的開發,並帶動相關工具的快速演進。 對於開發者而言,OvisOCR2 的開源也意味著可以立即在自己的專案中進行測試與整合。阿里雲同步提供了模型權重、使用範例與技術文件,降低入門門檻。未來,隨著社群貢獻與模型迭代,OvisOCR2 的表現還有望進一步提升,為文檔智慧化處理帶來更多可能性。 總結來說,阿里雲此次開源 OvisOCR2 不僅是一項技術成果的發布,更代表著文檔解析領域從流水線到端到端的路線轉移已正式啟動。在 0.8B 參數的輕量級架構下,模型展現出超越傳統方法的實力,為大規模語言模型落地提供了更簡潔、更可靠的基礎設施。對於所有關注 AI 應用的從業者而言,這無疑是一個值得密切關注的進展。
Related
相關文章

外骨骼救得了耐克嗎?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛拿到菲爾茲獎,他現場宣佈加入OpenAI
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

當大模型不再把用戶送回內容平臺,會如何收場?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

對話希捷俞康:AI規模化落地,存儲正成為關鍵基礎設施
隨著人工智慧規模化落地,數據存儲正從被動的資料倉儲轉變為驅動運算的關鍵基礎設施。希捷科技(Seagate)高層俞康在近期對談中指出,面對爆炸性成長的數據需求,單一儲存介質無法滿足所有應用場景,未來將是機械硬碟(HDD)與固態硬碟(SSD)等多種儲存媒介長期共存的格局。 俞康進一步揭露數據中心實際的儲存比例:目前 SSD 約占整體容量的 20%,而機械硬碟仍佔據高達 80% 的份額。

WAIC擠滿“賣鏟人”,但算力服務終究是少數人的遊戲
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

CVPR'26亮點:清華弄了個鏡像錯覺藝術生成器,支持3D打印
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。