阿里開源 0.8B 文檔解析模型 OvisOCR2,端到端模型首次超越流水線方法

2026年7月24日 14:48
阿里開源 0.8B 文檔解析模型 OvisOCR2,端到端模型首次超越流水線方法

重點摘要

首頁 > 智能時代>人工智能 阿里開源 0.8B 文檔解析模型 OvisOCR2,端到端模型首次超越流水線方法 2026/7/24 14:48:19 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 Domado 的線索投遞! IT之家 7 月 24 日消息,今日,阿里雲開源發佈文檔解析模型 OvisOCR2。該模型以 96.58 的綜合得分刷新 OmniDocBench v1.

站內 AI 整理稿

阿里雲於今日正式開源全新文檔解析模型 OvisOCR2,這款僅有 0.8B 參數的輕量級模型,在 OmniDocBench v1.6 榜單上以 58 分的綜合得分刷新紀錄,成為首個在該評測中超越傳統流水線方法的端到端模型。官方表示,這項成果標誌著文檔解析領域的技術路線迎來重大突破,也為大模型落地應用提供了更高效、更穩定的基礎設施選項。文檔解析是當前大規模語言模型落地的關鍵環節之一,無論是企業知識庫建置、RAG(檢索增強生成)系統,還是智慧問答與文件自動化處理,都需要將 PDF、掃描件等非結構化資料轉換為結構化文字。

過去,業界普遍採用「流水線方法」來處理這項任務,流程上通常先由版面分析模型辨識文件的佈局結構,再交由內容識別模型分別處理文字、公式、表格等元素,最後將各區塊的結果拼接輸出。這種多階段串聯的做法雖然經過多年發展已相當成熟,但隨著應用場景日益複雜,其固有缺點也逐漸浮現。首先,流水線方法需要維護多個獨立模型,部署與升級成本高;其次,前端版面分析的誤差會不斷累積到後續的內容識別階段,導致最終輸出品質不穩定;此外,不同模型之間的通訊與協調也增加了系統的複雜度,對於需要快速迭代的企業用戶來說,往往成為效率瓶頸。OvisOCR2 的推出則從根本上改變了這項遊戲規則。

它採用端到端技術路線,使用者在輸入一張文檔圖像後,模型能夠在一次生成過程中直接輸出符合自然閱讀順序的 Markdown 表示,涵蓋文字、公式、表格以及視覺區域等所有元素,無需再經過版面分析與內容識別兩個獨立步驟。這種簡潔的架構不僅大幅降低了維護與部署的門檻,也有效避免了誤差累積的問題。根據阿里雲公布的測試結果,OvisOCR2 在 OmniDocBench v1.6 的綜合評分達到 58 分,超越所有現有流水線方法,成為該榜單上的第一名。OmniDocBench 是業界公認的文檔解析評測基準,涵蓋多種文件類型與複雜排版,能夠全面評估模型的解析能力。

OvisOCR2 的勝出,說明了端到端路線在實際應用中已具備足夠的競爭力。值得注意的是,OvisOCR2 的參數量僅為 0.8B,相較於許多動輒數十億參數的模型來說,體積極為輕巧,卻能實現超越傳統流水線方法的表現。這也反映出阿里雲在模型設計上對於效率與精準度的平衡考量,讓更多中小型企業也能在有限資源下導入高品質的文檔解析能力。阿里雲本次開源 OvisOCR2,延續了其在 AI 開源社群的一貫策略,讓開發者與研究人員能夠自由下載、使用與改進模型。開源不僅有助於加速技術普及,也能透過社群回饋進一步優化模型表現。

對於正在進行企業知識庫建置或 RAG 系統開發的團隊來說,這款模型提供了一個可直接部署的端到端解決方案,省去自行搭建流水線的繁瑣過程。在技術細節上,OvisOCR2 的輸入輸出格式也相當直觀。使用者只需將文檔頁面轉為圖像,模型便會自動擷取所有文字、數學公式、表格結構以及圖片等視覺元素,並以標準的 Markdown 語法排列輸出,保留原始文件的閱讀順序。這意味著後續的資料處理與索引工作可以無縫銜接,大幅提升整體流程的自動化程度。從應用場景來看,OvisOCR2 的潛力十分廣泛。

例如,企業可以將大量歷史合約、報告或掃描文件快速轉換為可搜尋的結構化資料;學術機構能夠自動解析論文中的公式與表格,加速知識挖掘;金融與法律領域則可利用其高精度的表格辨識能力,進行資料比對與風險分析。每一次文檔解析的提速,都能直接轉化為業務效率的提升。業界分析指出,OvisOCR2 的出現可能預示著文檔解析技術路線的轉折點。過去端到端模型雖有概念上的優勢,但實際表現常不如精心調校的流水線組合。如今阿里雲以 0.8B 的小模型證明,端到端路線不僅可行,而且在綜合評分上已經能夠領先。這將激勵更多研究團隊投入端到端架構的開發,並帶動相關工具的快速演進。

對於開發者而言,OvisOCR2 的開源也意味著可以立即在自己的專案中進行測試與整合。阿里雲同步提供了模型權重、使用範例與技術文件,降低入門門檻。未來,隨著社群貢獻與模型迭代,OvisOCR2 的表現還有望進一步提升,為文檔智慧化處理帶來更多可能性。總結來說,阿里雲此次開源 OvisOCR2 不僅是一項技術成果的發布,更代表著文檔解析領域從流水線到端到端的路線轉移已正式啟動。在 0.8B 參數的輕量級架構下,模型展現出超越傳統方法的實力,為大規模語言模型落地提供了更簡潔、更可靠的基礎設施。對於所有關注 AI 應用的從業者而言,這無疑是一個值得密切關注的進展。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

剛剛

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

剛剛

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

剛剛

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

剛剛

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

剛剛

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

剛剛