阿里開源0.8B文檔解析模型OvisOCR2,端到端方案登頂OmniDocBench
重點摘要
AI資訊AI新閒資訊正文阿里開源0.8B文檔解析模型OvisOCR2,端到端方案登頂OmniDocBench發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘7月24日,阿里巴巴宣佈開源發佈僅0.8B參數規模的文檔解析模型OvisOCR2。在權威文檔解析基準OmniDocBench v1.6評估中,該模型以96.
阿里巴巴於7月24日正式宣布開源發布文檔解析模型OvisOCR2,這款僅有0.8B參數規模的輕量級模型,在權威文檔解析基準OmniDocBench v1.58上拿下綜合得分第一,成為首個全面超越傳統流水線方法的端到端文檔解析模型,為文檔智能技術帶來重要的範式轉折。長期以來,文檔解析作為RAG檢索、智慧問答與企業知識庫的核心基礎設施,普遍採用「版面分析+內容識別」的流水線串聯模式。這種傳統方法雖然成熟,但存在維護成本高、誤差逐級累積以及部署流程複雜等瓶頸。
OvisOCR2的出現,直接打破了這些限制,僅憑單一模型一次生成,就能按照自然閱讀順序輸出包含文本、公式、表格與視覺區域的完整Markdown表示。在技術實現上,OvisOCR2採用了真實數據與合成數據互補的訓練路徑,並透過監督微調(SFT)、強化學習(RL)、在線策略蒸餾(OPD)以及模型融合四大手段,充分釋放緊湊模型的潛力。這使得僅0.8B參數的模型能夠在OmniDocBench上擊敗許多參數量更大的傳統方案,展現出極高的效率與精準度。OmniDocBench是業界廣泛採用的文檔解析評測基準,涵蓋多種文件類型與複雜版面。
OvisOCR2在此基準的綜合得分首度超越所有傳統流水線方法,意味著端到端模型正式具備取代舊有架構的能力。這項突破不僅降低了文檔解析的部署門檻,也讓企業在構建知識庫與問答系統時,能獲得更穩定、更一致的解析結果。目前,OvisOCR2已基於Apache 2.0協議在Hugging Face及魔搭社區全面開源。開發者可以直接下載模型權重,並相容vLLM等主流推理框架,無縫接入千問生態系統。這項做法大幅降低了使用門檻,讓更多團隊能夠快速將先進的文檔解析能力整合到自己的應用中。值得注意的是,OvisOCR2雖然參數量僅0.
8B,但透過精心設計的訓練策略,在文本、公式、表格與視覺區域的識別上均達到業界領先水準。這對於需要處理大量技術文件、學術論文、財務報表或合約的企業而言,尤其具有實用價值。傳統的流水線方法往往需要分別訓練版面分析模型與OCR模型,再透過複雜的後處理串接,而OvisOCR2則以單一模型一次完成所有任務,大幅簡化流程。阿里巴巴此次開源,也顯示出在文檔智慧領域的持續投入。OvisOCR2的推出,不僅是技術上的突破,更代表著開源生態在AI基礎設施上的重要進展。開發者可以透過Hugging Face或魔搭社區取得模型,並根據自身需求進行微調或部署,彈性極高。
從技術細節來看,OvisOCR2的訓練流程中,監督微調(SFT)階段讓模型學會從輸入圖像直接生成結構化Markdown;強化學習(RL)則進一步優化模型在複雜版面下的輸出順序與準確度;在線策略蒸餾(OPD)技術則讓小型模型能夠吸收大型教師模型的知識,同時保持高效率推理;最後的模型融合技術則整合多個模型優勢,提升整體表現。這些技術手段的組合,使得OvisOCR2在保持輕量化的同時,仍能達到頂尖的解析效果。對於資源受限的邊緣設備或需要快速響應的即時場景,0.8B的參數規模極具吸引力,企業可以以較低的運算成本獲得高品質的文檔解析服務。
隨著OvisOCR2的開源,文檔解析領域的競爭格局可能出現顯著變化。過去,端到端模型雖然概念上具有優勢,但實際表現往往不如精心調校的流水線系統。如今OvisOCR2在OmniDocBench上的成績,證明端到端方案已經成熟,足以成為主流選擇。此外,OvisOCR2也能夠與千問生態中的其他模型無縫整合,例如搭配千問的大型語言模型進行更深入的問答與分析,形成完整的文檔智能處理鏈路。阿里巴巴表示,未來將持續優化模型,並歡迎社群貢獻更多應用場景與回饋。對於開發者與企業用戶而言,OvisOCR2的開源不僅提供了一個高效能的文檔解析工具,更降低了嘗試新技術的風險。Apache 2.
0協議允許商用與修改,讓企業可以放心導入生產環境。目前已有不少開源社群成員開始嘗試將OvisOCR2整合到RAG系統與知識庫建置工具中,初期回饋普遍正面。總體來看,OvisOCR2的發布標誌著文檔解析技術從傳統流水線邁向端到端架構的關鍵一步。阿里巴巴選擇以開源方式推動這項技術普及,有望加速整個AI基礎設施的升級,讓更多應用能夠受惠於更精準、更高效的文件理解能力。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。