騰訊混元發佈 HyOCR-1.5:僅 1B 參數 推理提速 6.37 倍

2026年7月14日 02:016600 次瀏覽

重點摘要

騰訊混元發佈輕量化端到端 OCR 專家模型 HyOCR-1.5,僅 1B 參數,並透過 DFlash 投機解碼框架實現推理速度最高 6.37 倍提升。該模型為首個全棧開源 OCR 模型,公開權重、訓練配方與推理框架,在 OmniDocBench 評測中表現優異,部分任務性能可與 8B 參數通用模型比肩。

站內 AI 整理稿

騰訊混元團隊近日正式推出輕量化端到端 OCR 專家模型 HyOCR-1.5,這款僅有 1B 參數規模的模型,在維持極簡架構的同時,透過一系列技術突破實現了性能與效率的顯著躍升。作為該領域首個全棧開源模型,HyOCR-1.5 不僅將模型權重公開釋出,更連同訓練配方、資料建構方法及推理加速框架一併向開發社群開放,大幅降低進入門檻,讓開發者能在消費級顯示卡或一般筆記型電腦上輕鬆復現、微調甚至直接部署。針對過往長自迴歸解碼造成的延遲瓶頸,團隊導入名為「DFlash」的投機解碼框架。該框架利用一個約 90.7M 參數的輕量級草稿模型進行並行預測,在維持輸出準確性的前提下,成功將推理速度提升數倍。

根據權威評測 OmniDocBench 的數據,在 Transformers 架構下,HyOCR-1.5 的推理速度最高可達到 6.37 倍的加速效果,成為目前端到端 OCR 模型中的效能佼佼者。在模型能力的進化上,HyOCR-1.5 採用了「智能體驅動數據流」的創新策略。研發團隊將模型在實務中表現較弱的環節,轉化為具體的任務目標,交由智能體自主拆解、蒐集相關語料並進行清洗驗證。這種閉環訓練模式有效補足了古文字辨識、低資源語種處理以及跨頁多圖問答等長尾場景的短板。此外,模型支援 4K 解析度輸入,並搭配 128K 上下文窗口進行訓練最佳化,使其在處理複雜文檔時的穩定度與準確度大幅提升。

評測數據顯示,儘管 HyOCR-1.5 僅有 1B 參數,但在多項任務中展現出「越級」表現。在 OmniDocBench v1.6 上,它不僅穩居端到端 OCR 模型的第一梯隊,在古文字辨識及圖表解析等特定任務中,其性能甚至可與 8B 參數規模的通用模型相匹敵。這意味著輕量化模型也能在專業領域達到高水準表現。HyOCR-1.5 的推出,象徵著端到端 OCR 大模型正朝向更輕量、更普及的方向邁進。透過將感知與理解能力深度融合,該模型不僅為企業級部署提供了高效率的解決方案,也為個人電腦端的本地化文檔智能處理奠定了堅實基礎。開發者無需依賴昂貴的雲端運算資源,即可在本地實現複雜的文件識別與分析功能。

從技術架構來看,HyOCR-1.5 的輕量化設計使其在部署上極具彈性。1B 參數的規模意味著它能夠在記憶體限制較低的裝置上運行,同時維持高精度的辨識效果。DFlash 投機解碼框架的引入,更進一步解決了端到端模型常見的推理延遲問題,讓即時性應用成為可能。此外,團隊對於開源生態的投入也備受關注。除了模型權重,訓練配方與資料建構方法的公開,讓學術界與產業界能夠深入理解模型的訓練歷程,並在此基礎上進行二次開發。這種開放態度有助於加速 OCR 技術的迭代與落地應用。總體而言,HyOCR-1.5 的問世不僅展示了輕量化模型在專業領域的潛力,也為文檔智能處理的普及化開啟了新篇章。

隨著開發者社群開始接觸這款全棧開源模型,預計將有更多創新的應用場景湧現,進一步推動 OCR 技術從雲端走向邊緣,從企業走向個人。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

42 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前