騰訊混元發佈 HyOCR-1.5:僅 1B 參數 推理提速 6.37 倍
重點摘要
騰訊混元發佈輕量化端到端 OCR 專家模型 HyOCR-1.5,僅 1B 參數,並透過 DFlash 投機解碼框架實現推理速度最高 6.37 倍提升。該模型為首個全棧開源 OCR 模型,公開權重、訓練配方與推理框架,在 OmniDocBench 評測中表現優異,部分任務性能可與 8B 參數通用模型比肩。
騰訊混元團隊近日正式推出輕量化端到端 OCR 專家模型 HyOCR-1.5,這款僅有 1B 參數規模的模型,在維持極簡架構的同時,透過一系列技術突破實現了性能與效率的顯著躍升。作為該領域首個全棧開源模型,HyOCR-1.5 不僅將模型權重公開釋出,更連同訓練配方、資料建構方法及推理加速框架一併向開發社群開放,大幅降低進入門檻,讓開發者能在消費級顯示卡或一般筆記型電腦上輕鬆復現、微調甚至直接部署。針對過往長自迴歸解碼造成的延遲瓶頸,團隊導入名為「DFlash」的投機解碼框架。該框架利用一個約 90.7M 參數的輕量級草稿模型進行並行預測,在維持輸出準確性的前提下,成功將推理速度提升數倍。
根據權威評測 OmniDocBench 的數據,在 Transformers 架構下,HyOCR-1.5 的推理速度最高可達到 6.37 倍的加速效果,成為目前端到端 OCR 模型中的效能佼佼者。在模型能力的進化上,HyOCR-1.5 採用了「智能體驅動數據流」的創新策略。研發團隊將模型在實務中表現較弱的環節,轉化為具體的任務目標,交由智能體自主拆解、蒐集相關語料並進行清洗驗證。這種閉環訓練模式有效補足了古文字辨識、低資源語種處理以及跨頁多圖問答等長尾場景的短板。此外,模型支援 4K 解析度輸入,並搭配 128K 上下文窗口進行訓練最佳化,使其在處理複雜文檔時的穩定度與準確度大幅提升。
評測數據顯示,儘管 HyOCR-1.5 僅有 1B 參數,但在多項任務中展現出「越級」表現。在 OmniDocBench v1.6 上,它不僅穩居端到端 OCR 模型的第一梯隊,在古文字辨識及圖表解析等特定任務中,其性能甚至可與 8B 參數規模的通用模型相匹敵。這意味著輕量化模型也能在專業領域達到高水準表現。HyOCR-1.5 的推出,象徵著端到端 OCR 大模型正朝向更輕量、更普及的方向邁進。透過將感知與理解能力深度融合,該模型不僅為企業級部署提供了高效率的解決方案,也為個人電腦端的本地化文檔智能處理奠定了堅實基礎。開發者無需依賴昂貴的雲端運算資源,即可在本地實現複雜的文件識別與分析功能。
從技術架構來看,HyOCR-1.5 的輕量化設計使其在部署上極具彈性。1B 參數的規模意味著它能夠在記憶體限制較低的裝置上運行,同時維持高精度的辨識效果。DFlash 投機解碼框架的引入,更進一步解決了端到端模型常見的推理延遲問題,讓即時性應用成為可能。此外,團隊對於開源生態的投入也備受關注。除了模型權重,訓練配方與資料建構方法的公開,讓學術界與產業界能夠深入理解模型的訓練歷程,並在此基礎上進行二次開發。這種開放態度有助於加速 OCR 技術的迭代與落地應用。總體而言,HyOCR-1.5 的問世不僅展示了輕量化模型在專業領域的潛力,也為文檔智能處理的普及化開啟了新篇章。
隨著開發者社群開始接觸這款全棧開源模型,預計將有更多創新的應用場景湧現,進一步推動 OCR 技術從雲端走向邊緣,從企業走向個人。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。