AI日報:混元發佈HyOCR-1.5;PixVerse完成4.39億美元融資;商湯開源 SenseNova-Vision-7B-MoT
重點摘要
AI資訊最新AI日報正文AI日報:混元發佈HyOCR-1.5;PixVerse完成4.39億美元融資;商湯開源 SenseNova-Vision-7B-MoT發布於最新AI日報時間 :Jul 14, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。新鮮AI產品點擊瞭解:https://app.aibase.
根據AI日報報導,2026年7月14日,人工智慧領域迎來多項重量級動態,涵蓋電腦視覺、基礎模型融資與開源生態發展。騰訊混元推出全新輕量化光學字元辨識(OCR)模型HyOCR-1.5,PixVerse宣布完成4.39億美元融資,商湯科技則正式開源其視覺模型SenseNova-Vision-7B-MoT。三項消息分別從技術突破、資金動能與開源共享面向,展現當前AI產業的活躍景象。首先在電腦視覺技術方面,騰訊混元團隊正式發布HyOCR-1.5。這款模型定位為輕量級端到端OCR解決方案,目標在兼顧效能與效率的同時,降低開發者導入OCR技術的門檻。HyOCR-1.
5並非單純追求參數規模,而是透過多項架構創新實現性能飛躍。團隊同時選擇開放全棧原始碼,讓學術界與產業界能夠直接取用、調整與部署,進一步推動OCR技術在更多場景落地。HyOCR-1.5的核心技術亮點包括引入名為「DFlash」的投機解碼框架。該框架針對推論階段進行最佳化,能夠在不犧牲辨識精準度的前提下,顯著提升模型在實際運行時的回應速度,對於需要即時處理大量文字影像的應用尤為關鍵。此外,模型採用「智能體驅動數據流」策略,這種訓練方法模擬動態場景中的多樣化輸入,使模型在面對不同字體、光源與背景干擾時,仍能維持穩定的辨識能力。據AI日報資訊,HyOCR-1.
5在數項標準OCR任務中展現出優異表現,其成效甚至超越目前市場上多款同類輕量模型。混元團隊強調,該模型不僅在公共資料集上取得領先分數,在實際場景的泛化能力同樣經得起考驗。透過開放原始碼,混元期望能吸引更多開發者投入基於OCR的創新應用,從自動化文件處理到智慧零售辨識等,加速相關領域的技術普及。另一項引發市場關注的是PixVerse完成的巨額融資。根據AI日報資訊,該公司成功籌集4.39億美元資金,但具體投資方與資金用途尚未完全揭露。這筆融資規模在當前AI投資環境中屬於頂尖水準,反映出資本市場對PixVerse技術路線與商業前景的高度期待。
儘管公司並未同時發布新產品,此輪融資仍被視為AI視覺內容生成領域的重要注資事件,預料將推升該賽道的競爭熱度。在開源模型陣營方面,商湯科技宣布正式開源SenseNova-Vision-7B-MoT。這款視覺模型的名稱揭示了其7B參數規模以及特殊的模型架構設計。商湯近年積極布局通用視覺與多模態技術,此次開源進一步延續其SenseNova系列的開放策略,讓研究人員與開發者能夠以較低成本取得先進視覺模型,進行微調與二次開發。此舉有助於打破大型模型由少數企業壟斷的局面,促進視覺AI技術的協作創新。從整體趨勢來看,這三則消息呈現出AI產業目前幾個顯著方向:一是技術持續朝輕量高效發展,HyOCR-1.
5在保持模型精簡的同時透過架構創新突破效能瓶頸,這類端側可部署的模型對邊緣運算場景極為重要;二是資本雖有降溫傳聞,但針對特定優質團隊的巨額投資仍不間斷,PixVerse的4.39億美元即為明確訊號;三是開源生態進入模型層級的競爭,商湯此舉不僅強化品牌影響力,也為其開發者社群注入新動能。針對HyOCR-1.5的細節,開發團隊指出,DFlash投機解碼框架的核心概念是利用模型自身的預測能力,在推理過程中同時探索多個候選輸出,再透過驗證機制篩選出正確結果。這種策略不僅減少逐字元解碼所需的內部迭代次數,更在硬體加速器上能更有效地利用計算資源。搭配輕量化的整體設計,使HyOCR-1.
5即使在CPU環境或低功耗裝置上,仍能實現流暢的辨識速度。「智能體驅動數據流」策略則從訓練資料端著手,模擬智慧體在真實世界中可能遭遇的各種文字干擾,例如彎曲表面、部分遮蔽或不均勻光照。透過這種對抗式資料生成方式,模型學會忽略無關雜訊而專注於文字輪廓與結構。這種方法提升了模型對抗域外樣本的穩定性,也減少後續對大量人工標註資料的依賴。商湯的SenseNova-Vision-7B-MoT開源後,開發者可在其官方平台與GitHub等渠道取得模型權重與使用範例。該模型繼承了SenseNova系列在多模態理解上的基礎能力,專注於視覺特徵提取與表示。
7B參數量級在學術研究與中小型應用場景中屬於實用範圍,既能保有相當的表達力,又不至於需要極端高昂的運算資源。結合開放授權條款,預期將帶動一批圍繞視覺理解、物體偵測與圖像生成的新實驗。綜合來看,AI日報此波報導顯示2026年夏季的AI產業並未放緩腳步。混元、PixVerse與商湯分別從技術產品、市場資金與開放社群等不同面向,為業界注入新話題。HyOCR-1.5的開源可能促使更多開發者投入文檔智慧化與自動辨識領域;PixVerse的巨額融資則讓市場重新審視視覺內容生成商業模式的潛力;而商湯的持續開源,則有助於維持亞洲AI研究圈在全球開源社群中的能見度。未來相關動態如何演變,值得持續關注。
Related
相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑
阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

Caviar 推出 24K 鍍金版 Meta 雷朋智能眼鏡 Odyssey,售價 6130 美元限量 24 副
Caviar 推出限量 24 副的 Odyssey 智能眼鏡,以 Meta Ray-Ban 為基礎,提供 24K 金與 925 銀裝飾版本,售價分別為 6130 美元與 6840 美元。該產品保留原版功能,並附帶鱷魚皮充電盒,展現奢華工藝。

Suno 平臺將為 AI 生成音樂添加隱水印,防止濫用現象發生
Suno 平台將為其AI生成的音樂加入隱藏式音頻水印與指紋識別技術,以便在其他平台上被上傳時可辨識來源。此舉是因應索尼、環球等音樂巨頭組成的聯盟,要求防止AI音樂濫用並禁止其進入全球排行榜。

AI寫的PR堆成山,Rust已忍無可忍
Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

內置 10TOPS INT8 算力:韓 Mobilint 推出 USB AI 加速器 MLD-R1
韓國NPU企業Mobilint推出USB外接AI加速器MLD-R1,內建REGULUS AI SoC,提供10TOPS INT8算力與4核Arm處理器。該裝置支援多種AI框架與作業系統,功耗僅3W,具備IP65防塵防水,適合邊緣運算場景。

AI 藝人“方桃子”帶貨美瞳廣告遭下架,聲稱“戴了一天都很舒服”
AI 虛擬藝人「方桃子」因推廣美瞳廣告,聲稱「戴了一天都很舒服」引發爭議,網友質疑其無真實眼睛無法體驗產品效果。該廣告目前已從抖音下架,可能涉及違反《中華人民共和國廣告法》中關於虛假或誤導性內容的規定。