商湯開源SenseNova-Vision統一視覺大模型,單模型橫掃四大核心視覺任務
重點摘要
AI資訊AI新閒資訊正文商湯開源SenseNova-Vision統一視覺大模型,單模型橫掃四大核心視覺任務發布於AI新閒資訊時間 :Jul 13, 2026閱讀 :1分鐘商湯科技正式發佈並全面開源"日日新SenseNova-Vision"理解生成統一視覺大模型,這是商湯日日新大模型體系的重要視覺能力升級。
# 商湯全面開源SenseNova-Vision統一視覺大模型,單模型橫掃四大核心視覺任務
商湯科技日前正式宣布,其自主研發的「日日新SenseNova-Vision」理解生成統一視覺大模型已全面開源。這一重大技術突破標誌著視覺AI從「多模型拼湊」正式邁向「單模型全能」的新紀元。作為商湯日日新大模型體系的核心視覺能力升級,SenseNova-Vision以顛覆性的統一架構,首次實現單一模型在結構化理解、稠密幾何預測、全景分割以及多視角3D重建等四大核心視覺領域的全面覆蓋,性能比肩甚至超越各領域專用專家模型。 ## 告別「拼圖式」統一,原生融合成最大亮點
長期以來,業界所謂的「統一視覺」方案,本質上仍是將目標檢測、語義分割、深度預測等不同任務的專家模型進行打包封裝,雖然在應用層面看似整合,但底層架構依然是各自為政的「拼圖」。SenseNova-Vision的核心變革在於從根源上打破這一藩籂,將視覺能力構建為通用基礎模型的原生內核,讓理解與生成能力在統一的框架下深度融合。這意味著模型不再需要針對不同任務切換不同的專家模塊,而是以一套統一的參數體系,同時感知、理解並生成視覺信息,徹底消除傳統方案中模塊間的語義鴻溝與性能損耗。 ## 四大核心任務全面領跑,展現代際級能力躍遷
在備受關注的結構化視覺理解領域,SenseNova-Vision展現出碾壓級優勢。無論是目標檢測、指代檢測,還是光學字符識別(OCR)與關鍵點定位等細分任務,該模型均大幅領先同類通用模型。特別是在業界公認的稠密小目標檢測與長尾類別識別等複雜場景中,SenseNova-Vision憑藉其深層語義理解能力,成功捕捉到以往模型難以識別的微小目標與罕見類別,實現了精準度與召回率的雙重突破。在稠密幾何預測方面,SenseNova-Vision的表現同樣令人矚目。其深度估計與表面法向估計的精度已達到甚至超越長期佔據主導地位的幾何專用模型水準。
無論是光線複雜的室內場景,還是結構多變的戶外環境,模型均能輸出極具穩定性的幾何預測結果。這為自動駕駛、機器人導航以及沉浸式混合現實等對空間感知要求極高的應用場景,提供了前所未有的高質量基礎能力。## 分割能力驚豔,推理分割展現多模態理解優勢
在分割能力的進化上,SenseNova-Vision突破了傳統語義分割的邊界。它不僅完美覆蓋通用分割、交互式分割等常規任務,更在推理分割與對話式分割等高階應用中展現出驚豔表現。得益於強大的多模態理解能力,模型能夠根據自然語言描述中的邏輯關係進行精準分割,例如理解「把桌子上那個紅色杯子旁邊的綠色蘋果分割出來」這類包含複雜空間關係與屬性的指令。這種「看得懂、聽得懂、切得準」的能力,讓AI從單純的像素分類躍升為具備高階認知能力的視覺助手。 此外,在多視角3D重建與相機位姿估計等三維視覺任務中,SenseNova-Vision僅憑單一模型即可高質量完成以往需要多個專業模型協作才能實現的複雜流程,在通用視覺路線中佔據絕對領先地位。 ## 全面超越Vision Banana,開源生態同步釋放
針對業界現有的視覺生成模型,SenseNova-Vision同樣展現出顯著的代際優勢。在與語義導向模型的橫向對比中,SenseNova-Vision在檢測、分割、深度等細節要求極高的視覺任務上實現全面超越。而與當前具有代表性的生成導向模型Vision Banana相比,SenseNova-Vision不僅在絕大多數權威評測指標上實現全面領跑,更重要的是在能力邊界上實現了質的飛躍——Vision Banana僅能有效處理四大核心板塊中的兩類問題,而SenseNova-Vision則實現了全任務覆蓋,展現出「一代平台級技術」對「單一功能型技術」的全面壓制。
在開源策略上,商湯科技展現出極大的誠意與前瞻性。除了全面開源SenseNova-Vision模型本身之外,商湯同步開源了包含5000萬條高質量樣本的視覺指令語料庫「SenseNova-Vision Corpus-50M」。這套迄今為止規模最大的視覺指令數據集,將為全球開發者與研究機構提供極其寶貴的訓練資源,極大降低視覺大模型的研發門檻,推動整個AI社區的技術進步。## 融入日日新生態,戰略佈局智能體賽道
商湯科技透露,SenseNova-Vision的核心技術未來將全面融入日日新U系列大模型中,進一步強化商湯在「理解-生成-行動」全鏈路的能力閉環。結合此前商湯在智能體賽道的持續佈局,包括正在研發的業內首個原生全模態智能體基座,以及由首席科學家林達華牽頭、對標OpenAI技術路線的秘密多模態模型項目,顯示出商湯正以視覺能力為核心突破口,全面推進行業從「被動問答」向「主動執行」的歷史性跨越。隨著SenseNova-Vision的全面開源,業界有理由期待,一個由統一視覺大模型驅動的AI新時代正在加速到來。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。