視覺模型新突破:商湯開源 SenseNova-Vision-7B-MoT

2026年7月14日 02:014900 次瀏覽

重點摘要

AI資訊AI新閒資訊正文視覺模型新突破:商湯開源 SenseNova-Vision-7B-MoT發布於AI新閒資訊時間 :Jul 14, 2026閱讀 :1分鐘人工智能視覺領域近期迎來重要進展。商湯科技正式宣佈開源其多任務視覺模型 SenseNova-Vision-7B-MoT,旨在為視覺理解及 GUI 智能體開發提供強有力的基座支撐。此次開源的模型具備出色的任務整合能力。

站內 AI 整理稿

商湯科技於2026年7月14日正式宣佈開源其最新多任務視覺模型 SenseNova-Vision-7B-MoT,為人工智能視覺理解與 GUI 智能體開發注入全新動能。這項舉措被業界視為視覺領域統一框架的重要突破,有望大幅降低開發者打造多樣化視覺應用的門檻。此次開源的模型採用 7B 參數規模(70億參數)架構,核心特色在於將多種核心視覺任務整合至單一模型中,徹底改變過去需要分別訓練不同專用模型的繁瑣流程。透過統一的設計,模型能夠同時處理多種視覺理解需求,展現出卓越的任務整合能力。

具體而言,SenseNova-Vision-7B-MoT 成功將目標檢測、光學字符辨識(OCR)、深度估計、法線估計、圖像分割,以及多視圖處理等關鍵視覺任務收納在同一個框架內。這意味著開發者無需再針對每項任務維護獨立模型,即可在同一平台上完成多樣化的視覺分析工作。更值得關注的是,該模型支援透過自然語言定義全新的視覺任務變體。使用者只需以簡單的文字描述,就能讓模型靈活重組既有視覺能力,突破傳統任務邊界的限制,實現前所未有的自訂功能。這項設計極大提升了模型的通用性與擴展性。為促進社群研究與實際應用落地,商湯本次採取完全開源策略。

開發者不僅能夠直接取得完整的模型權重,還能同步獲取 SenseNova-Vision 語料庫中高達 5000 萬個樣本的子集,以及一套詳盡的復現工具包,用於處理剩餘的公開資料,確保研究與開發過程的完整性。業內專家分析指出,SenseNova-Vision-7B-MoT 的推出並非單純的輕量化模型迭代,而是為視覺理解任務提供了一個更具擴展性的統一框架。這種架構設計跳脫了過往「一任務一模型」的思維,讓模型能夠在統一的基礎上靈活適應新需求。目前,該模型的技術細節、程式碼倉庫以及線上演示空間已同步在 Hugging Face 與 GitHub 等國際知名平台上線。

全球的科研人員與開發者均可直接調用模型資源,加速相關領域的技術創新與應用部署,大幅縮短從研究到落地的距離。對於專注於 GUI 智能體開發的團隊而言,SenseNova-Vision-7B-MoT 提供的多任務整合能力尤為關鍵。模型能在同一時間內完成螢幕元素辨識、文字讀取、空間理解等多重任務,為建構具備環境感知能力的智慧代理提供強力基座。商湯科技持續在開源社群投入資源,此次開源不僅展現其技術實力,也為全球 AI 生態注入活水。透過提供完整模型、資料集與工具鏈,開發者不需從零開始訓練,即可在此基礎上進行微調與創新,降低重複造輪子的成本。

隨著 SenseNova-Vision-7B-MoT 的發布,視覺模型領域正式迎來一個更易於擴展、更靈活統一的發展方向。無論是學術研究還是工業應用,都能夠藉助此框架快速實現從概念驗證到產品化的跨越。對於有興趣深入探索的開發者與研究人員,專案官方網址已在 GitHub 上公開(https://github.com/OpenSenseNova/SenseNova-Vision),所有資源均開放取用,歡迎全球開發者共同參與測試與改進,攜手推動視覺理解技術的下一波進展。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

46 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前