8B 參數塞進 4K 生成與編輯,商湯開源輕量統一多模態模型 U1.5-Lite 預覽版

2026年8月4日 08:305200 次瀏覽

重點摘要

商湯科技開源輕量級統一多模態模型 SenseNova U1.5-Lite-Preview,以僅 8B-MoE 參數規模達成原生 4K 圖像生成與編輯,並強化視覺理解、推理與指令遵循能力。官方指出此版本針對生成頭、編輯訓練任務與原圖保持進行系統性優化,多項基準如 Qwen-Image-Bench、ImgEdit-Bench 及 GEdit-Bench 分數均明顯提升,展現輕量模型在精細生成與穩定編輯上的進展。

站內 AI 整理稿

商湯科技近日宣布,正式向社區開源輕量級統一多模態模型 SenseNova U1.5-Lite-Preview。這款新模型並非單純的規模擴張,而是基於先前 SenseNova U1 的系統性迭代成果,目標是在同一架構中貫通視覺理解、推理、生成與編輯四大核心能力。最受矚目的特點在於其輕量化的設計,僅以 8B-MoE 的參數規模,就將模型能力推進至 4K 分辨率,同時實現更精細的真實質感呈現與更複雜的視覺控制。商湯方面表示,如果說 U1 驗證了統一架構的可行性,那麼 U1.5 的任務就是進一步證明,在這樣的架構之下,模型能力能否持續擴展。此次開源的 U1.

5-Lite-Preview 版本,正是這一思路的具體實踐,透過對生成與編輯全鏈路的系統性優化,試圖在輕量級參數規模下,挑戰以往需要更大模型才能達成的任務表現。與前代 U1 相比,U1.5-Lite-Preview 在四個核心方向上有著顯著提升。首先是原生支援 4K 圖像生成,解析度大幅躍升;其次是更精細的局部紋理與真實世界質感呈現,讓生成圖像的細節更為豐富;第三是更準確的中英文文字生成與複雜版式組織能力,能應付更嚴謹的排版需求;最後則是更穩定的圖像編輯與視覺指令遵循,確保模型能精確理解並執行使用者的修改意圖。

在技術細節層面,商湯針對過往生成圖像中常見的網格偽影以及高分辨率細節建模問題,重新設計了模型的生成頭,有效減弱視覺 Token 網格對最終圖像的影響,並將訓練過程擴展至 4K 分辨率。這項調整對於提升高分辨率圖像的品質至關重要,能讓生成結果在放大後依然保持清晰與自然。在圖像編輯方面,U1.5-Lite-Preview 也進行了深度優化。團隊重新組織了編輯數據與訓練任務,強化模型對原圖內容、主體身份、空間結構以及非編輯區域的保持能力。這意味著模型在執行使用者指定的修改時,能夠更精準地鎖定目標區域進行變更,同時盡可能保留原圖中不需要改動的部分,避免整體風格或細節被破壞。

多項基準測試的結果也印證了這輪優化的實際成效。在 Qwen-Image-Bench 評測中,模型得分從先前的 47.14 提升至 55.20(配合提示詞增強);ImgEdit-Bench 得分則從 3.90 上升至 4.37;GEdit-Bench 英文版從 7.47 提升到 8.17,中文版也從 7.42 升至 8.05。整體而言,無論是生成質量還是編輯穩定性,都有明顯的躍升,特別是在圖像編輯的指令遵循與原圖保持方面,進步尤為突出。商湯強調,U1.5-Lite-Preview 的核心思路並非盲目擴大模型規模,而是對生成與編輯的整個流程進行細緻且系統性的優化。

這種「以架構創新換取能力增長」的發展路線,為輕量級多模態模型的持續迭代提供了一個值得參考的範本。當 8B 參數規模就能夠流暢運行 4K 生成與精細編輯任務時,統一多模態架構的潛力或許才正要開始被真正釋放。此次開源行動也延續了商湯近期在視覺模型領域的積極布局。從先前推出的 SenseNova-Vision 系列,到如今的 U1.5-Lite-Preview,商湯持續嘗試將多種視覺能力整合進更精簡的架構之中,試圖打破傳統上依賴多個專家模型協作的割裂模式。這一系列動作,也讓外界對於輕量級模型在實際應用中的可能性有了更多想像空間。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

37 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前