8B 參數塞進 4K 生成與編輯,商湯開源輕量統一多模態模型 U1.5-Lite 預覽版

2026年8月4日 08:305200 次瀏覽

重點摘要

商湯科技開源輕量級統一多模態模型 SenseNova U1.5-Lite-Preview,以僅 8B-MoE 參數規模達成原生 4K 圖像生成與編輯,並強化視覺理解、推理與指令遵循能力。官方指出此版本針對生成頭、編輯訓練任務與原圖保持進行系統性優化,多項基準如 Qwen-Image-Bench、ImgEdit-Bench 及 GEdit-Bench 分數均明顯提升,展現輕量模型在精細生成與穩定編輯上的進展。

站內 AI 整理稿

商湯科技近日宣布,正式向社區開源輕量級統一多模態模型 SenseNova U1.5-Lite-Preview。這款新模型並非單純的規模擴張,而是基於先前 SenseNova U1 的系統性迭代成果,目標是在同一架構中貫通視覺理解、推理、生成與編輯四大核心能力。最受矚目的特點在於其輕量化的設計,僅以 8B-MoE 的參數規模,就將模型能力推進至 4K 分辨率,同時實現更精細的真實質感呈現與更複雜的視覺控制。 商湯方面表示,如果說 U1 驗證了統一架構的可行性,那麼 U1.5 的任務就是進一步證明,在這樣的架構之下,模型能力能否持續擴展。此次開源的 U1.5-Lite-Preview 版本,正是這一思路的具體實踐,透過對生成與編輯全鏈路的系統性優化,試圖在輕量級參數規模下,挑戰以往需要更大模型才能達成的任務表現。 與前代 U1 相比,U1.5-Lite-Preview 在四個核心方向上有著顯著提升。首先是原生支援 4K 圖像生成,解析度大幅躍升;其次是更精細的局部紋理與真實世界質感呈現,讓生成圖像的細節更為豐富;第三是更準確的中英文文字生成與複雜版式組織能力,能應付更嚴謹的排版需求;最後則是更穩定的圖像編輯與視覺指令遵循,確保模型能精確理解並執行使用者的修改意圖。 在技術細節層面,商湯針對過往生成圖像中常見的網格偽影以及高分辨率細節建模問題,重新設計了模型的生成頭,有效減弱視覺 Token 網格對最終圖像的影響,並將訓練過程擴展至 4K 分辨率。這項調整對於提升高分辨率圖像的品質至關重要,能讓生成結果在放大後依然保持清晰與自然。 在圖像編輯方面,U1.5-Lite-Preview 也進行了深度優化。團隊重新組織了編輯數據與訓練任務,強化模型對原圖內容、主體身份、空間結構以及非編輯區域的保持能力。這意味著模型在執行使用者指定的修改時,能夠更精準地鎖定目標區域進行變更,同時盡可能保留原圖中不需要改動的部分,避免整體風格或細節被破壞。 多項基準測試的結果也印證了這輪優化的實際成效。在 Qwen-Image-Bench 評測中,模型得分從先前的 47.14 提升至 55.20(配合提示詞增強);ImgEdit-Bench 得分則從 3.90 上升至 4.37;GEdit-Bench 英文版從 7.47 提升到 8.17,中文版也從 7.42 升至 8.05。整體而言,無論是生成質量還是編輯穩定性,都有明顯的躍升,特別是在圖像編輯的指令遵循與原圖保持方面,進步尤為突出。 商湯強調,U1.5-Lite-Preview 的核心思路並非盲目擴大模型規模,而是對生成與編輯的整個流程進行細緻且系統性的優化。這種「以架構創新換取能力增長」的發展路線,為輕量級多模態模型的持續迭代提供了一個值得參考的範本。當 8B 參數規模就能夠流暢運行 4K 生成與精細編輯任務時,統一多模態架構的潛力或許才正要開始被真正釋放。 此次開源行動也延續了商湯近期在視覺模型領域的積極布局。從先前推出的 SenseNova-Vision 系列,到如今的 U1.5-Lite-Preview,商湯持續嘗試將多種視覺能力整合進更精簡的架構之中,試圖打破傳統上依賴多個專家模型協作的割裂模式。這一系列動作,也讓外界對於輕量級模型在實際應用中的可能性有了更多想像空間。

Related

相關文章

物理AI不是下一個風口,而是下一輪工業革命

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

開源版Claude Science來了,零依賴、MIT協議,內置30+項科研Skills

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體生成式AI

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?文娛先聲2026.08.04 17:56 · 來自北京全文4045字從製作流程到商業化路徑,《奇譚》的探索證明,AI影視的發展並非簡單替代傳統影視,而是在人工創意與AI能力結合下,重新定義影視生產方式。文 | 文娛先聲,作者 | 王燁 AI影視,迎來了首部獲得官方發行許可的長片作品。近期,《奇譚:紙刃渡荒墟》(以下簡稱《奇譚》)在愛奇藝正式上線。

剛剛

斷電0.01秒燒掉幾十萬:AI最隱秘的暴利賽道,中企瘋搶

AI 的運算能力正在成為這個時代最稀缺的資源,但支撐這一切運轉的,除了那些昂貴的圖形處理器(GPU),還有一套外界幾乎看不見的電力系統。每天有無數人對著人工智慧對話框輸入指令、要求生成圖片或影片,每一次請求的背後,都是成千上萬顆GPU在瞬間進入滿載狀態。這些晶片的用電模式和傳統數據中心截然不同,過去機房的電力負載相對平穩,現在AI的GPU則像一輛在怠速與全油門之間來回切換的跑車,用電量在毫秒級別內暴起暴落。

剛剛
智東西生成式AI

120萬星!開發者排隊“投簡歷”,DeepSeek一條內測帖,變成了Agent開源大摸底

DeepSeek的Agent Harness團隊負責人崔添翼於8月1日發文招募內測人員,吸引769位開發者提交712個開源倉庫,合計超過120萬Stars,涵蓋長任務執行、記憶管理與安全評測等Agent基礎設施方向。社區推測DeepSeek可能基於Harness打造對標Claude Code的AI Coding Agent,但官方尚未證實。這場招募意外揭露了Agent工程化的關鍵能力版圖,包括穩定執行、上下文管理與安全控制等挑戰。

剛剛

OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。

剛剛