雷峰網生成式AI

原生統一多模態進階!SenseNova U1.5-Lite-Preview開源,生成編輯能力再進化

2026年8月3日 11:27

重點摘要

今年4月,商湯科技發佈了SenseNova U1,首次完整展示了基於NEO-Unify架構的原生統一多模態路線:在單一模型中聯合建模語言、視覺語義與像素生成,讓模型能夠原生完成視覺理解、推理和生成。過去幾個月中,我們持續強化模型的圖像生成與編輯能力,現面向社區開源輕量級統一多模態模型的預覽版本SenseNova U1.5-Lite-Preview。SenseNova U1.

站內 AI 整理稿

**商汤科技開源SenseNova U1.5-Lite-Preview:原生統一多模態躍遷,4K生成與精準編輯重塑創作邊界**

商湯科技近日宣佈,正式面向全球開源原生統一多模態模型預覽版本SenseNova U1.5-Lite-Preview。作為今年4月發佈的SenseNova U1的系統性迭代,新模型在單一架構內進一步貫通視覺理解、推理、生成與編輯,原生支持4K圖像生成,並在文字渲染、版式組織和複雜指令遵循方面實現了顯著躍升。 U1.5-Lite-Preview的開源,標誌著商湯在原生統一多模態技術路線上的又一關鍵節點。該模型僅以8B-MoT的輕量級規模,便實現了可比肩商用閉源模型的圖像生成與編輯效果,為開發者社區提供了高質量、高可控性的創作工具。 **從「架構可行」到「能力可擴展」:U1.5驗證統一路線潛力**

回溯技術路徑,商湯此前通過SenseNova U1成功驗證了「NEO-Unify」架構的可行性,證明了從像素和語言出發、端到端構建原生統一多模態模型是可行的。U1.5的推出則進一步回答了下一個關鍵問題——能力能否持續擴展。 U1.5-Lite-Preview並非簡單的規模擴大,而是針對真實創作場景痛點的全鏈路優化。它不僅在同一架構中承載理解與生成,更將能力邊界拓展至更高分辨率、更複雜的信息表達與更真實的視覺世界,體現了統一架構在承載更高階視覺任務時的獨特優勢。 **長上下文視覺控制:寫得越細,出圖越準**

在複雜創作任務中,模型能否精準理解超長自然語言與結構化視覺指令,是實現精準視覺控制的核心。U1.5-Lite-Preview重點優化了對長篇、多約束指令的理解能力。官方展示的「背包產品解析」信息圖案例,採用長達1675詞的超長提示詞,涵蓋復古博物學風格、五章結構、中英雙語對照及拉丁文標註等複雜要求。值得注意的是,其強Prompt Following能力並非依賴對結構化模板的記憶。商湯團隊觀察到,即便在沒有高度依賴專門Prompt Enhance格式數據訓練的情況下,模型仍能穩定執行層次化視覺指令,這體現了原生統一路徑下從語言描述到視覺結構的映射能力。

為降低使用門檻,商湯亦配套提供實驗性的Prompt Enhance Skill,可將簡短想法整理為包含主體、佈局、風格與約束的完整方案。**原生4K生成:告別拼接感,細節經得起放大**

針對U1在生成時偶發的區域銜接不自然、細微網格紋理與斷裂等問題,U1.5-Lite-Preview重新設計了生成頭,有效減弱視覺Token網格對最終畫面的影響,並將訓練擴展至4K分辨率。 在展示的「WAIC發展歷程長卷」案例中,模型生成了分辨率4K、長寬比10:3、prompt總長3880詞的宏大敘事作品。畫面採中國傳統山水長卷的散點透視與連續敘事方式,融合上海城市、智慧交通、大模型、具身機器人等元素,即便放大觀看,細節、文字與圖標依然清晰穩定。在常規圖像生成中,模型亦展現出更細膩的真實材質質感與光影層次。 **文字渲染與版式升級:信息量再大,效果依然穩定**

中英文文字生成一直是多模態模型的難點。U1.5-Lite-Preview強化了文字生成的精確度與複雜版式組織能力。無論是雜誌內頁、旅行攻略還是密集的信息圖,模型均能在保持視覺風格的同時,組織清晰、專業的版式結構,確保文字內容準確呈現。這對於海報設計、品牌視覺等專業創作場景意義重大。 **編輯能力進化:告別「一鍵重來」,實現「反覆修改」**

依託原生統一架構,U1.5-Lite-Preview的圖像編輯不再是外掛功能,而是模型原生能力。其採用encoder-free視覺建模方式,減少了固定視覺編碼器的信息壓縮瓶頸,將文字筆畫、局部紋理等精細信息保留得更完整,顯著提升瞭如「哪裡要改、怎麼改、哪些不能動」的理解精準度。 新模型已覆蓋多類主流工作流:包括參考圖風格遷移、多參考圖跨圖要素融合、單圖條件創作(如人物照片簡歷排版)、局部定向修改、真實場景文字編輯(保持字體、透視與遮擋關係),以及通過畫框或座標標記實現的交互式精準編輯。這使得圖像創作從一次性的「重新採樣」,轉變為可持續迭代的視覺操作過程。 **針對性優化與實測數據:以輕量規模比肩閉源**

為了兌現「真實場景好用」的目標,U1.5-Lite-Preview在優化編輯範圍外內容漂移、主體身份保持等方面下了功夫,強化了模型對原圖內容和空間結構的保持能力。官方公佈的多項主流基準測試結果顯示,其綜合能力大幅超越U1,以輕量級規模比肩甚至超越部分商用閉源模型:Qwen-Image-Bench從47.14提升至55.20(with Prompt Enhance);ImgEdit-Bench從3.90提升至4.37;GEdit-Bench英文與中文分別從7.47和7.42提升至8.17和8.05。 **開放生態與未來展望**

目前,SenseNova U1.5-Lite-Preview已同步上線GitHub、Hugging Face及魔搭社區,供全球開發者下載體驗。與此同時,面向專業用戶的交付級創作模型U1 Pro正在緊密邀測,並將於近期對公眾開放服務。 商湯科技長期專注於原創技術研究,其「日日新SenseNova」大模型體系及「商湯AI大裝置SenseCore」基礎設施,正持續推動生成式AI的工業化落地。U1.5的開源不僅是技術實力的展示,更體現了商湯降低AI創作門檻、攜手社區共建繁榮生態的願景,也為原生統一多模態智能體的演進奠定了堅實基礎,讓AI從理解世界向主動創造世界邁進。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

14 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前