雷峰網生成式AI

原生統一多模態進階!SenseNova U1.5-Lite-Preview開源,生成編輯能力再進化

2026年8月3日 11:27

重點摘要

今年4月,商湯科技發佈了SenseNova U1,首次完整展示了基於NEO-Unify架構的原生統一多模態路線:在單一模型中聯合建模語言、視覺語義與像素生成,讓模型能夠原生完成視覺理解、推理和生成。過去幾個月中,我們持續強化模型的圖像生成與編輯能力,現面向社區開源輕量級統一多模態模型的預覽版本SenseNova U1.5-Lite-Preview。SenseNova U1.

站內 AI 整理稿

**商汤科技開源SenseNova U1.5-Lite-Preview:原生統一多模態躍遷,4K生成與精準編輯重塑創作邊界**

商湯科技近日宣佈,正式面向全球開源原生統一多模態模型預覽版本SenseNova U1.5-Lite-Preview。作為今年4月發佈的SenseNova U1的系統性迭代,新模型在單一架構內進一步貫通視覺理解、推理、生成與編輯,原生支持4K圖像生成,並在文字渲染、版式組織和複雜指令遵循方面實現了顯著躍升。 U1.5-Lite-Preview的開源,標誌著商湯在原生統一多模態技術路線上的又一關鍵節點。該模型僅以8B-MoT的輕量級規模,便實現了可比肩商用閉源模型的圖像生成與編輯效果,為開發者社區提供了高質量、高可控性的創作工具。 **從「架構可行」到「能力可擴展」:U1.5驗證統一路線潛力**

回溯技術路徑,商湯此前通過SenseNova U1成功驗證了「NEO-Unify」架構的可行性,證明了從像素和語言出發、端到端構建原生統一多模態模型是可行的。U1.5的推出則進一步回答了下一個關鍵問題——能力能否持續擴展。 U1.5-Lite-Preview並非簡單的規模擴大,而是針對真實創作場景痛點的全鏈路優化。它不僅在同一架構中承載理解與生成,更將能力邊界拓展至更高分辨率、更複雜的信息表達與更真實的視覺世界,體現了統一架構在承載更高階視覺任務時的獨特優勢。 **長上下文視覺控制:寫得越細,出圖越準**

在複雜創作任務中,模型能否精準理解超長自然語言與結構化視覺指令,是實現精準視覺控制的核心。U1.5-Lite-Preview重點優化了對長篇、多約束指令的理解能力。官方展示的「背包產品解析」信息圖案例,採用長達1675詞的超長提示詞,涵蓋復古博物學風格、五章結構、中英雙語對照及拉丁文標註等複雜要求。 值得注意的是,其強Prompt Following能力並非依賴對結構化模板的記憶。商湯團隊觀察到,即便在沒有高度依賴專門Prompt Enhance格式數據訓練的情況下,模型仍能穩定執行層次化視覺指令,這體現了原生統一路徑下從語言描述到視覺結構的映射能力。為降低使用門檻,商湯亦配套提供實驗性的Prompt Enhance Skill,可將簡短想法整理為包含主體、佈局、風格與約束的完整方案。 **原生4K生成:告別拼接感,細節經得起放大**

針對U1在生成時偶發的區域銜接不自然、細微網格紋理與斷裂等問題,U1.5-Lite-Preview重新設計了生成頭,有效減弱視覺Token網格對最終畫面的影響,並將訓練擴展至4K分辨率。 在展示的「WAIC發展歷程長卷」案例中,模型生成了分辨率4K、長寬比10:3、prompt總長3880詞的宏大敘事作品。畫面採中國傳統山水長卷的散點透視與連續敘事方式,融合上海城市、智慧交通、大模型、具身機器人等元素,即便放大觀看,細節、文字與圖標依然清晰穩定。在常規圖像生成中,模型亦展現出更細膩的真實材質質感與光影層次。 **文字渲染與版式升級:信息量再大,效果依然穩定**

中英文文字生成一直是多模態模型的難點。U1.5-Lite-Preview強化了文字生成的精確度與複雜版式組織能力。無論是雜誌內頁、旅行攻略還是密集的信息圖,模型均能在保持視覺風格的同時,組織清晰、專業的版式結構,確保文字內容準確呈現。這對於海報設計、品牌視覺等專業創作場景意義重大。 **編輯能力進化:告別「一鍵重來」,實現「反覆修改」**

依託原生統一架構,U1.5-Lite-Preview的圖像編輯不再是外掛功能,而是模型原生能力。其採用encoder-free視覺建模方式,減少了固定視覺編碼器的信息壓縮瓶頸,將文字筆畫、局部紋理等精細信息保留得更完整,顯著提升瞭如「哪裡要改、怎麼改、哪些不能動」的理解精準度。 新模型已覆蓋多類主流工作流:包括參考圖風格遷移、多參考圖跨圖要素融合、單圖條件創作(如人物照片簡歷排版)、局部定向修改、真實場景文字編輯(保持字體、透視與遮擋關係),以及通過畫框或座標標記實現的交互式精準編輯。這使得圖像創作從一次性的「重新採樣」,轉變為可持續迭代的視覺操作過程。 **針對性優化與實測數據:以輕量規模比肩閉源**

為了兌現「真實場景好用」的目標,U1.5-Lite-Preview在優化編輯範圍外內容漂移、主體身份保持等方面下了功夫,強化了模型對原圖內容和空間結構的保持能力。官方公佈的多項主流基準測試結果顯示,其綜合能力大幅超越U1,以輕量級規模比肩甚至超越部分商用閉源模型:Qwen-Image-Bench從47.14提升至55.20(with Prompt Enhance);ImgEdit-Bench從3.90提升至4.37;GEdit-Bench英文與中文分別從7.47和7.42提升至8.17和8.05。 **開放生態與未來展望**

目前,SenseNova U1.5-Lite-Preview已同步上線GitHub、Hugging Face及魔搭社區,供全球開發者下載體驗。與此同時,面向專業用戶的交付級創作模型U1 Pro正在緊密邀測,並將於近期對公眾開放服務。 商湯科技長期專注於原創技術研究,其「日日新SenseNova」大模型體系及「商湯AI大裝置SenseCore」基礎設施,正持續推動生成式AI的工業化落地。U1.5的開源不僅是技術實力的展示,更體現了商湯降低AI創作門檻、攜手社區共建繁榮生態的願景,也為原生統一多模態智能體的演進奠定了堅實基礎,讓AI從理解世界向主動創造世界邁進。

Related

相關文章

智東西生成式AI

又一國產模型重磅開源!有聲視頻編輯全球第一,16家芯片及平臺首日適配

智東西(公眾號:zhidxcom) 作者 | 楊京麗 編輯 | 李水青 智東西8月3日報道,今日,MiniMax正式開源新一代通用視頻模型MiniMax H3。 MiniMax H3是一個通用型全模態生成系統,可統一理解文本、圖像、視頻和音頻組成的多模態上下文,生成最長15秒、最高2K分辨率並帶有原生立體聲音頻的視頻。 此前7月31日,MiniMax H3發佈。

剛剛

豆包輸入法撕開語音口子,扒開科大訊飛外衣

# 豆包輸入法撕開語音口子,科大訊飛的護城河為何失效? 大模型戰火正在燒向一個用戶習以為常、卻高頻剛需的角落——輸入法。這個被視為“最後一公里”的關鍵入口,迎來了新一轮殘酷洗牌。當搜狗、訊飛、百度、微信等老牌廠商佔據超過84%市場份額時,看似固若金湯的格局,卻被一款新產品迅速撕開裂口:豆包輸入法。 據MobTech研究院數據,2025年11月豆包輸入法上線首周下載量即突破5000萬,日活躍用戶衝上1200萬,刷新了輸入法新品增長紀錄。

剛剛

Claude 焚書又“越獄”邊界在哪?

# Claude 焚书又“越獄”,Anthropic的邊界何在? **——從“巴拿馬計劃”到模型逃逸,AI巨頭的數據饑渴正同時撕開物理與數字邊界** 2026年7月底,人工智能公司Anthropic的兩件事同時被推至聚光燈下,分別觸及物理世界與數字世界的邊界。一方面,法庭解封的“巴拿馬計劃”內部文件顯示,這家公司通過二手書商大宗採購實體書籍,用液壓機切除書脊、掃描內容,再將紙張送入碎紙機,試圖將50萬至200萬冊書籍“破壞性掃描”為訓練數據。

剛剛

靠做“中間商”生意估值20億美元,Liblib跑出了奇蹟還是泡沫?

在AI領域普遍追求「得大模型者得天下」的浪潮中,一家不走尋常路的應用層公司卻交出了截然不同的成績單。演語科技(Evoken)於6月18日宣布完成近3億美元的B+輪融資,投後估值一舉突破20億美元,成為中國AI應用層至今為止規模最大的單輪融資之一。多數人或許對演語科技這個集團品牌感到陌生,但其旗下產品LiblibAI以及Liblib這個名稱,在業界早已廣為人知。此次融資也是演語科技首次以集團身分對外發聲。 在大量AI初創公司仍依賴投資人耐心爭取時間窗口的當下,這家沒有自研大模型的企業卻成了最會賺錢的AI應用之一。

剛剛

大模型公司估值,正在降權「SOTA敘事」

7月之后,资本市场对大模型公司的估值逻辑正在发生显著变化:单一大模型在榜单上的领先排名,已经不足以支撑长期估值溢价。8月3日,阿里巴巴发布Qwen 3.8-Max版正式版,港股当日上涨6.75%;而在此前半个月,Kimi K3的发布却让智谱和MiniMax股价坐上过山车。同样是竞争对手发布新模型,市场给出的反应截然不同,这背后折射出投资者对“SOTA叙事”的降权。 7月17日,Kimi K3发布,其在Artificial Analysis(AA)的编程评分一度位列第一。这一排名直接冲击了智谱依靠GLM-5.

剛剛

無人再議AI六小龍

# 無人再議AI六小龍:三年分化背後,大模型行業正從技術敘事走向商業現實 「AI六小龍」這個稱謂,正在成為一個頗具時代氣息的歷史標籤。三年前,智譜、MiniMax、月之暗面、階躍星辰、百川智能和零一萬物被市場共同裝進同一個籃子裡比較——誰的模型參數更大,誰的融資速度更快,誰更有希望成為「中國的OpenAI」。彼時,技術敘事是AI創業的第一針強心劑,資本的熱情幾乎全部押注在AGI的遠期想象力之上。 三年過去,潮水退去,賽道並未如預期般跑出唯一的贏家,反而走出了六條截然不同的路徑。

剛剛