SenseNova U1.5 Lite正式版發佈:支持超長指令,解鎖原生4K真實視覺創作流
今天,商湯科技正式開源輕量級、原生統一多模態大模型 SenseNova U1.5 Lite。與預覽版(U1.5 Lite Preview)呈現的原生統一多模態模型能力相比,正式版更關注的是,這些能力能否更準確、更穩定地進入真實視覺創作流程。模型重點圍繞真實視覺任務重新完善訓練數據、任務設計與後訓練流程,強化視覺質量、複雜指令遵循、文字與佈局、原生4K、圖像編輯和精細視覺控制等,提供更高可控性、更高清、更高性價比的能力工具,推動 AI 視覺生成真正跨越到“穩定完成真實視覺交付”的新階段。目前模型已面向全球開源,開發者與創作者可直接部署體驗。GitHub:https://github.
com/OpenSenseNova/SenseNova-U1Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15 魔搭社區:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoTSenseNova Studio在線體驗:https://unify.light-ai.
top/ 更完整的視覺創作能力,告別AI創作瓶頸“精心寫了 25 分鐘的詳細 Prompt,模型卻只能解析 1k 字符,不得不花半小時刪減細節”;“只想改掉圖裡的一隻杯子,AI 卻把背景和主角的臉一起換了”。這些幾乎是每個創作者都遇到過的“崩潰瞬間”。過往幾年,行業往往把重點放在卷“畫面美感”和“寫實感”上;但在實際生產流程中,真正的核心問題是:模型能否精準執行你的完整意圖?SenseNova U1.5 Lite 解決了這一難題:• 3-4k 字符超長複雜指令遵循:打破大多數開源模型在指令超過 1k 字符時易崩潰、遺漏細節的瓶頸。SenseNova U1.
5 Lite 原生支持 3-4k 上下文長度,能夠同時處理主體、數量、空間關係、文字、佈局、風格等多重約束,提升複雜視覺任務的執行穩定性。• 更高質量的視覺生成:改善整體構圖、色彩、材質、光影、真實感和局部細節,減少“局部正確但整體完成度不足”的情況。• 更可靠的原生圖像編輯:增強主體身份、空間結構、版式關係和非編輯區域的保持,同時提升局部修改、元素替換、文字精修和多參考圖編輯能力。• 更好的文字與複雜佈局:加強中英文文字、海報、信息圖、品牌視覺及多文本排版能力,從“生成內容”進一步走向“組織完整視覺表達”。
• 更精細的視覺控制:支持 Bounding Box、Visual Marker 以及單圖、多圖參考等方式,對指定區域和對象進行更準確的編輯。• 原生4K高分辨率輸出:在高分辨率生成中兼顧整體構圖與極精細的肌理、微小文字與光影折射。實戰演練:真實場景深度還原我們挑選了最能考驗“硬實力”的創作場景,帶你看 SenseNova U1.5 Lite 如何搞定真實交付。場景一:複雜視覺表達1、創意海報與封面生成:展現出極佳的美學完成度與高對比度質感。
具備高精度的複雜佈局能力,可精準掌控文字與留白節奏;在處理文字與物體的空間遮擋時,能夠維持光影的自然連貫,充分展現了原生多模態對三維空間疊加關係的深刻理解。2、高密度信息圖生成:保證中英文、數據等豐富細節的準確無誤;通過多層級結構化空間映射,完美串聯各類標籤和信息,實現了複雜信息可視化圖表的高質量一次性交付。瑞士旅行攻略手繪地圖滑板信息圖餛飩製作指南3、高清細節與藝術質感:在建築結構、人像肌理、藝術畫作筆觸等複雜場景中,展現出媲美攝影與大師畫作的細膩質感。
超現實書本船隻效果圖工人群像工筆水彩海岸船隻水彩畫哥特式教堂建築 爵士樂演奏插畫沙灘人像特寫公路視角攝影城市攝影海報 場景二:原生圖像編輯1、佈局與風格可控編輯• 草圖/線稿轉復古暖色漫畫:精準遵循超長複雜指令,保留線稿分鏡與人物輪廓,上色與材質補充自然細膩。prompt:請把這張手繪草圖渲染成一幅復古暖色調的手繪漫畫風格插圖,背景帶有米黃色紙張質感,整體光影溫馨,突出燭光下的專注氛圍。構圖上保持草圖的版式,中心是主場景,周圍環繞五個帶編號的分鏡面板。左上角用巨大的毛筆字體寫上主標題“敲擊靈魂的機械軸”,下方加一個綠色標籤寫上“每一顆軸,都是我與世界對話的方式。”。
中心畫面裡,戴著護目鏡的少年正在燭光下用螺絲刀組裝鍵盤,桌上有印著“BUILD SOUL”的馬克杯和散落的軸體,少年上方的對話框寫“深夜の工作臺,只有我、燭光,還有這些小傢伙。”,旁邊黑貓的對話框寫“又在折騰鍵盤啊?喵~”。右上角的面板①展示綠色金屬鍵盤外殼,標題寫“① 選個靠譜的‘殼’!”,下面配文“定製金屬外殼,沉甸甸的安全感!”。右側中間的面板②展示四種顏色的機械軸體,標題寫“② 挑選心儀的‘軸’!”,配文“紅軸輕盈,茶軸均衡,青軸清脆...總有一款擊中靈魂!”。右下角的面板③特寫拔鍵器取下鍵帽的動作,標題寫“③ 拔鍵器,yyds!”,加上擬聲詞“咔噠!
”,配文“拔鍵、換軸、換鍵帽,自由才是機械鍵盤的浪漫!”。左側中間的面板④展示一堆反光的透明鍵帽,標題寫“④ 透明鍵帽,透出光芒!”,配文“燈光透過鍵帽的那一刻,整個世界都溫柔了。”。左下角的面板⑤展示發出溫暖背光的組裝完成的鍵盤,標題寫“⑤ 大功告成!”,配文“每一次敲擊,都是靈魂的迴響!”。底部中間的畫面是少年興奮敲擊鍵盤的動態特寫,加上綠色爆炸框文字“這就是屬於我的聲音!♡”,底部寫上擬聲詞“噠噠噠噠噠!!”。右下角角落畫一隻小貓看著蠟燭,氣泡裡寫“機械鍵盤的魅力,在於創造,更在於熱愛。喵~”。
線稿圖編輯後• 跨主題遷移且保持排版:深度理解原海報的版式框架,切換主題後仍能保持完美的視覺結構。prompt:沿用參考圖的復古印刷風格,生成一張天文臺公眾開放日主題海報。參考圖編輯後2、多參考圖融合生成• 融合核心元素與場景重組:如“橘貓騎摩托坐在咖啡館內”,提取多圖核心特徵(主體、風格、光影),在全新空間中自然重組,光影與比例渾然天成。參考圖參考圖參考圖編輯後• 美食海報重組:多張美食圖融合為一張完整海報,自動匹配一致的背景、餐盤質感與環境光,並完美植入排版文案。
參考圖參考圖參考圖參考圖參考圖編輯後• 信息圖參考元素替換:保留原海報中的所有元素,同時替換圖中的樂隊成員,並將下方板塊重新排列,添加曲目和新的劃線元素。prompt:Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images.
Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style.
Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy.
Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background.Preserve all original text and all other poster elements.參考圖參考圖參考圖編輯後3、信息圖編輯• 變換風格主體保持不變:prompt:將整張海報改為藍銀色高科技工業風,保持所有文字內容、機器人主體和信息佈局不變。
• 局部屬性修改:prompt:將植物周圍Cd、Pb、Zn、Cu、As五個圓形標籤改為磚紅色,文字保持米白。4、文字編輯• 黑板菜單局部文字替換:prompt:將黑板菜單上“Summer Drinks”標題下方第一行、位於白色三角形符號右側的黃色手寫體文字“快樂檸檬水”替換為紅色手寫體文字“草莓啵啵奶茶”,保持原有粉筆質感和筆觸風格,嚴格保留黑板上其餘所有文字(包括價格5.00)、插圖(檸檬、咖啡杯、冰棍)、木框結構及背景綠植環境不變。• 多處精準文字重寫:prompt:在畫面中央超大磚紅色主標題,將 "PEARL" 替換為 "HORIZON"。
若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在左上英文地點標題,將 "ORIENTAL PEARL TOWER" 替換為 "SHANGHAI LANDMARK"。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在左上英文地點副標題,將 "SHANGHAI, CHINA" 替換為 "CITY OF HARMONY"。
若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在右上中文地點標題,將 "東方明珠" 替換為 "城市之光"。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在左側城市宣言第一句,將 "A SYMBOL OF SHANGHAI." 替換為 "A BEACON OF VISION."。
若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在右側城市宣言第一句,將 "DESIGNED FOR HARMONY." 替換為 "BUILT FOR TOMORROW."。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在建築底部中文大標語,將 "時代的瞭望 · 城市的明珠" 替換為 "城市的節奏 · 未來的地標"。
若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。在底部英文宣言,將 "A LANDMARK OF VISION.A BEACON OF SHANGHAI." 替換為 "A LANDMARK OF TOMORROW.A BEACON OF THE CITY."。若該區域足夠顯眼、清晰且邊界簡單,則逐字呈現,不得增刪或改寫字符;若文字過小、被遮擋、嚴重透視或位於複雜紋理中,則保留原文,不要為完成替換而重繪背景。
5、指定區域與局部精細編輯prompt:將紅框中的“WHY IT MATTERS”模塊完整翻譯為中文,保留原有圖標、層級和排版;紅框僅作定位,輸出中不要保留紅框。prompt:Follow the marks and overall hints on the image to creatively transform this scene, making it moody, sophisticated midnight lounge vibe; remove the annotations when done.
8B 參數架構突破:不只是“更多”能力,還是“更穩定”和“更高性價比”作為8B參數的輕量化模型,SenseNova U1.5 Lite在指令遵循與圖像編輯保持度上超越了同量級模型,並在文字渲染與複雜佈局上達到了媲美超大規模商業模型的交付水平。面對不同視覺任務,業界通常採用顯式 Router(路由)或多專家協同機制將渲染、美學、編輯分發給不同模型。但這大幅增加了系統開銷與推理時延。SenseNova U1.
5 Lite 基於NEO-unify統一架構,打破了這一傳統定式:• 解耦訓練與交付(MOPD 蒸餾):訓練階段針對文字、美學、編輯獨立訓練專家模型(Expert);交付階段,通過多專家在線策略蒸餾技術(MOPD),將多專家能力無損融合至單體 8B 模型中。• 理解與生成雙向反哺:視覺語義理解與空間建模形成的認知直接反哺生成,使其自然消化多層級指令,同時在多模態理解榜單上保持強勁表現。• 極致性價比:8B 參數量支持單卡流暢運行,無須 Router 頻繁切換,單次 Pass 即可兼顧語義理解與像素生成,極大降低調用成本與推理延遲。
在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 與 Qwen-Image-Bench 上的生成延遲與平均性能對比。此外,正式版強化了任務導向的強化學習(RL)後訓練,聚焦優化三大關鍵維度:• 指令遵循(Instruction Compliance):輕鬆解析超長 Prompt,精準執行嚴苛的多重複雜限制。• 視覺偏好(Visual Preference):全面優化構圖、材質與光影,提升畫面質感與視覺完成度。
• 編輯保持(Editing Preservation):實現像素級局部修改,完美保留非目標區域的內容與結構。這種複雜指令跟隨與精細編輯能力,使得 SenseNova U1.5 Lite 可以無縫支持多輪迭代修改而不跑偏。這真正打破了單次生成的侷限,讓輕量級模型參與長流程的持續創作與二次改造成為可能。讓開源創作從“能看”走向“能用”多模態是AI邁向物理世界與真實生產力的必經之路。商湯 SenseNova U1.5 Lite 開源的初衷,正是希望為全球開發者與創作者提供一個輕量、統一、極具性價比且高可控的生產力工具。
歡迎前往 GitHub / Hugging Face 部署體驗,與我們共同繁榮開源生態!GitHub:https://github.com/OpenSenseNova/SenseNova-U1Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15 魔搭社區:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoTSenseNova Studio在線體驗:https://unify.light-ai.top/
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。