何夕2077AI應用場景

UniWorld設計框架改寫像素生成

2026年8月6日 00:00

重點摘要

北京大學團隊提出UniWorld-Design框架,將影像生成從平面像素合成改為以語意RGBA圖層為基礎的結構化視覺組合,並包含文字轉RGBA與影像轉圖層兩個模型。在Crello基準上,影像轉圖層模型將每層RGB L1誤差降低37%,Alpha Soft IoU相對提升34%,文字轉RGBA模型則在CLIP Score上優於LayerDiffuse與OmniAlpha。

站內 AI 整理稿

圖像生成技術近年來快速演進,從早期的風格遷移到如今的高保真擴散模型,業界多數成果仍然建立在「像素合成」的基礎之上。北京大學研究團隊近期發表了一項名為 UniWorld-Design 的新框架,嘗試從根本上改變這項預設,將圖像生成從平面的像素輸出,轉向更具結構性的視覺組合流程,並以具備語意的 RGBA 圖層作為生成、理解與編輯的基本單元。 這篇論文已於 8 月 4 日公開在 arXiv 平台上,並在隔日由共同作者李宗健正式提交。研究團隊集結了北京大學多位學者,包括李宗健、閻志遠、白辰旭、陳晨、孫浩翔、王少東、吳飛澤、袁勝海、林彬、劉哲源、牛宇偉與袁粒等人。團隊提出的核心觀點相當直接:像素決定的是圖像如何被渲染,而圖層決定的則是圖像如何被創建、理解與編輯。 這個觀點呼應了設計產業的真實工作方式。無論是平面設計師、UI 設計師或影像後製人員,在實務上幾乎都是透過圖層來操作視覺內容,而非直接面對原始像素。研究團隊認為,多模態生成模型也應該具備同樣的「圖層原生」設計空間,而非只是把生成結果當作一張完整的平面影像輸出。UniWorld-Design 正是基於這樣的想法所建構的框架。 UniWorld-Design 由兩個核心模型組成,各自負責不同的任務。第一個模型稱為 Text-to-RGBA,簡稱 T2RGBA,功能是直接從文字描述生成獨立的 RGBA 素材。RGBA 色彩模式除了紅、綠、藍三個通道之外,還包含了 Alpha 透明度通道,這讓生成的素材可以帶有透明背景,便於後續疊加與組合。這項能力使得模型生成的內容不只是單張圖片,而是可重複使用的視覺元件。 第二個模型稱為 Image-to-Layer,簡稱 I2L,負責處理更複雜的分解任務。I2L 以一張完整的圖像作為輸入,同時接受一個全域指令以及多個針對個別圖層的提示,最終共同產生有序且完整的語意 RGBA 圖層。換句話說,這個模型能夠把一張已經完成的圖像,拆解成多個具有獨立語意的圖層結構,而不是單純依照可見像素的邊界進行切割。 I2L 的指令介面設計值得特別注意。它支援三種不同的分解模式,包括頂層分解、遞迴分解與目標提取。頂層分解指的是將圖像拆解為最上層的主要結構;遞迴分解則可以進一步對已經拆出的圖層再進行細部分解;目標提取則讓使用者可以針對特定物件進行抽取。這樣一來,圖層操作不再只是生成後的附屬功能,而是可以透過指令直接定址的編輯操作。 這樣的能力讓圖層在移動或移除之後仍然保持可用。傳統的影像分割或去背技術,往往只能針對可見像素進行切分,一旦圖層被移動,原本被遮蓋的區域就會出現空洞或破損。UniWorld-Design 的 I2L 模型由於學習的是完整的語意物件,而非僅是可見像素的 partition,因此即使圖層被單獨取出或移動,依然能保持結構上的完整性。 在技術評估方面,研究團隊針對 I2L 使用了 Crello 基準進行測試。結果顯示,I2L 在每層 RGB L1 誤差上降低了 37%,相較於 Qwen-Image-Layered 有顯著的進步。同時,在 Alpha Soft IoU 指標上也取得了 34% 的相對改善。Alpha Soft IoU 是衡量透明度通道預測品質的重要指標,這項數據代表了 I2L 在圖層分離的精準度上具有明顯優勢。 至於 T2RGBA 模型,研究團隊則在文字生成 RGBA 素材的任務上進行了評估。T2RGBA 在 CLIP Score 指標上達到最高分,超越了現有的 LayerDiffuse 與 OmniAlpha 等方法。CLIP Score 用於衡量生成影像與文字描述之間的語意對齊程度,分數越高代表生成的內容越符合文字描述的要求,這也顯示 T2RGBA 在理解文字並轉化為視覺素材的能力上具備領先水準。 從整體架構來看,UniWorld-Design 的意義不僅在於提升了生成品質,更重要的是重新定義了生成模型與視覺內容之間的關係。傳統的像素生成模型把影像視為一個不可分割的整體,使用者若要編輯生成結果,往往需要仰賴外部工具進行後處理。UniWorld-Design 則把圖層作為模型內建的操作單元,讓生成、理解與編輯三個環節得以在同一個框架內完成。 這項設計也為代理式編輯帶來了新的可能性。由於 I2L 的指令介面支援多層次的分解操作,未來的 AI 代理可以透過自然語言指令,直接對圖像進行結構性的修改。例如,使用者可以要求系統「把背景拆出來換成另一個場景」,或是「把前景的主體單獨提取並調整位置」,這些操作不再需要手動框選或複雜的遮罩處理。 研究團隊在論文摘要中強調,人類設計師在創作過程中,始終是透過圖層來建構與調整視覺內容,而不是直接操作像素。UniWorld-Design 的目標,就是讓多模態生成模型也能夠在同樣的設計空間中運作,從而縮短 AI 生成內容與專業設計工作流程之間的距離。這項研究已在學術社群中引起討論,論文發布後獲得了不少關注與正面評價。 整體而言,UniWorld-Design 代表了圖像生成技術從「產生一張圖」朝向「產生一組可編輯的視覺結構」的重要轉向。隨著生成式 AI 在設計、行銷、影視與遊戲產業的應用日益普及,具備圖層原生能力的生成框架,可望為專業創作者提供更貼近實際工作流程的工具,也為後續研究開啟了新的方向。

Related

相關文章

WorkBuddy 跑出來後,釘釘飛書放下了“入口”執念

WorkBuddy以AI代理為核心的新工具,促使釘釘與飛書放下過去對「入口」的執念,轉而將重心放在協作效率與場景落地。企業用戶不再迷信單一入口,更看重平台能否與其他系統順暢對接,讓AI在具體工作中產生實質效益。整體而言,競爭焦點從「圈住用戶」轉向「服務用戶」,AI能力與開放性成為下一階段的主導關鍵。

剛剛

AI 帶火挖掘機,土木狗有救了?

AI 挖掘機正進入工地,透過自動駕駛、電腦視覺與數據分析降低操作門檻,有望改善營造業缺工、年齡斷層與工安問題,並讓從業人員轉向技術管理職。不過,工地環境複雜、導入成本與人員再訓練仍是現實門檻,能否化解產業危機尚待驗證,關鍵在於產業是否願意藉此吸引人才、改善勞動條件。

18 小時前

即夢 AI 接入 Seedance 2.5 並上線 Maya/Blender 插件,字節打通 AI 視頻專業創作全鏈路

AI資訊AI新閒資訊正文即夢 AI 接入 Seedance 2.5 並上線 Maya/Blender 插件,字節打通 AI 視頻專業創作全鏈路發布於AI新閒資訊時間 :Aug 5, 2026閱讀 :1分鐘字節跳動旗下內容創作平臺即夢 AI 正式接入 Seedance 2.5 模型,並同步上線多款面向複雜項目的專業創作工具,包括 Maya 與 Blender 插件及智能編輯模式。

20 小時前6700

字節跳動啟動2027校園招聘,持續加碼AI人才

字節跳動啟動2027校園招聘,持續加碼AI人才 本文作者: Nemo 2026-08-05 15:22 導語:8月3日,字節跳動正式啟動2027屆校園招聘,面向2026年9月至2027年8月畢業的同學,開放研發、產品等八大類崗位,重點向技術與AI人才傾斜。 8月3日,字節跳動正式啟動2027屆校園招聘,面向2026年9月至2027年8月期間畢業的同學,開放研發、產品、運營、設計、市場、職能/支持、銷售、遊戲策劃八大類崗位。

22 小時前

悟空四個月“消失”,大廠為何如此看重AI Work?

AI產品「悟空」在推出四個月後幾乎銷聲匿跡,但大型科技企業仍持續押注AI Work,看重其在文書處理、會議摘要等場景帶來的效率提升與成本降低。然而,悟空項目的暫時沉寂也反映出AI產品從技術到市場落地仍面臨用戶習慣培養與應用場景磨合的挑戰。

1 天前

超400萬人在靈光App“手搓”AI應用,加速AI原生創作者生態形成

AI應用創作正從專業開發走向普羅大眾。8月3日,靈光App宣佈,其平臺“閃應用”創作者已超過400萬人,其中絕大多數為沒有編程背景的普通用戶,包括學生、教師、心理療愈師、遊戲發燒友、網文愛好者等群體。隨著創作者規模不斷擴大、應用類型日趨豐富,一個由普通用戶驅動的AI原生應用生態正在加速形成。平臺數據顯示,遊戲化是當前最活躍的趨勢。其中,“模擬器”成為今年上半年最熱門類型,誕生近萬個相關應用,覆蓋升學、職場、偶像養成等主題。

1 天前