何夕2077AI應用場景

UniWorld設計框架改寫像素生成

2026年8月6日 00:00

重點摘要

北京大學團隊提出UniWorld-Design框架,將影像生成從平面像素合成改為以語意RGBA圖層為基礎的結構化視覺組合,並包含文字轉RGBA與影像轉圖層兩個模型。在Crello基準上,影像轉圖層模型將每層RGB L1誤差降低37%,Alpha Soft IoU相對提升34%,文字轉RGBA模型則在CLIP Score上優於LayerDiffuse與OmniAlpha。

站內 AI 整理稿

圖像生成技術近年來快速演進,從早期的風格遷移到如今的高保真擴散模型,業界多數成果仍然建立在「像素合成」的基礎之上。北京大學研究團隊近期發表了一項名為 UniWorld-Design 的新框架,嘗試從根本上改變這項預設,將圖像生成從平面的像素輸出,轉向更具結構性的視覺組合流程,並以具備語意的 RGBA 圖層作為生成、理解與編輯的基本單元。這篇論文已於 8 月 4 日公開在 arXiv 平台上,並在隔日由共同作者李宗健正式提交。研究團隊集結了北京大學多位學者,包括李宗健、閻志遠、白辰旭、陳晨、孫浩翔、王少東、吳飛澤、袁勝海、林彬、劉哲源、牛宇偉與袁粒等人。

團隊提出的核心觀點相當直接:像素決定的是圖像如何被渲染,而圖層決定的則是圖像如何被創建、理解與編輯。這個觀點呼應了設計產業的真實工作方式。無論是平面設計師、UI 設計師或影像後製人員,在實務上幾乎都是透過圖層來操作視覺內容,而非直接面對原始像素。研究團隊認為,多模態生成模型也應該具備同樣的「圖層原生」設計空間,而非只是把生成結果當作一張完整的平面影像輸出。UniWorld-Design 正是基於這樣的想法所建構的框架。UniWorld-Design 由兩個核心模型組成,各自負責不同的任務。

第一個模型稱為 Text-to-RGBA,簡稱 T2RGBA,功能是直接從文字描述生成獨立的 RGBA 素材。RGBA 色彩模式除了紅、綠、藍三個通道之外,還包含了 Alpha 透明度通道,這讓生成的素材可以帶有透明背景,便於後續疊加與組合。這項能力使得模型生成的內容不只是單張圖片,而是可重複使用的視覺元件。第二個模型稱為 Image-to-Layer,簡稱 I2L,負責處理更複雜的分解任務。I2L 以一張完整的圖像作為輸入,同時接受一個全域指令以及多個針對個別圖層的提示,最終共同產生有序且完整的語意 RGBA 圖層。

換句話說,這個模型能夠把一張已經完成的圖像,拆解成多個具有獨立語意的圖層結構,而不是單純依照可見像素的邊界進行切割。I2L 的指令介面設計值得特別注意。它支援三種不同的分解模式,包括頂層分解、遞迴分解與目標提取。頂層分解指的是將圖像拆解為最上層的主要結構;遞迴分解則可以進一步對已經拆出的圖層再進行細部分解;目標提取則讓使用者可以針對特定物件進行抽取。這樣一來,圖層操作不再只是生成後的附屬功能,而是可以透過指令直接定址的編輯操作。這樣的能力讓圖層在移動或移除之後仍然保持可用。傳統的影像分割或去背技術,往往只能針對可見像素進行切分,一旦圖層被移動,原本被遮蓋的區域就會出現空洞或破損。

UniWorld-Design 的 I2L 模型由於學習的是完整的語意物件,而非僅是可見像素的 partition,因此即使圖層被單獨取出或移動,依然能保持結構上的完整性。在技術評估方面,研究團隊針對 I2L 使用了 Crello 基準進行測試。結果顯示,I2L 在每層 RGB L1 誤差上降低了 37%,相較於 Qwen-Image-Layered 有顯著的進步。同時,在 Alpha Soft IoU 指標上也取得了 34% 的相對改善。Alpha Soft IoU 是衡量透明度通道預測品質的重要指標,這項數據代表了 I2L 在圖層分離的精準度上具有明顯優勢。

至於 T2RGBA 模型,研究團隊則在文字生成 RGBA 素材的任務上進行了評估。T2RGBA 在 CLIP Score 指標上達到最高分,超越了現有的 LayerDiffuse 與 OmniAlpha 等方法。CLIP Score 用於衡量生成影像與文字描述之間的語意對齊程度,分數越高代表生成的內容越符合文字描述的要求,這也顯示 T2RGBA 在理解文字並轉化為視覺素材的能力上具備領先水準。從整體架構來看,UniWorld-Design 的意義不僅在於提升了生成品質,更重要的是重新定義了生成模型與視覺內容之間的關係。

傳統的像素生成模型把影像視為一個不可分割的整體,使用者若要編輯生成結果,往往需要仰賴外部工具進行後處理。UniWorld-Design 則把圖層作為模型內建的操作單元,讓生成、理解與編輯三個環節得以在同一個框架內完成。這項設計也為代理式編輯帶來了新的可能性。由於 I2L 的指令介面支援多層次的分解操作,未來的 AI 代理可以透過自然語言指令,直接對圖像進行結構性的修改。例如,使用者可以要求系統「把背景拆出來換成另一個場景」,或是「把前景的主體單獨提取並調整位置」,這些操作不再需要手動框選或複雜的遮罩處理。

研究團隊在論文摘要中強調,人類設計師在創作過程中,始終是透過圖層來建構與調整視覺內容,而不是直接操作像素。UniWorld-Design 的目標,就是讓多模態生成模型也能夠在同樣的設計空間中運作,從而縮短 AI 生成內容與專業設計工作流程之間的距離。這項研究已在學術社群中引起討論,論文發布後獲得了不少關注與正面評價。整體而言,UniWorld-Design 代表了圖像生成技術從「產生一張圖」朝向「產生一組可編輯的視覺結構」的重要轉向。

隨著生成式 AI 在設計、行銷、影視與遊戲產業的應用日益普及,具備圖層原生能力的生成框架,可望為專業創作者提供更貼近實際工作流程的工具,也為後續研究開啟了新的方向。

Related

相關文章

選秀捲土重來,這回來的都不是真人了

抖音近期出現AI生成虛擬偶像的選秀短劇,如《星光108》和《12星練賽》,完全複製傳統選秀模式但選手皆非真人,引發熱潮。這類節目成本低、產出快,觀眾可投票決定成團命運,但也引發缺乏真實情感與監管不確定性的爭議。AI選秀可能預示娛樂產業結構性變革,未來或與真人選秀走向融合。

2 小時前

小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞

首頁 > IT資訊>網絡 小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞 2026/8/7 15:49:00 來源:IT之家 作者:潞源 責編:潞源 評論: 感謝IT之家網友 軟媒用戶1238620 的線索投遞! IT之家 8 月 7 日消息,小紅書官方昨天發佈《AI 治理規則公告》,明確 AI 賬號的治理原則。

3 小時前

我,用美圖Agent,一句話拍出AI短劇

美圖公司推出「美圖Agent」新功能,使用者只需輸入一句話即可自動生成AI短劇,大幅降低創作門檻。該功能整合自然語言處理與影像生成模型,能將指令拆解成分鏡腳本並產出連續畫面,目前支援多種風格且可免費試用基本功能。此舉顯示美圖從修圖軟體轉向AI內容創作平台的企圖心,目標鎖定短影音創作者與品牌行銷需求。

8 小時前

Grokipedia被曝數月未更新,AI百科項目編輯功能陷停滯

馬斯克推出的AI百科項目Grokipedia被揭露自今年4月起內容更新基本停滯,過去三個月內沒有任何條目完成更新,用戶編輯請求也長期未處理。調查顯示此問題普遍存在於各類頁面,與早期數分鐘內完成修改的效率形成明顯反差,且該平台曾因直接引用維基百科及爭議性來源而受質疑。

16 小時前5700

美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感

首頁 > 智能時代>人工智能 美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感 2026/8/6 17:44:33 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,美國一些祖父母正熱衷於把孫輩寫進 AI 生成童書,卻讓孩子父母大為反感,甚至引發家庭矛盾。據《連線》雜誌當地時間 7 月 29 日報道,美國各地不少父母陸續收到孩子祖父母送來的 AI 童書。

1 天前

WorkBuddy 跑出來後,釘釘飛書放下了“入口”執念

WorkBuddy以AI代理為核心的新工具,促使釘釘與飛書放下過去對「入口」的執念,轉而將重心放在協作效率與場景落地。企業用戶不再迷信單一入口,更看重平台能否與其他系統順暢對接,讓AI在具體工作中產生實質效益。整體而言,競爭焦點從「圈住用戶」轉向「服務用戶」,AI能力與開放性成為下一階段的主導關鍵。

1 天前