NUS Show Lab 壽政教授:打通自迴歸與離散擴散,打造下一代具身大模型底座|ECCV 2026

2026年9月14日 02:50
站內 AI 整理稿

告別模型拼貼套路,自迴歸與離散擴散的融合,正在開啟 AI 的體驗時代。作者丨張璐 編輯丨岑峰 “理解”和“生成”真的無法在同一個模型底座中完美融合嗎?不同於拼接獨立模型的傳統做法,NUS Show Lab 選擇了一條更原生的架構路線:在單個 Transformer 中同時打通自迴歸預測與離散擴散生成。作為多模態領域的重磅成果,Show-o 系列不僅打破了模態壁壘,更將觸角延伸至具身機器人決策。在 ECCV 2026 現場,Show Lab 負責人壽政教授詳細還原了他們如何用閉環算法破解數據稀缺、消除連續視頻幀卡頓,並實現雲端大模型與端側低延遲控制的完美配合。

壽政教授此次披露的研究成果,不僅是一次性能的跨越,更是多模態架構從“實驗玩具”向“具身大腦”進化的分水嶺。其核心突破點在於以下三個維度的重構:首先,在架構底層,Showo 架構打破了文本離散性與視覺連續性的“死結”。通過將處理文本的自迴歸(AR)機制與處理視覺的離散掩碼擴散(Discrete Diffusion)深度縫合,Showo 避開了傳統自迴歸生成圖像的效率泥潭,同時也解決了連續擴散模型無法直連 VLM 離散 Token 的痛點,實現了邏輯推理與高質生成的完美共生。其次,針對困擾具身智能的“標註荒”,壽教授提出的循環一致性監督(Cycle Consistency)提供了極佳的解決方案。

在缺乏人類標註的特定文化或低資源領域,模型通過“觀察-描述-再合成”的邏輯循環實現自監督進化。這讓 AI 從 YouTube 海量無標籤“生肉”視頻中吸取物理常識成為了可能,極大地拓寬了 Scaling Law 的數據邊界。最後,具身智能的落地成敗取決於毫秒級的反應。團隊自研的 Q1 實時骨幹網,通過精密的特徵對齊與蒸餾,實現了遠超前沿閉源大模型的推理速度。這證明了:一個真正的“數字生命”大腦,不僅要能深思熟慮,更要在與物理世界碰撞的一瞬間,給出近乎本能的實時反饋。

以下為演講全文,AI科技評論在不改變原意的基礎上,對內容進行了整理與編輯:01告別“只讀不練”:多模態 AI 如何從“看懂視頻”跨入“具身體驗”?過去幾年,視覺與語言交叉領域的核心任務主要圍繞視頻理解與視頻生成兩條獨立路線展開。前者致力於將視頻轉化為文本描述或解答視頻問題,後者則根據文本提示詞生成對應的動態視頻。以往業界往往為這兩類任務分別訓練專屬模型,但一個天然的演進趨勢是:能否構建一個單一的統一模型來同時完成這兩類任務?如今,AI 發展正迎來一個關鍵轉折點,即從單純的“語言-視頻相互作用”邁入“體驗時代”。在這一新階段,模型不再僅僅停留在對視覺和文本的關聯認知上,而是融入了“動作”維度。

模型需要具備在物理或虛擬環境中採取行動的能力,並通過環境給出的實時反饋實現“在做中學”。02Show-o 架構突破:用單個 Transformer 打通“文本生成”與“高效繪圖”在實現多模態統一的探索中,業內曾出現過不同的技術嘗試。例如早期的NEXt-GPT項目,通過將大語言模型與專用的擴散模型進行外掛組合,實現了任意模態到任意模態(Any-to-Any)的輸入與輸出。但這本質上依然是“大模型 + 獨立生成模塊”的分立架構,並未實現模型底座的真正融合。要用單一網絡同時搞定理解與生成,主要面臨兩套主流範式的權衡。

▎純自迴歸範式以 Chameleon 為代表的自迴歸方案天然適配文本及圖文交錯數據,但在圖像生成時需要將圖像切分成數百個 Token 並進行逐 Token 預測,推理速度較慢且算力開銷巨大。▎連續擴散範式傳統的連續擴散方案雖然生成質量高、速度快,但由於其運行在連續隱空間中,難以與基於離散 Token 的大語言模型在統一空間內無縫融合。為了解決這一矛盾,Show-o 架構應運而生。它是首個將自迴歸與離散擴散融合在單一 Transformer 架構中的統一模型。

在處理文本理解與生成時,模型保持自迴歸模式;而在進行圖像或視頻生成時,則切換至基於離散 Token 的擴散模式(基於 Mask-and-Predict 機制)。模型僅需十幾步迭代即可一次性恢復出完整的視覺Token,既保留了自迴歸對多模態文本的建模能力,又實現了擴散模型的高效圖像生成,支持任意順序和組合的多模態輸入輸出。

03從靜態生成到動態視頻:Show-2 破解多模態統一的三大技術瓶頸雖然 Show-o 驗證了統一架構的可行性,但要邁向下一代統一模型,仍需破解三個核心難題:▎雙向反哺:不僅用“理解”教生成,更用“生成”提精理解目前業內已普遍證實“理解能力可以促進生成”(例如提供更詳盡的描述能指引更高質量的生成),但“生成能力如何反哺理解”仍是前沿課題。為此,團隊引入了循環一致性監督機制。對於缺乏文本描述的特定領域圖像(如特定文化遺產或偏遠自然景觀),先利用理解模塊生成描述文本,再將該文本作為輸入驅動生成模塊重建圖像,通過對比原始圖像與重建圖像的差異建立自監督閉環。

▎幀間流暢度革命:3D Tokenizer 與時空雙向注意力Show-o 初期主要針對靜態圖像或非連續關鍵幀,而 Show-2 則實現了向連續視頻生成的跨越。團隊為此開發了一款通用的 3D Tokenizer,能夠同時對圖像和視頻進行統一編解碼。在注意力機制設計上,文本部分沿用因果單向注意力,保持前向預測的邏輯性;視覺部分則採用完全連接的時空雙向注意力,讓所有視覺 Token 在空間與時間維度上互相可見,大幅提升了生成視頻的連貫性與畫質。

▎兼顧“高層語義”與“像素細節”的雙路徑架構關於理解與生成是否應該共享同一個 Tokenizer,實驗表明,若完全共享同一個編碼器,在現有數據條件下理解性能相比專有的預訓練編碼器仍有微小差距。因此 Show-2 採用了雙路徑架構:在輸入端共享 3D Encoder,但在模型內部拆分為理解與生成兩條路徑。理解路徑中特別加入語義層(Semantic Layer)進行特徵蒸餾與對齊,既保障了視覺理解能力,又維持了極高的生成畫質。04大腦落地物理世界:從多模態大模型到機器人閉環控制在完成多模態理解與生成的統一後,團隊將這一統一架構思想進一步延伸至具身智能與機器人學習領域。

為了支撐具身智能的研究,團隊搭建了完善的物理實驗環境。桌面端部署了固定式雙臂系統,分別搭載雙指夾爪與五指靈巧手;移動端則結合了輪式導航底盤與頂部主動機械臂。通過雙操縱手柄的遙操作採集系統,人類操作員可以實時控制機械臂運行並採集“狀態-動作軌跡”數據。在具體的模型部署上,傳統的視覺-語言模型(VLM)正在向具備動作預測能力的視覺-語言-動作模型(VLA)演進:VLA 策略模型:在 VLM 底座的基礎上加入動作調製層,能夠根據視頻輸入和指令直接預測機器人應採取的物理動作。世界模型(World Model):能夠以當前視覺和動作輸入為條件,預測未來環境的像素級變化。

世界動作模型(World Action Model, WAM):將兩者融為一體,實現了“既預測動作,又預測未來動作產生的視覺結果”的閉環。在落地應用層面,團隊採取了雲端大模型與端側微調模型相結合的策略。雲端前沿大模型雖然規劃能力強,但推理延遲較高(單次決策約 8 至 20 秒);而基於開源底座微調的本地模型能夠實現近乎實時的低延遲控制,在自動化雙臂協作等複雜任務中表現出更高的成功率與響應速度。05現場互動 Q&A▎問:在 Show-2 中,團隊將視覺理解與生成統一到了同一個模型架構中,並展現出了極高的靈活性與效率。

請問在特定領域數據相對稀缺(Data Scarce)的場景下,這種統一理解與生成的架構,是否能比分立的模型帶來更顯著的性能提升?答: 這是一個非常關鍵且具有實踐價值的問題。如果採用完全共享的編碼器,在數據量極其有限的特定領域,模型確實容易在抽象語義理解(需要高度提煉)與高頻生成細節(需要保留像素細節)之間產生拉扯。這正是我們在 Show-2 中採用“共享輸入 Encoder + 內部分立路徑”這一設計的原因。我們在理解路徑中特別引入了語義蒸餾層(Semantic Layer),使得模型在面對稀缺數據時,既能充分吸收生成任務所帶來的豐富視覺表徵,又不會犧牲理解任務的精度。

隨著跨模態表徵對齊技術的不斷演進,統一架構在少樣本學習與跨域泛化上的潛在優勢將會得到進一步釋放。為了方便大家抱團交流、互通會議消息,我們專門建了 ECCV 2026 參會交流群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。

現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

6 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前