ECCV 2026|4步去噪實現12.66 FPS,清華、港科大提出實時流式視頻編輯框架LiveEdit

2026年8月26日 09:20
站內 AI 整理稿

來源:機器之心原文鏈接:https://mp.weixin.qq.com/s/HT6AMtSUoKPSpEKI2TLy5Q文本指令驅動的視頻編輯技術正在從離線內容生產走向直播特效、視頻會議和增強現實等在線交互場景。然而,高質量的視頻擴散模型的通常依賴於對完整視頻進行雙向時空注意力處理,即模型需要等待未來幀到齊,再對整段視頻進行聯合處理。這種範式能夠獲得較好的編輯結果,卻難以滿足低延遲、持續輸入與即時輸出的要求。近日,清華大學與香港科技大學的研究團隊提出 LiveEdit,一種面向通用文本指令的實時流式視頻編輯框架。

該方法以因果、分塊的方式處理持續到來的視頻,在 4 步 / 視頻塊的推理條件下實現 12.66 FPS 的流式編輯,並能保持被編輯區域的準確性以及未編輯區域的一致性。論文標題:LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing論文鏈接:https://arxiv.org/abs/2606.26740開源代碼:https://github.com/cp-cp/LiveEdit目前,該工作已被計算機視覺頂級會議 ECCV 2026 接收,其訓練、測試代碼和模型均已開源。

邁向實時視頻編輯的兩道門檻流式視頻編輯與常規視頻生成任務存在差異:視頻生成可以從高斯噪聲中自由地合成新的內容,而編輯任務需要在改變目標區域的同時,儘可能保持原始視頻中的人物結構、背景紋理、光照和運動軌跡。因此,直接複用面向生成的流式框架,往往會帶來背景閃爍、結構漂移或編輯範圍失控。1.從雙向注意力到因果注意力,會發生分佈偏移雙向視頻擴散模型通常能夠同時訪問過去幀和未來幀,並利用鄰近幀的雙向信息維持結構穩定。進入流式場景後,未來幀尚未到來,模型只能查看當前與歷史內容。論文觀察到,如果直接截斷未來幀,原本集中於鄰近幀的注意力會被攤薄到更長的歷史範圍,破壞預訓練階段形成的局部時序先驗。

最終表現為模型對原始視頻結構的「遺忘」,並在長時間編輯中出現閃爍或漂移。2.未編輯區域的重複計算,成為實時推理的主要負擔在多數編輯任務中,真正發生語義變化的區域只佔畫面的一部分。背景、結構和大量靜態紋理在相鄰視頻塊之間高度相似,但標準視頻擴散模型仍會讓所有空間 Token 反覆通過 Self-Attention、Cross-Attention 和 FFN。對這些未編輯區域進行密集重計算,不僅浪費算力,也可能讓本應保持不變的內容被模型反覆「重畫」。LiveEdit:先遷移編輯能力,再壓縮為 4 步因果推理LiveEdit 設計了漸進式的三階段蒸餾流程。其基礎模型建立在 Wan2.1-T2V-1.

3B 之上,訓練數據由從現有的視頻編輯數據集 Ditto-1M 篩選得到的兩萬組高質量數據對。階段一:Foundation Tuning,建立高質量雙向編輯先驗第一階段保留完整的雙向 DiT 結構,讓模型充分學習從原始視頻、編輯指令到編輯結果的複雜映射。為了避免序列長度進一步增長帶來的計算開銷,在輸入端將原始視頻潛變量與噪聲潛變量沿通道維度注入,而不是在時空序列維度追加 Token。該階段的目標不是追求流式推理,而是先獲得穩定、準確的編輯能力。階段二:Teacher Forcing,對齊分塊因果注意力第二階段引入塊狀因果注意力(chunk-wise causal attention)。

每個視頻塊只能訪問當前塊和歷史塊,時間塊大小設置為 3 個潛空間幀。通過教師強制(Teacher Forcing),模型在明確的因果約束下學習復現第一階段的編輯分佈,使雙向模型的局部結構先驗逐步遷移到單向、分塊的因果擴散模型中。階段三:DMD,分佈匹配蒸餾把 100 次推理壓縮到 4 次完成因果初始化後,LiveEdit 使用分佈匹配蒸餾(Distribution Matching Distillation)繼續壓縮採樣過程。不同於依賴高成本 ODE 初始化的常見自迴歸蒸餾路線,生成器直接由第二階段的因果擴散模型權重初始化,並通過分佈匹配進行訓練。

最終,推理步數從 100 次降至 4 次,同時移除需要額外前向計算的 Classifier-Free Guidance。面向自迴歸的掩碼緩存:讓未編輯區域不再反覆計算僅減少擴散步數仍不足以實現穩定高效的實時視頻編輯。LiveEdit 進一步提出面向自迴歸的掩碼緩存(AR-oriented Mask Cache),比較前一個視頻塊中原始視頻潛變量與編輯結果的差異,按照一定閾值預測當前視頻塊中可能發生編輯的空間區域掩碼。掩碼將 Token 劃分為活躍編輯區域與未編輯區域:需要被編輯 Token 繼續執行完整計算,未編輯 Token 則優先複用先前緩存的中間特徵。

這裡使用的閾值並非固定設置,而是根據當前 Token 的冗餘程度動態調整。在論文采用的推理配置下,70% 的冗餘空間 Token 被裁剪。這一設計利用了視頻編輯區域在相鄰視頻塊之間通常不會發生突變的特點。由於當前塊的掩碼可以由前一塊的編輯差異推斷得到,模型無需再額外運行計算開銷較大的分割模塊。緩存位置同樣經過專門設計。消融實驗發現,Self-Attention 特徵在相鄰時刻之間具有較強的重複性,因而更適合進行跨時間複用;相比之下,FFN 保留了更多紋理和局部結構等高頻空間信息,直接複用容易造成畫面模糊,甚至引起結構不穩定。

因此,最終方案將緩存應用在 Self-Attention 層,而不是簡單緩存整個 DiT 塊。12.66 FPS:流式速度與編輯質量如何兼顧?在效率測試中,LiveEdit 處理 81 幀視頻的總延遲為 7.89 秒,達到 12.66 FPS;LiveEdit 通過三階段蒸餾和緩存機制共同將流式視頻編輯系統推入實時化的速度區間。為了評估通用流式編輯能力,研究團隊建立了包含 120 組樣本的測試集,並從文本對齊度、背景一致性、運動平滑度、動態程度、美學質量和視頻質量等六個維度進行比較。定性結果顯示:LiveEdit 能夠準確完成局部顏色、材質和屬性替換,並減少向非編輯區域漂移的情況。

並且,緩存機制在保持背景一致性的同時,沒有削弱文本指令對齊和運動連續性。同時,用戶研究邀請 20 名志願者對各個方法的結果在指令一致性、背景保留和整體質量三方面進行排序:LiveEdit 在三項指標上的 Top-3 偏好率分別達到 100.0%、87.5% 和 95.8%。從離線後期處理走向持續在線編輯LiveEdit 的目標並不只是一個更高的 FPS 數字,而是針對「流式視頻編輯」設計實時化路徑。這一路線為直播特效、視頻會議、實時內容創作與交互提供了更直接的技術基礎。

不過,當前方法仍依賴相鄰視頻塊編輯區域較穩定的假設;當目標快速移動、編輯區域劇烈變化或出現大範圍全局修改時,掩碼估計與緩存複用策略仍有進一步優化空間。如何在更長視頻、更高分辨率和複雜交互指令下保持穩定,也將是後續值得關注的問題。

Related

相關文章

IT之家生成式AI

MiniMax:正推進 M3 和 H3 的國產芯片適配,大規模國產算力集群將很快上線

首頁 > 智能時代>人工智能 MiniMax:M3 Pro 模型參數規模預計提升至約 3T,大規模國產算力集群將很快上線 2026/8/26 21:46:50 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: 感謝IT之家網友 麻辣清補涼 的線索投遞! IT之家 8 月 26 日消息,據證券時報消息,MiniMax 在中期業績電話會上透露,M3 Pro 的參數規模預計提升至約 3T,並進一步擴大強化學習和長程任務訓練,以提高模型的泛化能力和智能上限。MiniMax 創始人、CEO 閆俊傑表示,下一階段將繼續推進模型智能、推理效率和基礎設施能力的協同提升,加快 M 系列與 H 系列模型的研發及發佈週期。此外,MiniMax 正在推進 M3 和 H3 的國產芯片適配,大規模國產算力集群將很快上線,並逐步承擔真實生產流量。據IT之家此前報道,MINIMAX 今日發佈 2026 財年上半年(2026 年 1 月~2026 年 6 月)報告:營業總收入:1.17 億美元(現匯率約合 7.88 億元人民幣),同比增長 283.1%毛利潤:2,081.3 萬美元(現匯率約合 1.4 億元人民幣),同比增長 464.8%毛利率:17.9%歸母淨利潤:-3.58 億美元(現匯率約合 -24.12 億元人民幣),虧損收窄 11%基本每股收益:-1.18 美元(現匯率約合 -7.9 元人民幣)稀釋每股收益:-1.18 美元(現匯率約合 -7.9 元人民幣)資產負債率:21.5%相關閱讀:《MiniMax M3 模型正式開源:原生多模態、百萬上下文》《通用視頻模型 MiniMax H3 正式開源,支持多模態上下文、2K 分辨率》 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:MiniMaxMINIMAX 2026 財年上半年歸母虧損 3.58 億美元,同比虧損收窄

剛剛
鈦媒體生成式AI

大廠競逐AI辦公助手,蒙牛先跑出一個落地樣本

AGI-Signal2026.08.26 18:58 · 來自北京全文5756字00:00 / 17:29蒙牛讓200名業務骨幹自建AI應用。微軟Copilot嵌入Office,Google Gemini覆蓋Workspace,國內騰訊WorkBuddy、字節豆包、阿里千問辦公等密集迭代,AI辦公助手賽道持續升溫,各方爭奪的是辦公場景的桌面入口。產品能力在提升,功能覆蓋面在擴大,但在企業側究竟能跑出什麼樣的實際效果,目前能拿出完整案例的並不多。蒙牛8月中旬辦了一場AI應用創新大賽的中期路演。

剛剛
量子位生成式AI

硅谷今日最熱具身模型!不用後訓練,看一遍就學會

北美機器人新創Skild AI發布基礎模型S1,主打上下文學習,機器人只需觀看人類示範影片,無需後訓練即可完成煎餅、泡咖啡、植物換盆等長達10分鐘以上的複雜任務,在未見過任務上成功率達66%,遠高於傳統語言提示VLA的9%。相較之下,傳統後訓練需約380次示範才能達到同等水準,顯示機器人學習新技能的成本可望大幅降低。

剛剛