京東開源視頻實時編輯模型:30 幀秒級推理,邊看邊改重新定義視頻創作

2026年8月5日 03:317400 次瀏覽

重點摘要

京東宣佈開源自研實時流式視頻編輯模型 JoyAI-Video-Edit,支持720P下每秒30幀推理,可任意時長穩定流式編輯,實現邊觀看邊修改。在OpenVE-Bench評測中全面領先,並可為機器人訓練合成數據。

站內 AI 整理稿

**京東開源視頻實時編輯模型 JoyAI-Video-Edit:30 幀秒級推理,開啟「邊看邊改」的視頻創作新紀元**

**新聞導讀:** 京東今日宣佈開源其自研的實時流式視頻編輯模型 JoyAI-Video-Edit。該模型實現了在 720P 分辨率下每秒 30 幀的推理速度,支援任意時長的視頻流式處理,讓用戶能夠在視頻播放過程中即時修改人物、場景與風格,徹底顛覆傳統「先有素材再修改」的創作流程。此舉不僅為視頻創作者提供了革命性的工具,更為具身智能機器人的訓練數據合成開闢了全新的技術路徑。 **即時互動編輯,突破傳統創作瓶頸**

傳統的視頻編輯流程繁瑣且耗時,創作者往往需要先完成素材拍攝,再通過後期軟體進行剪輯、調色與特效添加,整個過程猶如一場漫長的「馬拉松」。然而,京東最新開源的 JoyAI-Video-Edit 模型,正試圖將這一過程轉變為輕鬆的「散步」。該模型的核心突破在於其「實時流式」處理能力,用戶可以在視頻播放的同時,通過指令即時修改畫面內容,實現「邊觀看邊創作」的全新互動體驗。這意味著,創作者不再需要等待漫長的渲染過程,而是可以在視頻流動的瞬間,捕捉靈感並即刻付諸實現。 **技術攻堅:速度與長度的雙重突破**

視頻實時編輯最大的技術挑戰在於速度。視頻由連續的幀畫面組成,若模型處理速度無法跟上播放速率,便會產生嚴重的卡頓與延遲,破壞觀看與創作的連續性。為了解決這一難題,京東研究團隊基於全自研的 JoyAI-Video 基礎模型,對其推理引擎進行了深度優化。官方數據顯示,JoyAI-Video-Edit 在 720P 分辨率下,實現了每秒 30 幀的模型推理速度,這一性能指標不僅保證了畫面的清晰度,更完美契合了主流影視視頻的播放節奏,確保了編輯過程的流暢無阻。除了速度,視頻長度也是制約流式編輯模型應用的另一大門檻。此前,市場上的流式編輯模型大多只能處理幾秒或分鐘級的短片段,極大限制了其應用場景。

JoyAI-Video-Edit 則徹底打破了這一限制,支援任意時長的穩定流式編輯。無論是數分鐘的短視頻,還是數小時的長片,該模型都能伴隨視頻的持續播放,進行不間斷的實時處理。這項突破意味著,用戶無需等待整段視頻生成完畢,即可在播放過程中對任意時間點的畫面進行修改,真正實現了「所見即所改」。**權威評測全面領先,四類編輯任務優勢顯著**

為了驗證模型的真實性能,京東研究團隊將 JoyAI-Video-Edit 與當前國際上頗具代表性的流式視頻編輯模型,如 SANA Streaming、LiveEdit 和 Xmax-X2.0 等進行了嚴謹的對比測試。結果顯示,在覆蓋典型視頻編輯場景的綜合評測數據集中,JoyAI-Video-Edit 的整體效果全面領先。尤其在業界權威的 OpenVE-Bench 通用評測中,該模型一舉超越了目前所有的流式編輯方法,展現出統治級的實力。

具體而言,JoyAI-Video-Edit 在四類核心編輯任務中表現尤為突出:**全局風格**轉換、**局部物體**替換、**局部內容**刪除以及**字幕**編輯。在這些任務上,該模型的處理效果大幅領先行業同類產品,無論是風格遷移的自然度、物體替換的真實感,還是字幕編輯的準確性,都達到了世界一流水平。這一系列權威數據的背書,無疑證明了 JoyAI-Video-Edit 在技術上的領先地位。**應用場景廣泛,重塑內容創作與直播互動**

這項技術的落地,將為內容創作領域帶來無限可能。在短視頻創作中,創作者可以讓視頻中的人物連續更換多套服裝,無需重新拍攝;在電商直播間,主播可以一鍵將普通的室內場景切換為絢麗的動畫世界,極大增強直播的視覺吸引力與互動性;在家裝設計領域,設計師或業主可以通過實時編輯,在視頻中嘗試不同的傢俱擺放、牆面顏色與燈光效果,身臨其境地感受裝修完成後的實際效果。這些應用場景的拓展,將極大地降低視頻創作與視覺呈現的門檻,激發更多用戶的創作熱情。 **賦能具身智能,為機器人「量產」訓練數據**

更值得關注的是,JoyAI-Video-Edit 的價值遠不止於視頻創作本身。它還為當前火熱的具身智能(Embodied AI)領域提供了一條高效的數據合成新路徑。機器人訓練需要海量的物體抓取、搬運與操作視頻數據,然而,真實的機器人數據採集成本高昂,且涉及危險或少見場景時難以反覆獲取。JoyAI-Video-Edit 憑藉其對場景、物體與畫面內容的精準可控編輯能力,可以巧妙地將現有的人手操作視頻,轉化為機械手或機械臂的操作素材。在保留物體位置、空間關係與動作軌跡等關鍵資訊不變的前提下,模型可以自由替換視頻中的場景、物體甚至機器人形態,從而將一段原始視頻擴展出大量多樣化的訓練樣本,有效解決了具身智能領域數據匱乏的痛點。 **開源生態,開啟多賽道想像空間**

從革新視頻創作流程,到為機器人「量產」訓練數據,京東此次開源 JoyAI-Video-Edit 模型的舉動,其意義深遠。通過開源,京東將這一前沿技術無償貢獻給全球開發者與研究機構,有望吸引更多力量參與到視頻實時編輯技術的迭代與應用創新中來。這不僅將加速視頻創作工具的民主化進程,也將為人工智能在多個垂直行業的落地應用打開全新的想像空間。業內人士認為,京東此舉將有力推動整個 AI 視頻編輯賽道的發展,並在具身智能等前沿領域催生出新的生態模式。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

29 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前