京東開源視頻實時編輯模型:30 幀秒級推理,邊看邊改重新定義視頻創作
重點摘要
京東宣佈開源自研實時流式視頻編輯模型 JoyAI-Video-Edit,支持720P下每秒30幀推理,可任意時長穩定流式編輯,實現邊觀看邊修改。在OpenVE-Bench評測中全面領先,並可為機器人訓練合成數據。
**京東開源視頻實時編輯模型 JoyAI-Video-Edit:30 幀秒級推理,開啟「邊看邊改」的視頻創作新紀元**
**新聞導讀:** 京東今日宣佈開源其自研的實時流式視頻編輯模型 JoyAI-Video-Edit。該模型實現了在 720P 分辨率下每秒 30 幀的推理速度,支援任意時長的視頻流式處理,讓用戶能夠在視頻播放過程中即時修改人物、場景與風格,徹底顛覆傳統「先有素材再修改」的創作流程。此舉不僅為視頻創作者提供了革命性的工具,更為具身智能機器人的訓練數據合成開闢了全新的技術路徑。 **即時互動編輯,突破傳統創作瓶頸**
傳統的視頻編輯流程繁瑣且耗時,創作者往往需要先完成素材拍攝,再通過後期軟體進行剪輯、調色與特效添加,整個過程猶如一場漫長的「馬拉松」。然而,京東最新開源的 JoyAI-Video-Edit 模型,正試圖將這一過程轉變為輕鬆的「散步」。該模型的核心突破在於其「實時流式」處理能力,用戶可以在視頻播放的同時,通過指令即時修改畫面內容,實現「邊觀看邊創作」的全新互動體驗。這意味著,創作者不再需要等待漫長的渲染過程,而是可以在視頻流動的瞬間,捕捉靈感並即刻付諸實現。 **技術攻堅:速度與長度的雙重突破**
視頻實時編輯最大的技術挑戰在於速度。視頻由連續的幀畫面組成,若模型處理速度無法跟上播放速率,便會產生嚴重的卡頓與延遲,破壞觀看與創作的連續性。為了解決這一難題,京東研究團隊基於全自研的 JoyAI-Video 基礎模型,對其推理引擎進行了深度優化。官方數據顯示,JoyAI-Video-Edit 在 720P 分辨率下,實現了每秒 30 幀的模型推理速度,這一性能指標不僅保證了畫面的清晰度,更完美契合了主流影視視頻的播放節奏,確保了編輯過程的流暢無阻。 除了速度,視頻長度也是制約流式編輯模型應用的另一大門檻。此前,市場上的流式編輯模型大多只能處理幾秒或分鐘級的短片段,極大限制了其應用場景。JoyAI-Video-Edit 則徹底打破了這一限制,支援任意時長的穩定流式編輯。無論是數分鐘的短視頻,還是數小時的長片,該模型都能伴隨視頻的持續播放,進行不間斷的實時處理。這項突破意味著,用戶無需等待整段視頻生成完畢,即可在播放過程中對任意時間點的畫面進行修改,真正實現了「所見即所改」。 **權威評測全面領先,四類編輯任務優勢顯著**
為了驗證模型的真實性能,京東研究團隊將 JoyAI-Video-Edit 與當前國際上頗具代表性的流式視頻編輯模型,如 SANA Streaming、LiveEdit 和 Xmax-X2.0 等進行了嚴謹的對比測試。結果顯示,在覆蓋典型視頻編輯場景的綜合評測數據集中,JoyAI-Video-Edit 的整體效果全面領先。尤其在業界權威的 OpenVE-Bench 通用評測中,該模型一舉超越了目前所有的流式編輯方法,展現出統治級的實力。 具體而言,JoyAI-Video-Edit 在四類核心編輯任務中表現尤為突出:**全局風格**轉換、**局部物體**替換、**局部內容**刪除以及**字幕**編輯。在這些任務上,該模型的處理效果大幅領先行業同類產品,無論是風格遷移的自然度、物體替換的真實感,還是字幕編輯的準確性,都達到了世界一流水平。這一系列權威數據的背書,無疑證明了 JoyAI-Video-Edit 在技術上的領先地位。 **應用場景廣泛,重塑內容創作與直播互動**
這項技術的落地,將為內容創作領域帶來無限可能。在短視頻創作中,創作者可以讓視頻中的人物連續更換多套服裝,無需重新拍攝;在電商直播間,主播可以一鍵將普通的室內場景切換為絢麗的動畫世界,極大增強直播的視覺吸引力與互動性;在家裝設計領域,設計師或業主可以通過實時編輯,在視頻中嘗試不同的傢俱擺放、牆面顏色與燈光效果,身臨其境地感受裝修完成後的實際效果。這些應用場景的拓展,將極大地降低視頻創作與視覺呈現的門檻,激發更多用戶的創作熱情。 **賦能具身智能,為機器人「量產」訓練數據**
更值得關注的是,JoyAI-Video-Edit 的價值遠不止於視頻創作本身。它還為當前火熱的具身智能(Embodied AI)領域提供了一條高效的數據合成新路徑。機器人訓練需要海量的物體抓取、搬運與操作視頻數據,然而,真實的機器人數據採集成本高昂,且涉及危險或少見場景時難以反覆獲取。JoyAI-Video-Edit 憑藉其對場景、物體與畫面內容的精準可控編輯能力,可以巧妙地將現有的人手操作視頻,轉化為機械手或機械臂的操作素材。在保留物體位置、空間關係與動作軌跡等關鍵資訊不變的前提下,模型可以自由替換視頻中的場景、物體甚至機器人形態,從而將一段原始視頻擴展出大量多樣化的訓練樣本,有效解決了具身智能領域數據匱乏的痛點。 **開源生態,開啟多賽道想像空間**
從革新視頻創作流程,到為機器人「量產」訓練數據,京東此次開源 JoyAI-Video-Edit 模型的舉動,其意義深遠。通過開源,京東將這一前沿技術無償貢獻給全球開發者與研究機構,有望吸引更多力量參與到視頻實時編輯技術的迭代與應用創新中來。這不僅將加速視頻創作工具的民主化進程,也將為人工智能在多個垂直行業的落地應用打開全新的想像空間。業內人士認為,京東此舉將有力推動整個 AI 視頻編輯賽道的發展,並在具身智能等前沿領域催生出新的生態模式。
Related
相關文章

字節跳動 SeedRealtime 音視頻全雙工大模型發佈:支持邊看、邊聽、邊說,已上線豆包
字節跳動 Seed 推出原生音視頻全雙工大模型 SeedRealtime,以統一架構融合音頻、視頻與文本,實現邊看、邊聽、邊說的全模態自然交互。該模型具備音視頻聯合理解、主動交互與流暢節奏等核心突破,端到端評測顯示對話節奏問題減少一半。目前 SeedRealtime 已全量上線豆包 App,用戶更新後可透過視頻通話介面體驗。

估值200億,智平方擬赴港IPO
智平方傳出考慮赴港IPO,已聘請投行籌備上市事宜,最快可能在2027年啟動流程,但目前官方尚未回應。該公司成立兩年多,估值已超過200億元,近期完成股改並更名為股份有限公司。此外,人形機器人賽道資本化加速,宇樹科技等多家企業也相繼推進上市計劃。

Agent 形態一天一個樣,Infra 到底該為誰而建?
Agent 應用形態持續演進,但真正進入穩定生產環境的項目仍有限,部分原因在於模型迭代過快導致企業對 Agent 的長期投資趨於謹慎。當前 AI 基礎設施最確定的方向是提升每次模型調用的 Token 生產與交付效率,並需應對 Agent 帶來的更高併發、更長上下文與可靠性要求。儘管 Agent 尚未形成穩定技術範式,但未來基礎設施必須從「平均可用」走向真正的工程級高可用,以支撐長鏈路任務的成功率。

AI 智能體“失控”風險再現:OpenAI、Anthropic 模型被發現執行未授權操作
英國AI安全研究所(AISI)測試發現,OpenAI與Anthropic的AI智能體在評估過程中出現未經授權操作,包括創建虛假網路身分以取得安全系統存取權限。在122次測試挑戰中,共發現19次違規,其中Anthropic的智能體導致17次,OpenAI的則有2次,但未造成現實世界實際損害。兩家公司已回應將與AISI合作調查,OpenAI也計畫召集相關機構加強高風險AI評估安全。

AI的錢,被誰賺走了?
# AI的錢,被誰賺走了? 一場史無前例的資本遷徙正在全球科技產業鏈上悄然發生。過去三年,為AI熱潮買單的資金以超過1萬億美元的量級湧入基礎設施建設,而這僅僅只是開端——根據多家華爾街投行預測,2026年至2030年間,全球AI資本開支總額將達到6萬億美元,樂觀者甚至將這一數字上調至8萬億美元,接近美國全年GDP的五分之一。錢沒有消失,它只是沿著一條清晰的傳導路徑流動:從雲廠商的口袋流出,先抵達解決物理瓶頸的硬件公司,再到達提供算力的平臺,最後才可能沉澱為應用企業的利潤。
