螞蟻靈波開源 LingBot-Video,全球首個面向具身的視頻基模來了!

2026年7月9日 03:376000 次瀏覽

重點摘要

AI資訊AI新閒資訊正文螞蟻靈波開源 LingBot-Video,全球首個面向具身的視頻基模來了!發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘7月9日,螞蟻靈波開源 LingBot-Video,這是全球首個基於 Mixture-of-Experts(MoE)架構、面向具身智能的開源視頻生成基礎模型。

站內 AI 整理稿

螞蟻靈波於7月9日正式開源LingBot-Video,這是全球第一個基於專家混合(Mixture-of-Experts,MoE)架構、專為具身智能設計的影片生成基礎模型。不同於一般影片生成工具,LingBot-Video從機器人與具身智能的核心需求出發,重新思考影片預訓練的方式,在推理效率、物理合理性、動作理解與任務完成度上都獲得系統性提升,為影片基礎模型從數位內容創作跨入具身智能領域提供了一個新的開源底座。在評測表現上,LingBot-Video於北京大學與字節跳動共同發布的機器人操作影片綜合評測基準RBench中,以總分0.620超越Wan2.6(0.607)、Seedance 1.

5 Pro(0.584)與Cosmos 3 Super(0.581)等業界知名模型。RBench主要用來評估模型是否能生成符合真實物理規律的機器人行為,分數越高代表模型在動作合理性與任務執行完整性上越接近真實情境。這項成績顯示,LingBot-Video在生成機器人相關影片時,更能確保動作過程合乎物理邏輯,並完整呈現指定任務。為了進一步驗證模型對物理世界變化的掌握能力,螞蟻靈波也在內部自訂的評測標準中,分別從通用品質與具身領域兩個角度進行比較。對比NVIDIA Cosmos 3、Wan2.2 A14B、LongCat-Video、Hunyuan Video 1.5、LTX-2.

3等五個已開源的模型,LingBot-Video在具身相關場景中展現出更強的物理理解與動作一致性,整體表現優於主要基線模型。過去幾年,影片生成模型在畫質、流暢度與創意表達上進步飛快,但對於具身智能來說,一個看起來很逼真、動作流暢的影片,不一定能反映真實世界的物理定律,也就難以支撐機器人進行連貫的預測、規劃與任務執行。此外,具身智能還要求模型具備更高的推理效率,才能應付即時互動與控制閉環的需求。因此,影片生成領域逐漸分化出兩條路線:一條走向影視娛樂,服務於內容創作;另一條走向機器人世界,服務於對物理世界的理解、預測與互動。LingBot-Video正是螞蟻靈波為具身智能開拓這條新路線的重要嘗試。

從技術架構來看,LingBot-Video採取DiT(Diffusion Transformer)結合MoE的設計,以專家混合架構取代傳統的密集(Dense)網路,在擴大模型容量同時控制每次推理所需的計算成本。整體模型擁有300億個參數,但在生成時僅激活約30億個參數,相較同等參數規模的密集架構,推理效率提高約三倍。這樣的設計讓模型既能利用大規模參數帶來的視覺表達能力,又符合具身智能對於高效即時推理的嚴格要求。

在資料處理方面,螞蟻靈波建置了一套數據畫像引擎,除了納入海量網路影片,還特別引入VLA(Vision-Language-Action)、VLN(Vision-and-Language Navigation)、Ego(第一人稱視角)等機器人相關資料,涵蓋靈巧操作、機器人移動與第一視角互動等場景,整體具身資料總規模達到7萬小時。這些資料幫助模型學習動作與環境變化之間的因果關係,而不只是捕捉影片表面的紋理與視覺風格。

訓練流程方面,LingBot-Video導入多維強化學習獎勵系統,除了常見的美學品質、提示跟隨(prompt following)與動作一致性等指標,還進一步針對物理合理性與任務完成度進行對齊,使得生成的內容更貼近真實世界規律,也更符合機器人在現實中完成任務的實際需求。LingBot-Video的應用場景相當廣泛,可用於機器人動作預測、模擬資料生成、動作條件建模、世界模型研究等方向。目前該模型已正式開源,提供學術界與產業界一個專注於具身智能的影片基礎模型選項。

值得一提的是,螞蟻靈波並非首次在具身智能領域開源關鍵技術,該團隊曾在今年初開源互動式世界模型LingBot-World,為具身智能與自動駕駛等領域提供高保真、邏輯一致的虛擬訓練環境。此外,螞蟻靈波也與樂聚機器人簽署戰略合作協議,結合具身智能大模型與機器人本體技術,在工業與商業場景推動「一腦多機」落地,逐步構築從模型到硬體的完整生態。隨著LingBot-Video的發布,業界得以更清楚看到影片生成技術從「拍出好看的畫面」轉向「理解並預測真實物理互動」的可能性。這不僅為機器人學習與世界模型研究帶來新的基礎工具,也預示著生成式AI在實體世界中的應用將邁入更務實的階段。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

10 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前