螞蟻靈波開源 LingBot-Video,全球首個面向具身的視頻基模來了!
重點摘要
螞蟻靈波開源 LingBot-Video,這是全球首個基於 MoE 架構、專為具身智能設計的視頻生成基礎模型。該模型在機器人相關任務的基準測試中表現優於其他開源模型,並在推理效率與物理合理性方面有系統性提升。LingBot-Video 已正式開源,可用於機器人動作預測、仿真數據生成等方向。
螞蟻靈波於 7 月 9 日正式開源 LingBot-Video,這是全球首個以 Mixture-of-Experts(MoE)架構為基礎、專門面向具身智慧設計的開源影片生成基礎模型。該模型從機器人與具身智慧的核心需求出發,重新定義了影片預訓練的範式,在推理效率、物理合理性、動作理解與任務完成度等關鍵指標上取得系統性突破,為影片基礎模型從數位內容創作跨入具身智慧領域提供了全新的開源基底。在由北京大學與字節跳動共同發布的機器人操作影片評測基準 RBench 上,LingBot-Video 獲得總分 0.620,超越 Wan2.6(0.607)、Seedance 1.5 Pro(0.
584)以及 Cosmos3 Super(0.581)等主流模型。RBench 專注於評估模型能否生成符合真實物理規律的機器人行為,這項結果顯示 LingBot-Video 在生成機器人相關影片時,能更有效地維持動作過程的合理性與任務執行的完整性,凸顯其在具身智慧領域的技術優勢。為了進一步驗證模型對物理世界變化的建模能力,螞蟻靈波在內部評測基準中從通用品質與具身領域兩個維度進行對比,對象包括 NVIDIA Cosmos 3、Wan 2.2 A14B、LongCat-Video、Hunyuan Video 1.5 以及 LTX-2.3 等五個開源模型。
結果顯示,LingBot-Video 在具身相關場景中展現出更強的物理理解能力與動作一致性,整體表現優於主要的基線模型。過去幾年,影片生成模型在畫質、流暢度與創意表現上進步迅速,但對於具身智慧而言,一個看似逼真、動作流暢的影片,如果無法反映真實的物理規律,就難以支撐機器人進行連續預測、規劃與執行任務。此外,具身智慧還要求模型具備更高的推理效率,以適應即時互動與控制閉環的需求。這也使得影片生成開始分化出兩條截然不同的發展路徑:一條通往影視創作,服務於內容生成;另一條則通往機器人領域,服務於對物理世界的理解、預測與互動。LingBot-Video 正是螞蟻靈波在後者這條路線上進行的關鍵探索。
LingBot-Video 的技術突破來自架構、數據與訓練三大面向的系統性創新。在架構方面,模型採用 DiT(Diffusion Transformer)結合 MoE 的設計,以混合專家架構取代傳統的密集參數架構,在擴大模型容量的同時有效控制單次推理的成本。這個擁有 300 億總參數的模型,在實際生成時僅需啟動約 30 億參數,相較於同等參數規模的密集架構,推理效率提升約 3 倍。這樣的設計讓模型既能借助大規模參數獲得強大的視覺表達能力,又能滿足具身智慧對於高效推理的嚴格要求。
在數據處理層面,LingBot-Video 建構了一套數據畫像引擎,除了利用海量網際網路影片進行預訓練,更進一步導入 VLA(視覺-語言-動作)、VLN(視覺-語言導航)、Ego(第一人稱視角)等機器人相關數據,涵蓋靈巧操作、機器人移動與第一視角互動等多種場景,總計達 7 萬小時的具身數據。這些高品質的資料幫助模型學習動作與環境變化之間的因果關係,而不只是模仿影片表面的紋理與視覺風格。
在訓練階段,LingBot-Video 引入了多維度的強化學習獎勵系統,除了美學評分、提示跟隨能力與運動一致性等常規指標外,特別針對物理合理性與任務完成度進行對齊最佳化,使得生成的影片更符合真實世界的運作規律,也更貼近機器人在實際環境中完成任務的需求。據螞蟻靈波團隊介紹,LingBot-Video 可廣泛應用於機器人動作預測、模擬數據生成、動作條件建模以及世界模型研究等方向。目前該模型已正式開源,提供學術界與產業界進一步研究與落地使用。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。