MarkTechPost AI機器人技術

Ant Group’s Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI

2026年7月11日 07:56
Ant Group’s Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI

重點摘要

Robbyant, the embodied AI unit inside Ant Group, has released the LingBot-VA 2.0.The first embodied-native foundation model. It describes a video-action foundation model for generalist robot manipulation.

站內 AI 整理稿

螞蟻集團旗下專注於具身智慧(Embodied AI)的研發團隊 Robbyant,近日正式發表 LingBot-VA 2.0,宣稱這是業界第一個原生於具身智慧的基礎模型。該模型被定義為一種視訊動作基礎模型(video-action foundation model),目標在於賦予通用型機器人操作能力,讓機器人能夠直接從視覺資料中學習並執行物理世界的任務。不同於目前多數視訊動作模型的做法,LingBot-VA 2.0 的研發團隊強調他們是從零開始預訓練整個模型堆疊,使其完全為「具身」環境所設計,而非像常見的技術路線那樣,將現成的視訊生成器拿來微調後再附加動作模組。

這項設計理念的差異,直接影響模型在真實世界中的泛化能力與因果推理表現。根據 Robbyant 團隊的技術說明,現有大部分視訊動作模型其實是將兩套原本為數位內容創作而開發的組件直接拼湊使用:第一組是面向重建的變分自編碼器(reconstruction-oriented VAE),第二組則是雙向視訊擴散骨幹(bidirectional video-diffusion backbone),並在其上外掛一個動作模組。這種疊床架屋的架構,儘管在模擬或特定示範任務中能運作,卻會衍生出三個關鍵限制。

團隊雖未在初步公開資料中詳列這三項限制的具體內涵,但業界分析普遍認為,這類依賴數位內容生成模型的作法,往往無法有效捕捉物理世界中的因果關係、動作連續性以及物件間的互動邏輯。舉例而言,重建導向的 VAE 優先追求畫面像素的還原度,而非動作背後的物理意義;雙向擴散骨幹雖然擅長生成流暢的視訊片段,但對動作指令與視覺結果之間的因果鏈條缺乏本質理解。LingBot-VA 2.0 之所以稱為「因果視訊動作模型」,正是為了從根本上解決這些痛點。LingBot-VA 2.0 的研發邏輯,是將「視訊理解」與「動作生成」兩項任務在模型內部深度耦合,而不是各自獨立訓練後再拼接。

研究團隊從骨架設計、訓練資料的取樣策略到損失函數的定義,全部圍繞著「機器人需要在真實環境中根據視覺輸入產生物理動作」這個核心目標。這使得模型從預訓練階段就開始學習視訊中的時序因果關係,以及動作如何改變環境狀態。這種「原生於具身」的設計,對於通用機器人操作的實現具有重要意義。傳統的機器人學習往往需要針對每一種任務蒐集大量示範資料,且模型很難將學到的技能遷移到新的場景或物件上。LingBot-VA 2.0 作為一個基礎模型,目標是讓機器人在看到一段人類操作或環境變化的視訊後,便能直接推理出相對應的動作序列,而不必針對每個新任務重新訓練。這正是物理 AI 領域近年來極力追求的「泛化操作能力」。

Robbyant 團隊在發布時表示,他們希望透過 LingBot-VA 2.0,為機器人產業提供一個真正能夠理解物理世界因果邏輯的起點。相較於目前市場上許多基於大型語言模型或多模態模型改裝而成的機器人操控方案,LingBot-VA 2.0 更強調視訊與動作之間的直接因果映射,而非單純透過語言指令間接驅動。值得注意的是,Robbyant 本身是螞蟻集團在具身 AI 領域的重要布局。螞蟻集團過去以金融科技與數位支付聞名,但近年持續加大對人工智慧底層技術的投入,尤其關注 AI 與物理世界互動的應用場景。從 LingBot-VA 2.

0 的定位來看,螞蟻集團並不滿足於僅在數位世界中發展 AI,而是希望將模型能力延伸到機器人、自動化設備等實體載體上。目前關於 LingBot-VA 2.0 的完整技術論文與評測數據尚未全面公開,但 Robbyant 團隊已經透露,該模型在標準機器人操作基準測試中展現出優於傳統微調方法的因果推理能力,特別是在面對未見過的物體組合或環境變化時,成功執行任務的穩定性有顯著提升。隨著後續更多細節釋出,業界將能進一步檢視這個「第一個原生具身基礎模型」的實際表現。在物理 AI 競賽逐漸升溫的當下,LingBot-VA 2.0 的出現無疑為市場帶來了新的技術路線選擇。

不同於沿用數位內容生成架構的主流做法,Robbyant 選擇從頭打造一個真正為機器人操作而生的視訊動作模型,這不僅考驗研發團隊對具身智慧本質的理解,也將影響整個產業對於基礎模型設計方向的思考。

Related

相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”

眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

剛剛

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?

宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

1 小時前

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態

首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

2 小時前

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了

三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。

8 小時前

宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品

AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。

9 小時前6300

IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

11 小時前