行業首個具身原生世界動作模型來了!螞蟻靈波發佈LingBot-VA 2.0

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 行業首個具身原生世界動作模型來了!螞蟻靈波發佈LingBot-VA 2.
好的,這是根據您提供的資料重寫的一篇完整新聞稿:
### 從「嫁接」到「原生」:螞蟻靈波LingBot-VA 2.0發布,開啟機器人「物理腦」時代
7月10日,螞蟻靈波正式發布了業界首個具身原生世界動作模型——LingBot-VA 2.0。這不僅是一款新產品的問世,更標誌著機器人基礎模型的發展路線迎來了關鍵轉折:機器人的「大腦」不再依賴於從數字世界模型「嫁接」而來的二手能力,而是開始從物理世界交互的原始需求出發,進行原生設計。這項突破被視為具身智能領域一次根本性的路線選擇。一直以來,如何讓世界模型與具身智能有效融合,是業界關注的焦點。當前主流做法大多依託於在數字內容創作領域表現優異的視頻生成模型,再透過微調(Fine-tuning)的方式,試圖將其適配到機器人控制任務中。
然而,內容創作與機器人控制有著本質上的差異:前者追求畫質與創意,後者則更看重執行效率與因果預測的合理性。這種出發點的不同,導致了「強行微調」會帶來嚴重的副作用,如知識遺忘、泛化能力下降等問題。螞蟻靈波選擇了一條更艱難、但更具長遠價值的路徑:直面問題,從零開始建構一個原生於物理世界的模型。LingBot-VA 2.0基於自迴歸架構進行預訓練,透過四大核心設計,構建了一個能真正理解並執行物理世界任務的「原生基模」。這不是一次簡單的升級,而是一次架構上的徹底革新。首先,模型引入了全新的「語義視覺-動作分詞器」。這個視覺編碼器在壓縮視覺資訊的同時,強制性地將語義理解與動作資訊進行對齊。
這讓模型從訓練之初就能更好地將「理解指令」轉化為「完成動作」,顯著提升了指令跟隨的準確性與動作的精準度。其次,LingBot-VA 2.0採用了嚴格的「因果預訓練範式」。從訓練的第一刻起,模型就使用自迴歸架構,確保其視覺預測和動作生成都嚴格遵循時間的單向因果關係。這意味著機器人不再是簡單地對當前畫面做出反應,而是能理解「一個動作會引發怎樣的環境變化」,並據此規劃下一步行動。第三,為了解決模型容量與推理效率之間的矛盾,LingBot-VA 2.0引入了MoE(混合專家)架構。
這種設計能夠在不犧牲推理速度的前提下,有效擴大模型的參數容量,從而在性能與效率之間取得了最佳平衡,讓模型能夠處理更複雜、更細膩的任務。最後,透過增強的「異步推理機制」,模型實現了真正的實時閉環控制。機器人在執行動作的同時,能夠同步預測未來的環境狀態,並利用最新傳感器回傳的真實觀測數據,不斷校正自己的下一步決策。這項設計直接解決了行業普遍面臨的「具身世界模型執行效率低下」的痛點,最終交出了「單卡150Hz實時推理效率」的亮眼成績。LingBot-VA 2.0的發布,是螞蟻靈波本週一系列技術成果的集大成者。
在此之前,螞蟻靈波已經接連發布了面向空間感知的LingBot-Vision和LingBot-Depth 2.0、面向「一腦多機」泛化控制的動作模型LingBot-VLA 2.0、面向實時交互的世界模型LingBot-World 2.0,以及麵向更高推理效率的視頻生成基模LingBot-Video。這一系列的發布,清晰展示了螞蟻靈波在具身智能領域的戰略佈局:從「看」得更清楚(空間感知),到「想」得更明白(因果預測),再到「幹」得更利索(高效執行),每一步都在為機器人走向真實場景夯實基礎。而LingBot-VA 2.0正是將這些細分能力融會貫通的最後一塊拼圖,正式開啟了具身智能的「原生」新階段。
螞蟻靈波CEO朱興表示,公司將持續探索具身智能的新上限,同時也將加速建構開放的技術生態和場景生態,助力機器人加速從實驗室走向產業場景。螞蟻靈波計劃將於7月17日至20日在2026世界人工智能大會(WAIC)期間,全面展示全棧「大腦2.0」的落地能力,屆時觀眾可親臨上海世博展覽館現場體驗。此次LingBot-VA 2.0的發布,無疑為略顯浮躁的具身智能賽道注入了一針強心劑。它證明了,真正的智能化並非來自於對已有模型的簡單改造,而是需要從根源上理解並服務於物理世界的複雜規律。當機器人開始擁有「物理原生」的智慧,我們離科幻電影中那些能無縫融入人類生活的通用機器人,或許又近了一大步。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。