本體廠向上,大模型廠向下,螞蟻靈波VLA2.0搶到機器人“大腦入口”

重點摘要
機器人產業出現本體製造商向上拓展核心技術、大模型公司向下滲透應用場景的雙向競爭態勢。螞蟻集團旗下靈波團隊推出的VLA2.0端到端視覺語言行動模型,被視為搶占機器人大腦入口的關鍵產品,可能改變產業價值鏈。該模型能直接從視覺與語言指令生成行動序列,降低開發門檻,但面臨可解釋性與安全性等挑戰。
近期機器人產業出現明顯的發展分水嶺,傳統本體製造商積極向上游核心技術延伸,而大模型公司則向下游應用場景滲透,雙方在機器人「大腦」領域展開激烈競爭。在這樣的態勢下,螞蟻集團旗下靈波團隊推出的VLA2.0模型,被業界視為搶占機器人大腦入口的關鍵產品,為整個產業鏈注入全新變數。過去數年,機器人產業的發展路徑相對明確:本體製造商專注於機械結構、動力系統與生產工藝,軟體與決策層則依賴第三方供應商或學術研究成果。然而隨著人工智慧技術的快速迭代,尤其是大語言模型與多模態模型的突破,機器人的核心競爭力逐漸從硬體性能轉向感知、理解與自主決策的能力。
這使得本體廠商開始意識到,若要維持競爭優勢,必須向上掌握智慧控制層的核心技術,而不是僅停留在硬體組裝層級。與此同時,大模型公司也在尋找落地場景。過去幾年間,大模型在對話、生成、分析等雲端應用中展現驚人潛力,但要實現真正的商業價值,必須從虛擬走向實體。機器人成為最直接的載體之一。於是,大模型廠商開始向下滲透,試圖將自身在語言與視覺理解上的能力,延伸至機器人的行動控制,形成「從雲端到實體」的閉環。這種雙向擠壓,使得機器人智控層的入口爭奪戰日趨白熱化。在這個關鍵節點,螞蟻集團旗下靈波團隊推出的VLA2.0模型,引起業界高度關注。VLA2.0的全稱為Vision-Language-Action 2.
0,是一種端到端的視覺語言行動模型。它的問世,標誌著機器人領域在模型層級上的進一步革新。不同於傳統的分層架構——先由視覺模組感知環境,再由語言模組理解指令,最後由規劃與控制模組生成動作——VLA2.0直接從視覺與語言指令中生成行動序列,大幅簡化了流程。這種端到端的設計,不僅提升了機器人對複雜環境的反應速度,也降低了開發門檻。過去,開發者需要針對不同模組分別訓練與調參,並解決模組間的介面問題;現在,一個統一的模型就能完成從感知到行動的全部過程。這意味著,即使不具備深厚的機器人控制背景,團隊也能藉助VLA2.0快速建構具備高度自主能力的機器人應用。這對中小型開發者與新創公司來說,無疑是極大的助力。
從技術架構來看,VLA2.0的優勢在於其對多模態資訊的深度融合。模型不僅能理解視覺場景中的物體、空間關係與動態變化,還能解讀自然語言指令中的意圖、約束與偏好,並將這些資訊無縫轉化為機器人可執行的動作序列。例如,當使用者對機器人說「將桌上的藍色杯子拿到廚房水槽」,VLA2.0能同時解析杯子的位置、顏色、桌子與水槽的相對位置,並規劃出一條避開障礙物的搬運路徑,最終生成連續的控制信號。這樣的表現,讓VLA2.0在家庭服務、物流揀選、工廠巡檢等場景中具有廣闊應用前景。更重要的是,它讓大模型廠商從雲端走向實體,直接與本體廠商的向上策略形成對撞。本體廠商原本希望透過自研智控層來掌握話語權,但像VLA2.
0這樣的通用模型一旦成熟,可能讓機器人的「大腦」標準化,硬體反而成為可替換的周邊。這將徹底改變機器人產業的價值鏈分配。事實上,這場入口爭奪戰早已不是單一企業的博弈。國內外多家科技巨頭與新創公司都在積極布局機器人基礎模型。蘋果、Google、亞馬遜、特斯拉等企業均有相關研究或產品,而國內的華為、騰訊、百度等也持續投入。螞蟻集團雖然以金融科技與支付業務聞名,但其在AI與機器人領域的布局也非一日之功。靈波團隊作為螞蟻旗下的技術團隊,過去已在多模態感知與決策模型上累積不少經驗,VLA2.0正是這些技術成果的集中體現。值得注意的是,VLA2.0並非停留在實驗室的論文模型,而是已具備實際部署能力的產品。
據了解,靈波團隊已與多家機器人本體廠商展開合作,測試在真實場景中的表現。這意味著,這款模型有機會在短期內進入量產階段,成為產業鏈中的關鍵組件。若順利推廣,它將不僅是螞蟻集團在機器人領域的敲門磚,更可能成為整個行業的基礎設施之一。然而,挑戰同樣存在。端到端模型雖然簡化了開發流程,但其可解釋性與安全性仍是難題。當模型直接生成行動序列時,一旦出現錯誤決策,很難追溯問題根源。此外,機器人應用涉及人身安全與財產保障,對模型的可靠度要求極高。VLA2.0能否通過嚴格的工業與服務標準,還有待時間驗證。另一個挑戰是生態的建立:即便模型本身表現優異,若缺乏優質的感測器、執行器與應用場景,也難以發揮全部潛力。
從更大的視角來看,本體廠與大模型廠的雙向擠壓,其實是產業成熟過程中的自然現象。過去PC時代、手機時代都經歷過類似階段:硬體廠商與軟體廠商互相搶佔核心層級,最終形成穩定的分工與生態。機器人產業目前正處於這個關鍵轉折點,誰能掌握「大腦」入口,誰就能定義未來十年的競爭規則。螞蟻靈波VLA2.0的出現,無疑為這場競賽增添了新的變數。後續各方如何透過技術迭代與生態合作搶占先機,將是業界密切關注的焦點。可以預見,未來機器人將不再是單純的執行工具,而是具備理解與決策能力的智慧夥伴。在這條路上,無論是本體廠還是大模型廠,都必須在技術、場景與商業模式上找到最佳的平衡點。而靈波VLA2.
0,或許正是拉開新時代序幕的那個關鍵產品。
Related
相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”
眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?
宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態
首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了
三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。
宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品
AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。
IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118
進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。