WAIC 觀察:通用具身智能要在有生之年實現,急需「物理 AI 基建狂魔」

2026年7月20日 14:48

重點摘要

今天的物理 AI,不只比“武功”,更得拼“內力”。 作者丨齊鋮湧 董子博 編輯丨馬曉寧 WAIC 2026 到了最後一天,逛了無數個具身展臺,心裡不禁有了不少感慨。柔性抓取可以抓異形物體了,長程任務也更復雜了——技術飛快進步,好像通用具身離我們已經不遠。

站內 AI 整理稿

在今年的世界人工智能大會(WAIC 2026)尾聲,許多參展者都注意到一個現象:具身智能的技術展示愈來愈炫目,柔性抓取能應付異形物體,長程任務也變得更複雜,彷彿通用型機器人距離我們只剩一步之遙。然而,越是深入觀察,就越會發現一個被熱鬧表象掩蓋的關鍵缺口——模型被吹得天花亂墜,但支撐這些模型的底層數據基礎設施,卻鮮少有人認真討論。事實上,數據短缺已成為具身智能行業「房間裡的大象」,從業者只要深談幾句,就會陷入共同的焦慮:我們實在太缺數據了。要建構具身智能的數據基礎設施,必須同時回答兩個極為硬核的問題:第一,你能取得多少數據?第二,這些異構、非結構化的數據,能不能被有效地共同學習?

在今年的 WAIC 現場,一家名為跨維智能(Cross-Dimensional Intelligence)的公司,正是針對這兩個問題提出了自己的答案。用一句話來概括,跨維想做的,是「物理 AI 基建狂魔」——他們要為通用具身智能鋪設一條可規模化的數據高速公路。要讓具身智慧具備通用泛化能力,首先必須實現智能湧現,讓機器人像人類一樣擁有「物理直覺」,能夠理解複雜多變的真實世界;其次要能在不確定的環境中隨機應變、舉一反三;最後更必須具備自主糾錯能力,減少人工介入,提升整體韌性。而要達成這些目標,海量且可對齊的數據,就成了物理 AI 基建中一塊不可或缺的拼圖。

都知道數據量重要,但要把數據量「堆」出來,並非易事。靠真實環境裡一台台機器人慢慢採集,不僅成本高得嚇人,要覆蓋所有長尾場景更是耗費無數時間。因此,虛擬世界的仿真系統成了關鍵解法。在 WAIC 上,跨維展示了自研的仿真引擎 DexVerse,這款引擎是目前全球唯一一款支援同場景下多物理場耦合的具身智能仿真引擎。在 DexVerse 中,剛體、柔體、布料、流體甚至切割動作可以同時發生並相互影響。例如機器人切麵包時,系統能即時計算出物體拓撲結構的改變與全新的切面;機器人疊衣服時,引擎能精準模擬手、衣物和桌面之間持續的接觸與形變,而不是粗暴的視覺穿模。

許多人知道 NVIDIA 的 Isaac Sim 平台很強,但 DexVerse 也有與之一戰的實力。Isaac Sim 只能同時耦合兩種材質,DexVerse 則可同時耦合剛體、軟體、布料、流體四種材質,能力範圍更廣。而且,DexVerse 能實現 Isaac Sim 目前做不到的高保真軟體動態切割,徹底告別死板的預設軌跡;在處理複雜的剛體與布料耦合時,更做到了真正的物理級無穿透,自然堆疊與受力形變的精準度明顯領先 NVIDIA。Isaac Sim 能力不弱,而今天的 DexVerse 或許有潛力成為前者在仿真領域一個勢均力敵的對手,或者一個好用的國產替代方案。

有了能把複雜物理世界即時「算」出來的 DexVerse,跨維的下一步就是批量化地生產具身可用的高品質數據,把機器人的訓練從手工作坊變成數據的「生產線」。在虛擬世界中,無數訓練可以同時進行,迭代更快、成本更低。使用 DexVerse 的生成式仿真,不僅大幅降低真機數據採集的消耗,更讓客戶能快速定義新任務、新物體、新場景,並即時在仿真系統中驗證。如果能直接讓機器人訓練的數據像圖片和影片一樣被自動化批量生成,那麼具身智能距離通用就又前進了一大步。有了海量數據,就能直接餵給大模型嗎?

近期行業內一系列研究,包括阿里巴巴的 Qwen-RobotManip 等,不約而同指向一個殘酷事實:將異構的機器人數據簡單混合,往往會引發負遷移——也就是「幫倒忙」。不同機器人、不同相機視角、不同座標系的數據,在模型眼中完全是雞同鴨講。因此,行業正在形成一個新共識:「對齊是規模化的前提」。今年六月,跨維率先提出 Dexterity-BEV 統一表徵技術,系統性地將 BEV 方法論推進到具身智能數據基建層;同月,又拿下 WorldArena 世界模型榜單 Track 2 賽道全球第一。到了今年的 WAIC 上,跨維更進一步,直接端出百萬級時空動作對齊數據集 Aligned DexWorld。

Aligned DexWorld 包含超過 200 萬條高品質異構數據樣本,來源五花八門:有來自不同本體的真機數據(人形機器人與機械臂)、有仿真數據,還有第一人稱的人手演示數據。它的核心價值在於「深度物理級對齊」,讓人類數據與機器人數據真正「說上同一種物理語言」。具體來說,跨維對數據進行了三個對齊:空間對齊,統一多相機、多設備的三維座標系,消除觀測偏差;動作對齊,摒棄綁定特定硬體的表徵方式,轉化為通用物理表徵,實現跨機器人、跨設備的數據可遷移與聯合訓練;時間對齊,規整硬體頻率、人工操作帶來的時序差異。面對 200 萬條龐大的異構數據,如果全靠人工處理,成本無疑是天價。

跨維展現了「基建狂魔」的工程智慧:在處理精度上,他們搭建了「人工校準+幾何求解+模型輔助+人工核驗」的標準化閉環,讓每一條數據的對齊邏輯均可追溯、可復現;在數據標註上,則跑通了全自動標註流程,大幅削減人力成本,高效產出標準化的高質量子任務數據,能夠顯著提升具身模型的泛化能力。Aligned DexWorld 為整個機器人行業搭建起了一個低成本、可複用的數據生產底座。有了強大的數據生產和對齊能力,跨維還需要實際把數據和訓練基礎設施用起來,驗證這套體系的有效性。

除了可以獨立服務其他機器人企業、研究機構和模型開發者,跨維的旗艦世界模型 DexWorldModel 就成了「數據生產-模型訓練-真實場景落地」閉環的最後一塊拼圖。人類能夠與物理世界互動,需要一種「物理直覺」,能做到長程、抗干擾、精確的操作;機器人要越來越接近人類,也必須具備這種直覺。在 WAIC 現場,跨維展台被圍得水洩不通的是一個「機器人商超掃碼分揀」Demo。這是展廳裡唯一還原零售掃碼場景的展台,機器人展現的能力相當全面:不僅要從一筐隨機堆放的商品中抓起硬度、外形不一的瓶子,還要掃到瓶身上的條碼,再把瓶子放到指定位置。

面對非標的、甚至訓練集裡從未見過的飲料瓶,機器人自主湧現出側向掏取、扶正後抓取等策略;當抓取滑脫或掃碼失敗時,無需人工復位,它能即時感知錯誤並自主調整策略重新執行。真正的挑戰不在於 Pick & Place 或掃碼本身,而是「找到條碼」——在真實場景中,條碼在瓶身上的位置和朝向都不標準,可能背對相機、被手遮擋。機器人必須一邊調整抓握姿態,一邊重新規劃動作,一邊觀察尋找條碼,這種「手、眼、腦」一體的能力,考驗的是具身大腦在面對非標問題時的湧現式自主解題能力。跨維還展示了另一個模擬電子製造產線的「手機裝盒」Demo。

面對需要精準識別、精密操作、抵抗環境干擾和操作失誤的工作,不少廠商選擇遙操方案,但跨維的 Demo 是透過世界模型 DexWorldModel 實現,可直接異地部署。透過仿真合成數據和真機數據結合訓練,DexWorldModel 驅動的機器人不僅能即時自動識別物料的位置和姿態,還能自主識別漏抓、物料偏移等異常情況,不再只執行預設動作,可以重新規劃路徑完成任務。這種「智能湧現、隨機發揮與錯誤恢復」的能力,正是跨維「基模預訓練+場景 Finetuning+世界模型」的實戰檢驗。

世界模型在動作發生前進行「物理預演」評估抓取成功率,跨視角補全 3D 場景,預測下一個狀態,讓機器人真正理解「瓶子」這個物理概念,從而在充滿混亂與不確定的真實世界中游刃有餘。跨維的技術已在智慧製造、文旅服務等領域落地 50 多個真實場景,部署超過 1500 個具身模型,並實現了可觀的商業轉化。當許多公司忙著造機器人本體、卷大模型,或拿一堆真機數據死磕某個單一場景時,跨維選擇了一條不同的路:他們要構建的是一個體系,涵蓋從物理引擎、生成式仿真、世界模型到工業部署的全流程板塊。在他們看來,第一性的問題永遠是用更低的成本,讓機器人完成學習、試錯、規模落地的閉環。

技術最終要回歸商業本質,而只有地基足夠牢靠,其上的高樓才能在有朝一日讓頭頂的星星觸手可及。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

剛剛

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

剛剛

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

1 分鐘前

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

25 分鐘前

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

53 分鐘前

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

57 分鐘前