索辰科技加碼世界模型,與戰略投資企業美夢空間聯合發佈具身模型與物理測評標準

“世界模型”開始成為具身智能跨越商業化“奇點”的新敘事。當下,具身智能的商業化路線正撞上一堵牆。北大與BeingBeyond聯合發佈的BeTTER基準(ECCV 2026)戳破了這層窗戶紙:最先進的VLA模型在標準靜態測試中表現尚可,一旦引入空間佈局偏移或時序外推等干預,成功率斷崖式下跌。另一項斯坦福大學研究則直接鎖定了病因:在接觸豐富任務中,VLA存在“精度失效”與“力失效”兩個相互獨立的失效模式。現有測評關注與被忽略的物理變量 換句話說,VLA驅動下的機器人只知道“看到杯子就該抓”,但不知道“杯壁有多薄、摩擦力夠不夠、注水後重心會不會偏”。它本質上是個統計學模仿者,不是物理世界的參與者。
當VLA的侷限逐漸暴露,“世界模型”開始成為具身智能跨越商業化“奇點”的新敘事。9月26日,美夢空間CEO李明昊在第五屆全球數字貿易博覽會首發首秀主舞臺上,首次公開並正式發佈Physical-WAM、RoboTwin-Phys兩項重要成果 第五屆全球數字貿易博覽會上,杭州美夢空間科技有限公司(Memo)給具身智能補上了這堂“物理課”。教具是兩份:全球首個具備物理感知能力的Physical-WAM物理-世界動作模型,以及業內首個RoboTwin-Phys物理漂移評測基準——一個負責讓機器人“懂物理”,具備人類式的預判能力,一個驗證它是否真的“懂了”。
美夢空間專注於世界模型的研發與應用,由北京大學信息技術高等研究院高文院士領銜的AVS先進視覺系統研究中心孵化,核心團隊在具身智能、視頻編解碼、空間計算、人工智能領域積累了深厚的研究經驗,兼具學術深度與工程落地能力。2026年8月,物理AI頭部企業索辰科技(688507.SH)完成對美夢空間獨家種子輪戰略投資,雙方在數據、算力、物理AI等技術層面深度協同,共同推進世界模型研發與產業應用落地。而Physical-WAM和RoboTwin-Phys正是雙方攜手給業界帶來的一張新答卷。Physical-WAM:讓具身智能“理解”物理 具身智能向前推進時,首先撞上的是訓練信號的源頭。
計算機視覺與大語言模型領域獲取訓練樣本的邊際成本較低,網頁文檔、圖片視頻可以通過互聯網獲取標註。機器人與文本、圖像、視頻相比,訓練數據與樣本稀少 機器人物理交互數據的生產邏輯則完全不同。有效的物理交互樣本誕生於真實或高保真仿真的接觸過程:抓取、推撥、按壓,每一次有效交互都伴隨真機運動、接觸反饋和物體狀態改變。這類數據採集週期長,硬件損耗成本高,不同機器人本體之間還存在明顯的數據遷移壁壘。由此形成客觀現實,機器人可用的真實物理交互樣本僅維持在百萬量級,和文本圖像領域數十億級別的數據體量相比,存在數萬級別的落差。
Physical-WAM概念圖 面對數據供給的現實約束,美夢空間提出Physical-WAM作為針對性解法。整套架構的核心設計,是在感知信號輸入和動作輸出鏈路之間,插入一層“物理Token”表徵。傳統世界模型的中間表徵是像素或隱空間向量。它雖然可以推演物理世界的演化,但無法感知物理本身——知道“下一幀畫面會變成什麼樣”,卻不知道“為什麼會變成這樣”。Physical-WAM作為業內首個具備物理感知能力的WAM基模,基於可觀測數據與深層物理數據訓練,能在真實任務中實時覺察物理變化,並預判動作後果、實時修正行為。
Physical-WAM三大模塊架構圖 Physical-WAM由PhysLens、PhysDream、PhysAct三個模塊構成,形成“感知→預測→生成→修正”的反饋鏈條。PhysLens是“物理翻譯器”,從多模態感知信號中提取摩擦、重量、重心、接觸狀態等不可直接觀測的物理信息,輸出統一的物理Token表徵。對照來看,現有VLA學到的是反應式的觀測到動作映射,模型知道何時該伸爪、旋轉或鬆手,卻不顯式推斷物體有多重、表面是否溼滑。PhysLens要補的正是這層顯式估計。
PhysDream是“物理預言家”,結合當前物理表徵、環境狀態和候選動作推演未來物理狀態,預測打滑、脫手等風險並給出不確定性評估。PhysAct則負責物理條件化動作生成,把物理屬性與未來狀態預測引入動作生成,當環境發生物理漂移時自動調整執行策略。Physical-WAM三大模塊架構解析 舉一個直觀的例子:機器人抓握紙杯時,PhysLens識別出紙杯材質的低剛度特性,PhysDream預測注水後負載增加可能導致杯壁形變或滑脫,PhysAct據此調整抓握力度和接觸位置,在注水過程中持續修正策略,直至完成操作。這不再是簡單的動作復現,而是像人類一樣,憑藉“物理直覺”隨機應變。
RoboTwin-Phys:把物理擾動變成可控變量 技術路線的競爭最終需要評測來裁決。美夢空間測試機器人的物理理解力 現有的具身智能評測基準存在一個結構性盲區:它們測量的是“任務完成度”,而非“物理適應度”。一個模型可以在固定摩擦係數、固定物體質量的標準測試集上刷出高分,卻對物理參數的擾動毫無魯棒性。比如,同等推力下,高摩擦的罐子原地傾倒,低摩擦的罐子直接滑飛;夾持擀麵杖同一位置,重心偏移就會引發杆體擺動。這些現實世界中大量司空見慣的“物理漂移”,卻很難在傳統測評中得到有效驗證。一項能力無法被度量,模型的迭代優化就失去了錨點。
模型之外,美夢空間的第二個答案是重新建立一把評測標尺——RoboTwin-Phys物理漂移測評基準。這是業內首個以物理因素擾動為核心評測對象的機器人操作基準,能夠把現實中抽象的物理參數,轉化為可控、可標記、可復現的變量。RoboTwin-Phys概念圖 這套評測基準遵循三層遞進邏輯:物理屬性推斷準不準、物理擾動下任務還成不成、性能差距的上界在哪裡。它在RoboTwin的基礎上,新增了13類真實世界常見的物理擾動因素,從物體屬性、接觸屬性、阻尼、任務環境到相機配置五大維度,支持單因素擾動到多因素組合擾動測評。其工程價值主要體現在三點。
第一,提供物理真值——物理值、接觸力日誌、物體運動學數據和失敗時間線,使評測不只回答“成沒成功”,還能追問“模型是否估計對了、何時開始失敗”。第二,固定種子配對評估,讓不同模型面對相同擾動實例,減少運氣成分。第三,按推斷準確性、擾動下任務成功率、性能上界逐層遞進,區分“物理狀態識別錯了”和“識別對了但動作策略沒跟上”。這等於在“感知—預測—生成”鏈條每一環各設了一個考位。RoboTwin-Phys發佈即開源,項目代碼、數據集與排行榜全部開放,支持第三方驗證復現,為行業立起一把衡量“物理AI”的標準化標尺。
物理感知的下一步:邊界探索與縱深推進 “世界模型”本身仍是一個尚未收斂的概念,學術界至今沒有統一的技術定義。計算機視覺研究者把它理解為視頻生成,機器人領域把它當成狀態預測器,強化學習圈子則從MBRL出發將其視為環境代理。畢馬威2026年7月發佈的《跨越奇點:世界模型如何重塑具身智能產業與商業新範式》報告,提供了一個更清晰的座標系:表徵式世界模型回答“世界是什麼”,生成式世界模型回答“世界會變成什麼”,交互式世界模型回答“改變世界會發生什麼”,而理解-生成-預測一體化世界模型則試圖回答“如何理解、預測並自主改變世界”。
可以看到,美夢空間Physical-WAM為物理AI探索了一條可行的技術路徑,並仍在持續拓展能力邊界。第一,物理Token的粒度邊界在哪?摩擦、質量、重心是三個高度抽象的參數,但真實接觸中還存在表面粗糙度的各向異性、材料的非線性彈性行為、接觸面積的動態變化。當前表徵能力的上限,需要更系統的消融研究來回答。第二,跨本體的物理遷移效率如何?同一個物體,二指夾爪和靈巧手抓取所需的動作策略不同。物理參數到動作的映射,高度依賴末端執行器的形態與動力學特性。多本體適配的一致性和效率,是檢驗架構泛化能力的關鍵指標。第三,仿真物理的保真度天花板在哪?
PhysDream的推演精度受限於仿真引擎的物理保真度和真實傳感器的噪聲水平。當真實世界存在仿真無法建模的效應,比如織物的非線性大變形、顆粒材料的流動等,那麼這套閉環的魯棒性邊界在哪裡?9月26日,美夢空間CEO李明昊在第五屆全球數字貿易博覽會首發首秀主舞臺上,介紹Physical-WAM如何讓機器人讀懂物理世界 圍繞這些方向,美夢空間的下一步路線將圍繞“視覺先行,力觸聲遞進”持續迭代多模態物理表徵模型,擴充物理交互數據集,優化模型推理延遲與多本體適配能力,並聯合產業鏈上下游補齊物理數據、世界模型、評測標準三塊拼圖。“只有讓機器人真正讀懂物理世界,具身智能才能大規模從實驗室走向真實產業場景。
”美夢空間CEO李明昊表示,將以開源開放的態度,推動行業加速走向具身智能的“GPT時刻”。
Related
相關文章
Liquid AI 推出 LFM2.5-VL-3B-DSpark:推測解碼加速視覺語言模型,最高提升 3.13 倍
Liquid AI 發布 LFM2.5-VL-3B-DSpark,這是針對其 LFM2.5-VL-3B 視覺語言模型所設計的實驗性推測解碼草稿模型。該草稿模型約增加 2.8 億個參數,在不改變模型輸出的前提下加快解碼速度。官方數據顯示,在 Apple 晶片上解碼速度最高提升 3.13 倍,在 NVIDIA H100 上則最高提升 2.66 倍。此模型已可部署,權重以 Safetensors 與 GGUF 格式發布於 Hugging Face,並支援 SGLang、MLX-VLM 與 llama.cpp。Liquid AI 團隊將其標註為實驗性版本,採用 LFM 開放授權 v1.0,僅允許年營收低於 1000 萬美元的公司免費商用。推測解碼的原理是:標準模型每次前向傳播僅生成一個 token,而此技術加入一個小型草擬模型,以加速整個生成流程。

德國柏林警方藉助人工智能監控攝像頭打擊犯罪,自動識別暴力和破壞行為
作者:浩渺 責編:浩渺 評論: 9 月 25 日消息,據央視新聞報道,德國柏林警方 24 日在一處犯罪高發區域啟動一項計劃,將藉助人工智能監控攝像頭打擊犯罪。據悉,柏林警方將在這項計劃啟動的前四周內,在科特布斯門地區安裝並調試好人工智能監控攝像頭,隨後正式投入使用。

別人忙著卷Code,Kimi抽身反打瀏覽器插件:網頁操作一秒變Skill
Kimi近日推出瀏覽器擴展,由先前的WebBridge升級而來,新增側邊欄直接對話及將網頁操作錄製成Skill以便複用的功能。該擴展可操控真實瀏覽器完成重複性任務,但官方提醒複雜頁面可能導致操作失敗。此舉與Kimi Code Desktop搭配,顯示其強化Agent在桌面端與瀏覽器之間協作的產品策略。

影石正佈局 AI 眼鏡,或採用“分體電池”設計
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>智能穿戴 影石正佈局 AI 眼鏡,或採用“分體電池”設計 2026/9/25 12:26:17 來源:新浪科技 作者:- 責編:沁滄 評論: 9 月 25 日中午消息,有接近影石創新人士透露,當前影石創新正在佈局 AI 眼鏡賽道,並在進行相關研發,未來或將推出自己的 AI 眼鏡產品。

DeepSeek Harness 官方桌面版預覽偷跑
作者:故淵 責編:故淵 評論: 感謝網友 Domado、陣雨、章魚小丸子、科文雨、億百盧閃蔥、Juliandu、Vincent89、南琴梨 的線索投遞!9 月 25 日消息,DeepSeek Harness 悄然上線官方桌面版,目前還是開發者預覽版,版本號為 V0.

【IT之家開箱】小米 Watch S5 41mm 智能手錶圖賞:瑩白陶瓷表圈 + 24 道精雕錶冠,主打精緻佩戴
作者:馬卡 責編:馬卡 評論: 9 月 25 日消息,在 9 月 23 日晚間舉行的小米秋季新品發佈會上,小米 Watch S5 41mm 智能手錶正式發佈,首發搭載表端澎湃 OS 4,並升級了表端微信 App,售價 1299 元起。小米 Watch S5 41mm 提供氟橡膠錶帶款和真皮錶帶款,售價分別為 1299 元和 1499 元。