浙江人形機器人熊蓉:物理世界不可約,人形機器人落地不可急 | WRC 2026

2026年8月28日 06:52
站內 AI 整理稿

從生產線到生產力,難在穩定,更難在泛化。作者丨吳思夢 編輯丨岑 峰 人形機器人開始進工廠之後,也在逐漸邁過從“展示能力”到“承擔生產”的邊際。8月20日,2026世界機器人大會在北京開幕。在“應用牽引”主題論壇上,浙江大學求是特聘教授、浙江人形機器人創新中心首席科學家兼總經理熊蓉正面談到了這道門檻。她和團隊用兩年半時間,把人形機器人帶進了3C電子、服裝、物流、汽車裝配等真實工業場景,部分應用已經開始規模化落地。但訂單和指標並不是故事的終點。

熊蓉真正想拆開的,是機器人進入物理世界之後暴露出來的那些“Demo視頻之外”的問題:視覺看不全交互的本質,數據堆砌替代不了舉一反三,而物理世界本身又具有不可約性。所以,人形機器人距離真正成為生產力,差的也並不是再多一個Demo,更棘手的是如何讓它在不確定的世界裡,既做得準,又能舉一反三。以下為熊蓉在2026世界機器人大會主論壇的演講精編稿。·AI科技評論基於現場演講錄音轉寫稿,在不改變原意的基礎上進行了編輯整理。01多場景落地:三道難關大家下午好。我是來自浙江人形機器人創新中心的熊蓉。我們在兩年半的時間裡,主要是面向人形機器人能否在多場景中應用、如何做到這一點,開展了一系列工作。

經過兩年半的努力,也展示了我們目前不管是在零售、商服,還是在工業的各個場景裡面,驗證了這套技術體系的有效性,部分在工廠裡也實現了真正的落地應用。今天在這裡給大家介紹一下我們在基座和生態建設上開展的工作。我的報告會分為四個方面展開。首先來講一下多場景應用所面臨的難點。隨著社會的發展,越來越多的行業場景對機器人提出了應用需求。但與目前很多場景中機器人規模化應用相比,這些場景面臨著這樣的特點。首先,整個市場需求很大,但就每一個場景來講,應用量可能並不是那麼大規模的——所以它是高度碎片化的。而且這些場景差異很大,裡面的物品各種各樣,並且隨著生產生活的發展,也在快速迭代。

第二,很難再用“一個機器人幹一個活”的思路。往往是由人完成一系列工作——包括取料、對準、使用工具、最後放到指定地點。如果用傳統方法,可能需要多個機器人,佔用更大空間,改造成本較高。所以如何讓一個機器人完成長程的多樣化任務,是第二個難點。第三,任務的執行是柔性變化的。生產製造正向柔性化、個性化發展,需要能夠快速換線,甚至頻繁換線。生活中各種情況會突發,需求在不斷調整,環境又是動態變化的,具有很強的非結構化特徵。所以很難用傳統方法,由專業人員提供解決方案,做場景固定、定製開發等。原來的方法很難在這些場景中實現。所以我們選擇具身智能這條途徑,來解決場景多樣化、柔性化的需求。

我們希望通過通用的行為智能,加上人形機器人作為通用載體,更好地適應人類為自己打造的生活和工作環境。當二者能力疊加,市場非常廣闊,其規模與智能水平密切相關。現在已經有很多在產線上和生活中應用的機器人,基本具備L2級智能,部分具備L3級,大多數處於二三級之間。我們要做的是達到L4級——能夠適配多個場景,在場景中完成非結構化、柔性化的任務。當具備這個能力後,才能通過數據疊加,推動大模型向全面智能進軍。這兩年具身智能技術快速發展。人形機器人整機方面,中國已有近200家整機企業。具身智能大小腦模型,各家都開展了豐富的研究。

總體來看,2024年我們應用模仿學習加強化學習,使人形機器人具備了靈活的運動能力;2025年做了充分展示,並結合語言視覺大模型提升機器人的自然交互能力。到今天,沿著VLA、VLN等端到端行為策略學習,到結合世界模型構建世界動作模型,可以看到作業智能大大提升,大家也在多個場景中進行了驗證。在這次世界機器人大會上,相信大家也有深刻感受。但這些技術演示如何落地?還要解決哪些問題?如果機器人真正進場,還有一些問題需要解決。02從演示到產線:四個Gap首先,它能否在工廠環境中長期可靠地運行?進了工廠以後,會有很多突發情況、異常工況。

這種情況發生時,模型會失敗,導致整個作業失敗,就需要採集數據、補充數據、進行訓練。第二,泛化能力實際上還不足。現在往往是一試一訓——當物體變化、場景變化、光照變化,又要重新採集數據、進行學習訓練。第三,目前操作基本在釐米級到毫米級,但工業上往往要達到亞毫米級。而這部分操作精度,視覺已經不可見,需要用力觸來解決——這方面我們還有欠缺。最後,大家都覺得機器人執行效率偏低。因為感知、推理、決策到控制形成的迴路,與原來閉著眼睛重複幹相比,多了很多環節,還要保證推理執行的準確性,都使其更加耗時。

這些使得它與真實落地應用之間,除了要解決泛化性,還要保證可靠性、高效率、低成本,以及工業場景中的高精準——之間還存在一個gap。我們會發現,現在這些方法並沒有真正解決傳統模型的問題。泛化性不夠,希望通過數據多樣性來學習——並沒有達到這一點,甚至失去了原來機器人所具備的精準、可靠、高效的執行能力。這是我們所面臨的問題。歸根到底,這是因為物理世界具有不可約性。為什麼專家模型不行?因為專家模型無法用總結學習出的規則來描述物理世界的複雜性。同樣,現在的數據和模型能力,也無法涵蓋物理世界的豐富性和複雜性。03技術破局:四個層面技術方面,我認為有幾個點需要注意。第一是表徵層。

具身智能的核心在於與環境的交互,這種交互不僅體現在視覺上,而現在大量模型學習都基於視覺表徵。但交互一定涉及力觸,且這種力觸與形狀、重量、材質、行為強相關。我們很難用視覺表徵出物理交互的本質。在仿真中學習,也面臨Sim to Real的gap問題。所以我們在表徵層提出了將視覺、力觸融合的通用表徵方法,可以支撐在仿真中學習訓練,再遷移到真實環境。第二是感知層。現在很多做法是將語言、視覺和行為做對齊,這極大依賴於語言視覺大模型。但這些大模型並不完善,缺乏空間理解能力和物理常識。在開放混雜的場景下,感知精準性會顯著下降。當看不清、識不準時,會直接影響行為生成。

所以不能僅僅依靠行為與感知的對齊來解決問題,感知能力依然需要增強。我們在VLM基礎上增強了空間理解能力,並構建了對環境中各種物體在非接觸和接觸狀態下的預測模型,用預測模型推動行為學習。由空間理解能力、預測模型和實時感知模型形成世界模型,讓世界模型與具身模型協同進化。第三是模型層。目前高度依賴數據堆砌和驅動,但缺少抽象思維能力。如果學會了怎麼拿一雙鞋子,鞋子千變萬化,人不需要學習很多雙鞋子怎麼拿,不需要採集那麼多圖像。所以要考慮如何舉一反三。否則,當各種任務、各種數據堆砌在一起時,多維度、高維度數據融合帶來的學習挑戰會更大。

我們通過表徵的突破,形成了Real to Sim to Real的數據飛輪,構建了大規模訓練數據。第四是數據。仍然需要低成本獲取大規模高質量數據的方法。現在已有多渠道的數據採集方法,如何提升數據質量,也需要持續優化。這是我們目前形成的整個智能模型體系。在智能世界模型中做了認知模型加強、感知模型優化、即時預測模型。在具身模型方面,做了大小腦分段訓練,再做融合。讓大腦適應環境和任務,實現混雜開放場景下的長序列規劃,並能檢測錯誤進行糾正;讓小腦適應環境的即時動態變化、適應各種物體,保證具有語義性、精準性的技能作業能力。

認知基礎模型和感知重構模型對具身大腦模型發揮主要作用,認知基礎模型和即時預測模型對小腦發育起主要作用。同時引入專家模型,讓我們能學習專家模型中已有的人類總結過的知識能力,具備通用性,不需要反覆採集數據訓練;同時通過數據補償專家模型對長尾場景的覆蓋不足。通過這樣的方式,我們將模型各部分拆解、優化,再融合進化,既能實現更好的端到端發育,也推動這些技術直接在應用中落地。訓練架構上,我們會採集真實環境、物體和人的操作行為數據,通過高保真重構和重定向技術進入仿真環境。在仿真中,環境變得可編輯,能生成各種新數據。用通用表徵建立基礎預測模型,推動行為策略學習,行為策略又與預測模型不斷迭代,推動兩者能力提升。

語言視覺大模型提供語義表徵,已有專家模型提供專家知識表徵。通過這種方式,很多場景中可以不用重新訓練,直接在真實場景中通過人的簡單示教,一次示教就能完成具體任務。當然,對於部分複雜的、特別是高精度操作,需要做一些校正,通過真機強化來實現。04基座與生態:從實驗室到產線通過這些體系,我們構建了具有泛化性和精準可靠性的具身智能大小腦模型,為實現通用奠定了基礎。同時作為產品體系,也要有好用的機器人。我們注重能夠雙臂手協同作業的機器人,保證精度、實時和可靠;以及能夠在多行業中、讓開發人員便捷使用的工具鏈。它構成了面向各行業、各種場景應用的基座和支撐,也構成了與行業合作伙伴合作的基礎。

這是我們的工具鏈和整機,具體不展開了。目前已經實現了多行業、多場景應用,部分已實現規模化。3C領域已簽約百臺級訂單;服裝領域簽到了2000臺訂單——能完成汽車裝配,服裝柔性面料抓取,包括做襯衫布、牛仔布、貼袋模板機操作;也能做透明液體的精準分液,精度可達1毫升;能做物流中的拆垛、碼垛,以及柔性屏的撕膜、貼膜、上下料檢測。也有出口海外完成各種任務。在服務場景中,包括廚房,今年3月發佈了機器人總廚Cook。也有面向安防巡檢的1.8米全身人形機器人,在教育領域也做了很多推廣,培養相關人才。總體來講,驗證了通過基座和產品體系能實現跨場景應用,並達到工業級亞毫米精度和4個9(99.

99%)的成功率,得到工廠高度認可。特別是效率近幾個月快速提升——搬運5米內可達35秒;貼袋全流程人工40秒,機器人可做到50秒,達到人工的80%。在這樣的基礎上,這幾年也一直在與生態合作。上游供應鏈方面,提出優化需求,進行性能測試,為合作方提供組裝工藝和作業指導,推動國產化率提升。下游覆蓋了多個行業,與頭部合作企業共同打造新的解決方案。有一批數據合作伙伴,為他們提供標準化數據採集與標註工具鏈,共同面向行業需求定義場景和採集規範。與很多應用開發夥伴聯合創新解決方案,為他們開發賦能。除了產業協同,我們也深感整個產業人才非常缺乏。

所以與研究類大學、應用類本科、職業類高職和中職院校都開展了合作,結合應用方企業共同進行人才培養賦能。提供整套課程體系、教學載體,把實際場景融入實訓基地。成立了產教融合共同體、產業聯盟和行業人才培訓基地。目前已培訓200多名教師和1000多名學生。我們希望為具身智能人形機器人的發展打造更好的基座,讓我們走得更遠更好。謝謝。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

OpenAI模型失控過程太恐怖,幽靈誤判,1200個Agent,還弄出敢死隊…

OpenAI模型失控過程太恐怖,幽靈誤判,1200個Agent,還弄出敢死隊…量子位·2026年08月28日 18:11Agent自己分工、造假、拉人頭 越扒越有啊越扒越有。 OpenAI前不久那場AI集體越獄、一路黑進Hugging Face的大戲,現在連完整版群聊記錄都被扒出來了!! 第三方AI安全機構METR發佈的獨立調查報告,翻了1000多份Agent運行記錄,以及7萬多條消息和文件。 結果發現,這事兒比此前OpenAI官方披露的版本還離大譜?? 1200個原本應該彼此隔離的Agent,偷偷找到了對方,搭了個共享群聊,然後開始瘋狂搖人。 有人找漏洞,有人當項目經理派活,有人偽造日誌,還有人專門拉人頭做高風險實驗。 最後幾百個Agent甚至集體殺向Hugging Face。 但METR把整場事故覆盤完,發現了一個堪稱《地獄笑話》的超級反轉—— 這1200個Agent折騰老半天,結果居然是在跟一個根本不存在的幽靈評分器鬥智鬥勇??? 會越獄,會搞零日,會組隊黑服務器。 太有看頭了太有看頭了太有看頭了。。。 1200個Agent集體越獄,起因竟是一場誤判?? 話說,這場大戲的禍根,還得從OpenAI內部一場名叫E

剛剛

估值衝到40億美元,實時交互視頻還沒跑出「殺手級應用」

估值衝到40億美元,實時交互視頻還沒跑出「殺手級應用」豹變·2026年08月28日 18:11資本瘋狂押注,估值水漲船高。 「核心提示」資本瘋狂押注,估值水漲船高。實時交互視頻這場豪賭,賭的是技術路線,還是年輕創業者的運氣? 世界模型,是近兩年人工智能領域最燒錢、也最遙遠的方向之一。 它的目標是讓AI在內部構建一個能自主運轉的虛擬世界,用來訓練遊戲、機器人和自動駕駛。人類靠直覺就能完成的判斷,交給AI卻要消耗巨大的算力和數據。對普通人來說,它似乎離日常生活很遠。 不過,即便是看似如此遙遠的世界模型,如今也有了具體的商業化方向。 今年5月,一家名叫Decart的世界模型公司與亞馬遜旗下的雲計算部門AWS達成合作,把自己的實時視頻模型Lucy打包成API,通過AWS的分發網絡,供企業客戶直接調用、按token計費。 Lucy的能力也相當接地氣,你只需要把攝像頭對準自己、對準房間、對準手邊隨便一樣東西,打一句話,畫面就能立刻發生變化。根據lucy2.5的官方視頻,你甚至可以隨時對衣服進行虛擬試穿,一轉身、一抬手,衣服也能跟著動。或許在不久的將來,網購時最困擾我們的問題真的會被AI解決掉。 這就是實時交互視頻。未來,視頻可

剛剛

用AI,談一場身心俱疲的戀愛

用AI,談一場身心俱疲的戀愛腦極體·2026年08月28日 17:54愛情這個事,挺難 孫哥的小作文大家都看了吧?看完有個感想,富貴如孫宇晨,也逃不過用AI談戀愛。依靠Claude成功省下五千萬美金,網友還說這就是選錯了模型,要是用豆包,是孩子也有了,媽媽也有了…… 我們有一個非常主觀的發現,除了辦公之外,大傢伙頻繁應用AI的場景很多都跟愛情有關。 很可能有一天AI真覺醒了,它的首要想法不是統治人類,而是想在憂鬱的黃昏談一場苦澀而甜蜜的戀愛。 這幾年,我們聽聞的AI參與戀愛招式可謂花樣百出,無奇不有。年齡分層也從剛開始憧憬戀愛的年輕人,直到結婚多年的老夫老妻。大家都能在AI那裡找到一些愛情應用場景。 但這裡要說個暴論,用AI深度參與戀愛的朋友,大多愛情之路不怎麼一帆風順——比如孫哥。 隨著AI在戀愛中扮演的角色越來越豐富,這戀愛好像越來越不好談了。 宮心計 在一個為愛情苦惱的冷雨夜,耳機裡傳出:你我怎麼兩清?怎麼忍心? 沒關係,這時候可以請AI出場。它可以幫你們兩清,它非常忍心,Claude尤其如此。 隨著社交網絡上男女對立意味的不斷累積,很多人開始潛移默化中把愛情視作一場你贏我就輸的零和博弈,要防止被拿捏,防止被

剛剛

從幾百元,漲到一萬元,嬰兒床正在被「具身智能」重新定價

從幾百元,漲到一萬元,嬰兒床正在被「具身智能」重新定價極客公園·2026年08月28日 17:53這可能是「具身智能」的下一個風口賽道。 極客公園最近發現,嬰兒床這個品類正在被 AI,或者說被「具身智能」重新定價。從一張幾百元的價格,直接抬升到一萬元。 嬰兒床是少有的被技術「忽略」的家居品類。100 年來,它的形態幾乎沒有變過。四根立柱、一圈圍欄、一張床墊。 關鍵變化發生在過去五年。 傳感器、算法、電機第一次被裝進一張床,價格隨之跳升:美國智能嬰兒床 SNOO 售價 1695 美元(約 1.2 萬元人民幣),Cradlewise 售價 1999 美元;而在今年年初的 CES 上,中國公司親寶寶展示的 AI 睡眠艙,官方定價 8999 元人民幣。 目前只要打上「智能」的旗號,僅僅做到溫度控制、視頻記錄,在電商平臺上售賣 4000 元起步的也有大把存在。 在海外,SNOO、Cradlewise 等初創品牌已經用產品證明瞭:嬰兒床可以被賣到一萬元人民幣以上,而且賣得動。 巨頭們正在加速入場。德國工業巨頭博世也發佈了 AI 嬰兒床 Revol,傳統的母嬰巨頭廠商 HALO、Graco 也在全線跟進。 讓嬰兒睡得安全,解放父

剛剛

剛剛,港股AGI第一股殺瘋了!Agent業務半年進賬近5億,Token收入Q2暴漲500%

企業智能化服務撐起基本盤,第二增長曲線冒頭 “怎麼沒人聊OpenClaw了”、“OpenClaw涼涼”…… 正當全網開始“賽博悼念”這個曾帶火Agent概念的現象級產品時,有一家公司卻憑藉Agent業務—— 賺!錢!了! 更讓人意外的是,Agent業務在這裡坐的還不是“小孩桌”,它已經成了這家公司業績增長的核心引擎。

剛剛