突破具身智能物理死角:IJCAI 2026 具身智能泛化與控制突破
告別理想仿真,中國學術團隊用物理工程方案回應落地挑戰。作者丨張璐 編輯丨岑峰 過去一年多里,具身智能似乎按下了快進鍵。從 Physical Intelligence 發佈的π₀到開源社區追捧的OpenVLA,VLA大模型一路高歌猛進。在各種標準基準測試和精心搭建的實驗室 Demo 中,機械臂疊衣服、拿取物品流暢得宛如人類,動輒刷出 90% 甚至 95% 以上的成功率。然而,當全行業都在歡呼“機器人的 GPT 時刻”到來時,前沿學術界與產業界卻爆發了一場劇烈的反思:這些動輒數十億參數的具身大模型,真的學會“舉一反三”了嗎?還是在“死記硬背”?
在主流學術視角中,VLA 大模型像是給機器人裝上了具備常識與規劃能力的“大腦”。但要讓機械體真正幹好精細活,僅有一個聰明的大腦遠遠不夠。最新實驗數據表明,面對物品位置的隨機挪動或新指令組合時,純端到端大模型往往會受到“空間過擬合”的約束,末端執行成功率會出現劇烈衰減。這恰恰說明:具身智能要真正走出實驗室,不僅需要大模型提供常識和高層決策,更需要紮實的工程技術去打造精準、穩健的“小腦”。下面盤點入選 IJCAI 2026 的 6 項中國團隊成果。它們並非要替代大模型,而是從空間泛化、盲區感知到極端控制,為具身智能補齊了通往真實物理世界最關鍵的拼圖。
01解決死記硬背,大模型如何搞定未見場景具身智能的核心瓶頸之一在於真正的泛化能力。目前的VLA動輒擁有數十億參數,但在面對沒有見過的指令組合或場景變化時,表現往往大打折扣。▎泛化成功率跌破 21%:不重訓模型,如何把成功率拉回 83%論文:《VLAs Are Confined yet Capable of Generalizing to Novel Tasks》作者:李全義(論文獨立作者,一路從北郵本科、愛丁堡碩士深造至新加坡國立大學 CLeaR Lab 博士,現任 Oxa 高級應用科學家)論文鏈接:https://arxiv.org/pdf/2505.
03500v5假設你給機器人下達了一道指令:“把奶酪放進櫃子”。如果在訓練數據裡,這塊奶酪總是擺在桌子左側,那麼當你在現實中把奶酪挪到桌子右側時,會發生什麼?在李全義博士最新的研究中,發生了令人啼笑皆非的一幕:主流 VLA 大模型依然會機械地伸向桌子左側。模型根本沒有理解什麼是“奶酪”,它只是把詞彙與訓練集裡的固定物理座標進行了強行綁定。無論是π₀、OpenVLA 還是 UniVLA,雖然它們在標準測試集裡能刷出 95% 以上的超高成功率,但李全義博士專門構建了 20 個外推新任務的 libero-ood 基準。
在這個不按套路出牌的考場上,主流 VLA 的成功率瞬間斷崖式跌落到了 21% 以下(OpenVLA 僅 1%,π₀-fast 為 17%,UniVLA 為 21%)。原因是:大模型在決策時根本不關注物體本身,只盯著機械臂末端與終點座標。但這項研究最精彩的部分在於“反轉”。李全義博士通過機制可解釋性方法,從大模型內部提煉出了代表任務語義的“文本隱變量”。在模型殘差流中實施“文本隱變量插值(TLI)”後,在完全不重新訓練模型的前提下,直接將 π₀ 在外推新任務上的成功率從 9%提升到了 83%!
這項由中國年輕學者完成的獨立研究,不僅用嚴謹的數據證實了現有的端到端微調確實落入了死記硬背的陷阱,更從底層表徵上證明了大模型內部早已蘊含了可組合的通用泛化潛能,只是過往粗暴的端到端訓練並沒有找到喚醒它的正確鑰匙。▎微調 0.63% 參數:4 小時練完視覺大模型,嵌入式芯片 63ms 響應論文:《RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation》作者:Chu Wenhui(德克薩斯 A&M 大學)論文鏈接:https://arxiv.org/pdf/2605.
25495我們先來看兩組極其懸殊的對比數據:傳統全量微調“分割一切”大模型 SAM(ViT-H):需要訓練 6.32 億參數,耗時 384 個 GPU 小時。RepSAM 的適配方案:僅微調 400 萬參數,單卡 A100 訓練 4 小時。參數量縮減了 158 倍,訓練速度提升了 96 倍,感知效果卻達到了全量微調 97.9% 的水準。它是怎麼做到的?Chu Wenhui 並沒有盲目地對整個大模型進行“一刀切”式微調。
他利用中心核對齊(CKA)理論對 SAM 的 32 層 Transformer 網絡進行掃描後,發現了大模型內臟裡的表徵漂移規律:淺層網絡(L1-10)低階特徵的領域差異極其劇烈(CKA < 0.5),必須分配高容量適配(Rank 16);中層網絡(L11-22)處於中等特徵過渡區(Rank 8);深層網絡(L23-32)的高階語義表徵則高度通用(CKA > 0.7),只需極低容量適配(Rank 4)。RepSAM架構圖靠著按需低秩適配,RepSAM 在面對透明玻璃杯、嚴重遮擋堆疊零件等傳統視覺大模型經常失明的場景時,展現出了極其驚豔的感知力。
在 ClearGrasp 透明物體分割任務上,mIoU 從 SAM 零樣本的 34.7% 暴漲至 90.1%;在真實的 PyBullet 抓取物理仿真中,抓取成功率高達 94.4%,碰撞率降低了 8.8%。但在真實的工業抓取場景中,光有高精度遠遠不夠。算力開銷與實時響應時延,才是技術能否走出實驗室的關鍵。嵌入式機械臂與邊緣控制器算力極其寶貴,根本無法承載動輒全量重訓的重型視覺網絡。而RepSAM 真正硬核的地方,恰恰在於它在保持高精度的同時,在嵌入式設備 Jetson AGX Orin 上跑出了低至 63ms (15.8 FPS) 的響應時延。
這種對計算效率與表徵規律的極致壓榨,真正解開了工業級具身視覺在邊端部署上的時延枷鎖。02指令抽象、視線遮擋,如何實現釐米級精準交互進入真實場景後,機器人將面臨兩大感知殺手:一是人類給出的自然語言指令往往高度抽象,在連續空間漫遊時極易迷路;二是當機械臂接近物體時,機械臂自身或周圍障礙物會完全擋住攝像頭,形成物理上的視覺盲區。
▎連續空間導航:提取自然語言地標,陌生環境成功率提升 7%論文:《FILD-Nav: Vision-and-Language Navigation with Instruction Landmark Features in Continuous Environments》團隊:Chuangye Hu, Lulu Liu, Huaiwei Si, Yawen Zhao, Nan Ding(中國學者團隊)英偉達 CEO 黃仁勳曾在 GTC 大會上對具身導航做過一個極其深刻的斷言:未來的具身導航絕非簡單的幾何建圖與避障,而是語義理解與物理空間地理信息的深度交融。
當機器人從桌面搬運走向更大範圍的真實連續空間時,這一斷言在真實場景中顯得尤為貼切。“繞過前面的木質辦公桌,直走到廚房,在水壺旁停下。”人類聽到這樣的指令時,大腦會在移動過程中,不斷用眼睛去校驗“木質辦公桌”和“水壺”這兩個核心參照物。但在連續環境下的視覺-語言導航任務裡,現有算法在航點預測(Waypoint Prediction)時往往缺乏高階語義引導,在跨模態規劃中也缺少顯式的“語言-地標”對齊。這導致機器人無法精準匹配指令裡的物理實體,在跨長週期導航裡走著走著就迷失了目標。中國學者團隊提出的 FILD-Nav 框架,正好給出了呼應這一行業趨勢的硬核答卷。
算法能自動從複雜的自然語言指令中提煉出與任務強相關的“地標特徵(Instruction Landmark Features)”,並將地標語義雙向注入到導航的核心環路中:地標引導的航點預測:將地標語義融入航點生成,大幅提升預測航點與真實物理地標的相關性;地標增強的拓撲規劃:在跨模態規劃中引入地標語義校驗,使機器人具備了更穩健的長週期導航能力。在權威基準數據集 VLN-CE 的廣泛測試中,FILD-Nav 的導航成功率(SR)提升了 2%,路徑長度加權成功率(SPL)提升了 3%。特別是在未曾見過的全新陌生環境裡,其 Oracle 成功率(OSR)大幅提升了 7%。
這種賦予機器人邊走邊用語言符號校驗物理地標的高級認知能力,正是將黃仁勳所描繪的“語義與空間深度交融”落地為現實,為服務機器人走出實驗室、邁入結構複雜的商場、醫院與家庭場景打通了關鍵路線。▎最後一釐米視覺盲區:無需相機參與,150 個真實物體抓取率 97.
3%論文:《PECHC: Robust Tactile Grasping Stabilization in Vision-Denied Peripersonal Space》團隊:中國科學技術大學 董二寶教授團隊無論是 Meta 開源的 Digit 觸覺感知平臺,還是各類靈巧手在手指末端加裝多軸觸覺傳感器,都指向了一個非常現實的行業共識:要想讓機器人學會做精細活,光靠眼睛是遠遠不夠的。觸覺之所以被推到臺前,根本原因在於視覺在接近目標“最後一釐米”時的天然盲區。當機械臂手眼協同深入狹窄空間或接近目標時,相機視線會被夾爪和機械臂自身完全遮擋。加上相機標定誤差,視覺信息在最後關頭往往極其不可靠。
沒了視覺,傳統的視物抓取算法失去視覺參照,極其容易產生碰撞失誤,或者因無法感知接觸力而把蛋撻、玻璃杯等易碎品捏碎。中國科學技術大學董二寶教授團隊提出的 PECHC(物理演化級聯約束與人類糾偏)算法,選擇在視覺徹底失靈的近身盲區裡,把控制主導權毫無保留地交給觸覺。
為了徹底隔離觸覺在多指協同中的獨立貢獻,團隊採用解耦控制策略,將靈巧手工作空間內的抓握穩定設為一個無需視覺參與的“安全防禦反射(Fail-Safe Reflex)”:混合糾偏模仿學習 (HCIL):建立由失敗觸發的人機糾偏機制,僅需極稀疏的人類專家糾偏即可高效彌合模型差距;級聯約束調度 (CCS):施加物理上合理的行為約束(幾何接近、力封閉與動態穩定性),一舉彌合幾何拓撲差距;時序異構蒸餾 (THED):從歷史觸覺序列中進行隱式系統識別,精準彌合真實物理動力學差距。
在涵蓋 150 個真實物體(Visual Dexterity 數據集)的完全自主測試中,PECHC 展現出極高的魯棒性:實現了 97.3% 的真實機器人抓取成功率!整個測試過程中,僅需 1 個物體進行一次性 HCIL 校準,其餘 149 個全新物體在沒有任何干預的情況下全部輕鬆搞定。相比傳統的 Sim-to-Real 強化學習 Baseline(帶域隨機化的 Vanilla PPO),PECHC 性能大幅提升了 42.8%,並且在抓取易碎物品時展現出了類似人類手掌的細膩調力能力。團隊用實打實的 97.
3% 真實成功率證明了:當視覺退場後,高階觸覺感知才是讓機器人安全觸達物理世界的最終屏障,也展現了中國學術機構在靈巧手觸覺控制領域的突破。03極端控制:面對強風暗流,如何防止強化學習算法崩盤當具身智能從理想的室內實驗室走向戶外、高空或海洋,算法面臨的威脅不再只是簡單的視覺遮擋或空間位置變化,而是充滿了高度隨機性與非線性的真實物理世界擾動。在海浪衝刷、複雜洋流、強陣風以及高異構傳感器噪聲的夾擊下,缺乏魯棒防護的傳統算法極其容易發生價值函數崩潰,甚至引發致命的碰撞與墜毀。如何讓機器人在極端環境中保持穩健控制?中國學者們在控制算法的底層數學設計上交出了一份滿意的答卷。
▎極端海況抗擾:分佈魯棒替換反向傳播梯度,碰撞率下降 12.28%論文:《Perturbation-mitigated USV Navigation with Distributionally Robust Reinforcement Learning》團隊:香港科技大學(廣州)熊輝教授團隊強化學習教父 Rich Sutton 曾提出過著名的“苦澀的教訓(The Bitter Lesson)”,認為純粹基於數據和算力的通用算法,終將戰勝人類精心設計的物理規則。然而,當算法從理想的計算機仿真走到殘酷的物理世界時,純數據驅動的脆性便暴露無遺。
以無人水面艇為例,當它行駛在充滿了未知暗流、隱蔽礁石以及惡劣天氣的真實海面上時,傳感器觀測噪音會隨海況劇烈波動。這種高度異構且非平穩的觀測干擾,極其容易導致傳統強化學習算法的價值函數徹底崩潰,引發致命的碰撞與迷航。香港科技大學(廣州)熊輝教授團隊提出的 DRIQN(分佈魯棒隱式分位數網絡)算法,選擇用極其優雅的數學手段,給純數據驅動的強化學習穿上了一套“防護罩”。論文鏈接:https://arxiv.org/pdf/2512.
00030面對海量且複雜的噪聲干擾,團隊沒有采用增加複雜輔助模塊的“重型架構”,而是做出了兩項關鍵突破:回放池顯式子組建模:將經驗回放池中的轉移數據按噪聲模式劃分為J個同質子組,專門對異構噪聲與最壞工況進行顯式建模,巧妙地將原本計算極其複雜的點級 DRO 優化,轉化為高效的子組級損失優化;輕量化“梯度替代”機制:利用分佈魯棒優化(DRO)求解出的對偶二次規劃,直接替換神經網絡最後一層的反向傳播梯度。這樣既完整保留了深度網絡高階特徵表達的優勢,又讓算法天生具備了抵禦最壞工況的魯棒性。
在疊加了 4 個水流渦流、6 個隨機礁石障礙物以及高強度傳感器噪聲的模擬極端海況下,DRIQN 展現出了極其硬核的抗擾穩定性。相比頂級基線模型,它不僅將導航成功率提升了 13.51%、碰撞率降低了 12.28%,還在成功航次中同時實現了 35.46% 的省時與 27.99% 的節能。即便面對傳感器突變與數據丟失交織的複合故障,DRIQN 依然以 58% 的全場最高成功率和最低超時率跑贏了所有對手,做到了安全性、能效與容錯力的全面兼容。熊輝教授團隊的這項成果證明了,純數據驅動的 RL 在複雜的物理世界裡絕不是萬能的。
通過在梯度更新層面無縫融入分佈魯棒性,為無人艇、無人機乃至各類工業巡檢機器人如何在極端物理擾動下保持可靠決策,提供了一份硬核的工業級答卷。▎突發強側風控制:空氣動力學與強化學習混合,毫秒級估計風場論文:《Disturbance-Aware Hybrid Learning for Robust and Adaptive UAV Flight in Extreme Winds》團隊:重慶大學古富強團隊在大地之上的高空,無論是高壓輸電線的野外巡檢,還是狹窄山谷裡的搜救探險,突如其來的強陣風始終是無人機最致命的噩夢。
傳統 PID 或模型預測控制(MPC)在面對非線性強風時響應滯後;而純深度學習控制在面對未曾見過的風場時極易產生過擬合,一旦遇到突發側風,無人機極易失控翻機墜毀。重慶大學古富強團隊提出的擾動感知混合學習(Disturbance-Aware Hybrid Learning)架構,切中了極端風況自適應控制的核心痛點。算法構建了一個實時風場擾動感知模塊,能像飛鳥的羽毛感知氣流一樣,毫秒級實時估計作用在無人機機體上的非線性氣流擾動特徵。
隨後,它將傳統空氣動力學物理模型與數據驅動的強化學習策略進行動態混合(Hybrid Learning),根據實時感知到的擾動強度毫秒級調整控制權重,實現了極端風況下的平穩懸停與高精度軌跡跟蹤。這項研究,切中了低空經濟發展中最核心的安全剛需,正是無人機從“攝影工具”躍遷為“全天候工業級生產力工具”的關鍵技術橋樑。04結語:在 Scaling Law 的信仰之外,尋找物理世界的硬解梳理完這 6 篇研究,最觸動人的其實是一種路線的分野。
當 Physical Intelligence 和 Figure 這些硅谷明星團隊傾盡算力和數據去押注VLA 大模型的 Scaling Law時,他們試圖重演大語言模型的奇蹟:相信只要模型參數足夠大、視頻喂得足夠多,通用的物理控制能力就會自然“湧現”。但這套邏輯在真實的物理世界裡,正頻頻碰壁。真實場景充斥著摩擦力、相機盲區、突發的陣風和傳感器噪聲。面對這些毫無規律可言的物理死角,端到端黑盒模型的泛化表現往往比預想中脆弱得多。相比之下,這 6 篇來自中國學者和科研機構的成果,展現出一條極其清晰的“物理工程主義”路線。
大家不再盲目追逐參數規模,而是直接拆解大模型的內臟,用 CKA 理論摸清表徵漂移,拿 0.63% 的參數量就把視覺大模型嵌進邊緣芯片。在鏡頭完全失靈的最後關頭,不靠算法去憑空盲猜,而是直接把控制權交給毫秒級響應的觸覺反射;面對海浪和強風的襲擾,則從數學底層入手,用分佈魯棒優化直接給強化學習的梯度更新安上防護罩。具身智能不能只停留在展臺炫技。真正的產業落地,絕不會誕生在無限堆疊數據的實驗室裡,而屬於那些能精算算力成本、硬剛真實物理環境各種複雜擾動的方案。IJCAI 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!
進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。
現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

燧原科技啟動科創板發行:擬募資60億元,9月2日申購
TechPulse2026.08.25 17:54 · 來自河北全文1176字00:00 / 03:59騰訊既是燧原科技的重要股東,也是公司第一大客戶。國產AI芯片企業燧原科技正式邁入科創板發行階段。8月25日,上海燧原科技股份有限公司披露招股意向書提示性公告。

大廠這波Agent混戰,殺死10多個AI名品
大型科技企業在人工智慧領域的競爭,正從單純的模型較勁,快速轉向更貼近實際應用的Agent(智慧體)戰場。過去一段時間,各大廠接連端出以「工作」、「效率」為核心的智慧體產品,試圖搶占使用者桌面與瀏覽器的主控權。然而這波快速推進的卡位戰,也伴隨著殘酷的淘汰,多達十餘款曾經備受關注的AI工具,在短短時間內從市場上消失,成為大廠戰略調整下的犧牲品。 這波混戰的起點,其實是AI應用從「能對話」走向「能做事」的轉折。

阿里雲 Token Plan 接入千問 App 及 PC 端,支持 Qwen3.8-Max 等模型
作者:沁滄(實習) 責編:沁滄 評論: 8 月 25 日消息,阿里雲今日宣佈,阿里雲 Token Plan 正式接入千問 App 及 PC 端。用戶只需將 API Key 綁定至千問,即可直接調用 Token Plan 訂閱額度,支持 Qwen3.

澳大利亞唱片業協會“重拳出擊”,純 AI 生成歌曲禁入官方排行榜
作者:清源 責編:清源 評論: 8 月 25 日消息,據美聯社報道,隨著生成式 AI 快速發展並開始威脅音樂人的生計,當地時間 25 日(今天),澳大利亞唱片業協會(ARIA)決定禁止完全由 AI 生成的歌曲進入官方排行榜。新規出臺前,一首由澳大利亞製作人利用 AI 生成人聲和鼓點重新制作了麥當娜的名曲《Like a Prayer》,並連續 16 周躋身澳大利亞前 20 名,也讓生成式 AI 在音樂行業中的地位成為爭論焦點。

開源國產8B模型,比肩閉源Image 2了!
商湯科技正式開源SenseNova U1.5 Lite,這是一款僅8B參數的國產生圖模型,主打4K直出與更完整、準確、穩定的表現。該模型能一次處理多張圖片與複雜指令,例如將九張食物照合成精美食譜卡片,並支援精準的局部圖像編輯,同時保留原圖其他區域的結構與空間關係。其亮點包括超長指令遵循、高品質視覺生成、可靠的原生編輯,以及優異的中英文文字與複雜佈局處理能力。

雷軍詳解新一代玄戒芯片原型機,包括高速 AI 演示終端和個人 AI 超級計算終端
作者:歸瀧 責編:歸瀧 評論: 感謝網友 Autumn_Dream 的線索投遞!8 月 25 日消息,小米創辦人、董事長兼 CEO 雷軍剛剛發文,介紹了搭載新一代玄戒芯片的兩款原型機,包括高速 AI 演示終端和個人 AI 超級計算終端。玄戒 O100 原型機:為端側大模型而生的高速 AI 演示終端。