GPT-6 絲滑「上身」宇樹 G1,斯坦福把機器人控制鏈封裝成了一套「專屬 API」

本文作者: 鄭佳美 2026-09-30 09:45 導語:空間記憶接導航,視覺伺服接抓取,全身運動負責落地。空間記憶接導航,視覺伺服接抓取,全身運動負責落地。作者丨鄭佳美 編輯丨岑 峰 這兩天,斯坦福大學 The Movement Lab 和加州理工學院公開了一個有趣的研究項目 HomeBody。團隊把 GPT Astra 接進 Unitree G1,讓人形機器人先自己探索陌生廚房,再根據人的指令完成找東西、拿藥、扔垃圾和開抽屜等連續任務。這並不是簡單給 G1 加一個大模型助手。
機器人事先不知道物體具體放在哪裡,它需要在探索過程中記錄環境和空間位置,任務開始後再從歷史信息裡找回目標,決定去哪、找什麼,以及接下來調用哪個技能。更關鍵的是,GPT Astra 並不直接控制關節。導航、軌跡規劃、碰撞檢測、視覺伺服和全身控制依舊運行在機器人本地,大模型負責的是任務理解、技能選擇和失敗後的重新決策。在全行業都在卷端到端大模型直接吐動作(VLA)的當下,但 HomeBody 項目顯然給出了相反的答案。它試圖回答具身智能一個充滿爭議的核心問題:當 VLM 已經能理解環境、調用技能並處理長任務以後,語言到動作之間那層原本很重的任務策略,還需要保留多少?
把機器人控制鏈做成標準化接口、用分層治理抗衡端到端,會是具身智能走向實用化的最優工程解法嗎?HomeBody 後面的整套架構設計,正是沿著這個追問展開的。01一套機器人 API這套系統往前走的一步,並不是把 GPT Astra 接到 G1 的關節控制器上,而是重新設計了大模型和機器人身體之間的接口。Astra 每次做完判斷後,會通過結構化 tool call 選擇一個技能,同時給這個技能提供它真正需要的參數。不同動作對應不同的命令空間:Pick 接收當前圖像中一個歸一化到 0–1000 的二維點,再指定左手或右手,Navigate 接收地圖座標系裡的二維目標點和朝向點。
Place 使用機器人軀幹座標系中的三維釋放位置、執行手以及釋放距離。抽屜操作則把視覺對準、掛住把手和向後行走封裝成一個完整技能。(公眾號:)這裡的設計很關鍵,因為它刻意不讓 VLM 輸出機械臂末端的連續軌跡。大模型只在語義空間裡表達我要操作哪個目標,技能接口再把這個意圖逐層變成機器人能夠執行的幾何約束。這樣一來,Astra 不需要理解 G1 的每個自由度,也不需要知道逆運動學求解器怎麼工作,它只需要知道當前有哪些能力,以及每種能力需要什麼參數。這和端到端 VLA 的區別也就在這裡。VLA 通常需要學習從視覺和語言直接映射到動作空間,動作分佈、機器人本體和訓練數據會緊密耦合。
這裡把中間層拆成顯式接口後,抓取可以由解析方法實現,導航可以接傳統規劃器,某個新技能也可以來自強化學習策略。只要輸入輸出遵循同一套協議,上層 VLM 並不需要知道底層究竟用了哪種控制方法。這種設計把機器人擴展能力的難點從重新訓練整條策略,轉移到了接口本身能不能表達任務需要的狀態。隨後麻煩很快就出現了:二維圖像點可以告訴 Pick 抓什麼,卻無法告訴 Navigate 幾分鐘前看到的藥瓶究竟位於房間哪一側。一旦任務跨越多個房間位置,VLM 就不能只依賴當前相機畫面,它需要把視覺語義和真實世界的米制座標接起來。02把視覺歷史放進統一座標系G1 在執行任務前先探索環境,技術意義就在這裡。
探索過程中,系統同步保存相機觀測、D435i 雙目數據、LiDAR 與 SLAM 信息、機器人關節姿態,以及 Astra 選擇過的航點。隨後,Astra 參與 Real2Sim 流程,把這些觀測整理成 Isaac Sim 中的數字環境。SLAM 提供實測幾何約束,視覺數據補充物體和場景語義,關節狀態與航點則把觀測重新綁定到機器人自身視角。這一步解決的是兩個座標體系之間的斷裂。VLM 看到的是圖像座標,例如藥瓶曾經出現在某張照片右下方;機器人導航需要的卻是地圖座標,例如目標位於當前身體前方 4.2 米、左側 1.1 米。單純保存歷史圖片無法直接完成這種轉換。
系統運行時先通過 Super Odometry 得到 G1 在現實 SLAM 地圖中的狀態,再利用 ICP,也就是 Iterative Closest Point,把 SLAM 點雲與 Isaac Sim 中的重建環境配準。完成配准以後,現實地圖和數字環境共享一套空間關係,探索階段保存的 ego keyframe 也能綁定到這個座標系。於是,空間記憶實際上被拆成了兩層。一層是語義記憶,保存某張關鍵幀裡出現了什麼;另一層是度量幾何,保存拍攝這張圖時機器人位於哪裡。
收到拿藥任務後,Astra 可以先從歷史觀測裡恢復藥瓶或抽屜對應的視覺線索,再沿著綁定的空間位置讓 Navigate 返回此前記錄過的區域。這比把幾十張歷史圖片直接塞進 VLM 上下文穩定得多。語言模型擅長判斷某個物體和任務有沒有關係,但機器人要走過去,還需要尺度、方向和可達區域。HomeBody 把這部分交給 SLAM 和 Real2Sim,讓 VLM 操作的是已經被空間化的記憶。Real2Sim 在這裡承擔的也不只是場景重建。
官方給出的對比顯示,僅靠人工拍攝視頻進行重建時,房間尺寸需要根據視覺外觀估計;加入機器人自身採集的 SLAM 幾何以後,房間佈局和尺度受到實測點雲約束,數字環境才適合繼續給導航和空間推理使用。不過,這套空間記憶主要解決的是目標已經離開視野以後怎麼重新找到它。機器人真正走到抽屜前,問題會從米級導航突然收縮到釐米級操作:三維位置稍微偏一點,手就可能從瓶子旁邊擦過去。因此下一層不能再靠地圖處理,需要把二維視覺、深度恢復、機械臂規劃和在線糾偏接成另一條閉環。03從一個圖像點到抓住物體Pick 技能的輸入非常簡單:Astra 給出圖像中一個 0–1000 範圍的二維點,並指定使用哪隻手。
但這個二維點不能直接驅動機械臂。系統先用該點提示分割模塊,把目標從背景中切出來,隨後 Fast-FoundationStereo 根據 D435i 的雙目圖像計算深度。得到目標區域的深度以後,再利用相機標定關係,把 mask 內的像素從相機座標投影成三維幾何,系統據此通過解析方法生成抓取姿態。接下來進入運動規劃。機械臂從當前姿態移動到抓取姿態時,規劃器生成 spline reference,並使用 minimum-jerk timing 約束軌跡,讓速度和加速度變化保持平滑。然後沿軌跡逐點求逆運動學,同時檢查整條 swept motion 的碰撞間隙。
換句話說,系統檢查的不是終點會不會撞,而是機械臂從起點移動到終點掃過的整個體積是否安全。但這種離線規劃仍然解決不了運動過程中的視覺漂移。人形機器人靠近桌子時,身體本身會移動,頭部相機的視角也會改變。最初投影得到的三維目標即使只偏幾釐米,也足以讓抓取失敗。系統因此繼續使用 SAM 2.1 跟蹤目標,並結合 SAMURAI 的 memory selection 維持跨幀目標狀態,再通過 visual servoing 根據新的視覺位置持續修正接近方向。這裡出現了一個很重要的閉環分層。
小範圍視覺誤差直接由 servo loop 修正;機械手閉合卻沒有建立接觸時,Pick 技能可以換一個 grasp candidate,或者改變機器人站位後重新規劃;這些嘗試有明確的次數邊界。只有局部恢復已經無法處理,技能才會把失敗原因返回 Astra,讓 VLM 決定重新定位、換目標或者調整任務順序/大模型因此沒有進入每一次糾偏。它負責的是離散任務狀態轉移,本地模塊負責連續狀態穩定。兩者時間尺度也完全不同:手臂和手部控制命令運行在 250 Hz,AMO 每 5 個控制 tick 更新一次,相當於 50 Hz。GPT Astra 的遠端推理則處在秒級。
把三種尺度硬塞進同一個策略裡,網絡抖動和模型推理時間會直接影響身體控制;現在它們被分開以後,大模型停頓主要發生在技能切換處。抽屜操作則把這種分層推到了全身控制。機械手掛住把手後,如果只讓手臂向後移動,很快就會遇到工作空間和身體平衡限制。系統會讓機器人向後走,同時維持上肢操作目標。這裡使用的 AMO 本身是一套將 Sim2Real 強化學習和軌跡優化結合起來的全身控制框架,訓練目標之一就是讓 G1 在面對超出常規分佈的上肢目標時,仍然能夠通過下肢和軀幹調整擴大可操作空間。
到這一步,整套技術鏈才真正閉合:VLM 輸出任務級目標,空間記憶把歷史視覺變成地圖位置,感知模塊把二維目標恢復成三維幾何,規劃器生成可執行軌跡,視覺伺服吸收局部誤差,全身控制器再負責讓這些動作在真實 G1 上保持穩定。04機器人內部的接口層這套系統目前還有很明顯的工程邊界。Real2Sim 會增加部署準備和 API 成本,Astra 的遠端推理會在技能之間產生停頓,本地感知和規劃目前需要一臺 RTX 4090 筆記本運行,更重的視覺模型會繼續推高計算需求。長時間任務還受到機械臂工作空間、手部舵機發熱以及硬件耐久度限制。更大的問題來自技能覆蓋範圍。
Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,卻不能僅靠語言推理生成一種從未實現過的接觸動力學。技能庫沒有擦桌子,就無法因為一句指令自動獲得穩定的擦拭控制;沒有處理柔性物體的控制器,也不能靠上層規劃彌補底層能力空缺。但這種限制反過來也說明了它的架構方向。這裡沒有要求一個 VLA 同時學習空間記憶、任務分解、三維視覺、抓取、碰撞規避和全身動力學,而是把這些問題拆成各自適合的表示和控制頻率,再通過顯式接口連接起來。
VLM 面對的是技能和狀態,SLAM 面對的是幾何空間,視覺模型面對的是像素與深度,運動規劃器面對的是軌跡約束,AMO 面對的是整具身體的動力學。人形機器人因而開始出現一種更接近複雜軟件系統的結構:高層模型負責離散決策,空間系統維護外部狀態,技能提供標準化調用接口,高頻控制層承擔物理穩定性。HomeBody 目前展示的能力還有限,但它提出的問題已經很具體。接下來具身智能的競爭可能不只是誰能訓練出更大的動作模型,還包括誰能設計出更合理的技能接口、更穩定的空間狀態表示,以及更清晰的高低頻控制邊界。參考鏈接:https://tml.stanford.
edu/homebody/https://github.com/Stanford-TML/homebody上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 AI 宇樹 Astra 從 App 到服務,騰訊 Marvis 為什麼認準「管家」 獨家|費米宇宙發佈全球首款全鏈路量子增強大模型 ...從創意落地到創業起步,嘉立創延長AI硬件創新支持鏈 ...中訓練、後訓練持續升溫,模型快速迭代,成為 AI fo ...
鄭佳美 編輯 發私信 當月熱門文章 Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token?深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 萬條軌跡才是底牌 DeepSeek V4 多模態開源,我們把它的視覺鏈路拆了一遍 讓機器人學會視頻裡的真實交互:大曉 HSImul3R 打通 Real-to-Sim-to-Real 拆解 Claude 5.1:38 小時不睡覺的背後,Anthropic 正在終結「模型論」 最新文章 深度拆解 Sonnet 5.
5 :半價 Opus 只是表象,Agent Runtime 才是變化核心 嶽麓大會觀察:當別處還在拼具身全棧,湖南選擇了一條更“重”的路 SeeAct AI穆堯:具身智能終局,一定是從“被訓練”走向“自我進化”|物理AI50人 這次雲棲,斑馬智能亮出了從汽車到具身智能的入場券 啟仔遠仔,想成為第一個被你帶回家的硅基夥伴 Jev 的「百億補貼」迷局:既然「極省」為何還要狂送 1.2 億 Token?熱門搜索 機器人 無人機 可穿戴設備 intel 庫克 Windows 8 早報 社交 Adobe 徐小平 速賣通
Related
相關文章

Dots 上場這天,OpenAI 把自家最強模型攔在門外
硅谷Tech news2026.09.30 11:06 · 來自湖北全文5803字00:00 / 14:52一邊登臺,一邊缺席。當地時間 9 月 29 日晚,舊金山。OpenAI 在年度開發者大會 DevDay 2026 上,將常駐代理 Dots 設為發佈重點。Dots 不同於此前任何 ChatGPT 產品形態。它不在對話窗口中等待用戶指令,而是在後臺持續運行。用戶無需主動調用,代理根據預設目標在雲端完成操作。一邊登臺,一邊缺席DevDay 2026 現場,OpenAI 一口氣公佈了約 20 項更新。

Anthropic 披露與 SpaceX 簽署高達 845 億美元鉅額算力協議
根據Anthropic在最新機密 IPO 文件中披露的信息顯示,該公司已與SpaceX正式簽署了一項規模龐大的算力供應協議。根據協議內容規劃,Anthropic計劃在 2029 年前向SpaceX支付最高達 845 億美元的費用,用於獲取後者基於英偉達芯片搭建的強大 AI 計算資源。

Muse憑啥讓小扎AI口碑翻盤?一文看懂
AI應用風向標(公眾號:ZhidxcomAI) 作者|畢偉豪 編輯|心緣 9月30日報道,過去三週,Meta發佈的一款App成了科技圈最大的變量。該應用上線後僅10天就登頂美國App Store免費應用總榜,將ChatGPT甩在身後,第12天,據第三方估算其全球安裝量達到280萬。

麥當勞在美規模化部署AI動態定價引擎,同城門店最高價差達21%
該系統通過深度處理超13000家內部門店及溫蒂漢堡等競對的海量交易數據,為各店計算最優價格。這一算法導致同區商品出現顯著價差,如加州弗雷斯諾相距僅兩英里的門店,同款巨無霸漢堡標價相差21%(5.69與6.89美元),紐約同城門店價差亦達11%。

Meta 又製造了一個賽道幻覺
版面之外2026.09.30 10:30 · 來自海外全文3062字00:00 / 08:36產品剛冒頭,資本先把泡泡吹了起來。文 | 版面之外,作者|畫畫Meta 的新產品 Muse 火了。上線僅半個月,兩週下載量突破280 萬。到 9 月 24 日,這個數字翻到了340 萬以上,毫無懸念地登頂美國 App Store 與 Google Play 免費榜。資本市場比用戶更興奮。Muse 描繪的 Personal Agent(個人智能體)藍圖,直接推動 Meta 市值一度暴漲近2000 億美元。

谷歌向免費用戶開放Gemini Skills服務,Gems功能將於11月完成整合
按照規劃,原有的Gems功能將於2026年11月17日自動過渡並整合至Skills系統中。此前,Gems允許用戶通過創建自定義指令來運行特定查詢,但其交互方式要求用戶在龐大的列表中滾動查找,整體效率偏低。升級後的Skills在保留原有自定義配置能力的基礎上,大幅優化了操作邏輯。