GPT-6 Astra開進機器人身體!清華聯手無問芯穹等開源RPent

2026年9月21日 14:24
GPT-6 Astra開進機器人身體!清華聯手無問芯穹等開源RPent
站內 AI 整理稿

出了一種全新且高效的工作方式:大模型理解目標,拆解任務,調用適當的工具,並根據執行結果不斷調整計劃,直到完成任務。隨著GPT-6 Astra開始接受真實機器人操作測試,這種“讓大模型作為決策大腦”的智能體範式正逐漸走向物理世界。同時,也讓一個曾經遙遠的問題變得越來越具體: 通用大模型,能否成為機器人的“大腦”,讓機器人真正完成現實世界中的複雜任務?但機器人面對的不是可以隨時回滾的代碼,在物理世界裡,環境持續變化、狀態無法完全觀測,動作一旦發生也很難輕易撤銷,抓取、裝配、插拔等精細操作更需要專門的模型與控制能力。

物理世界中的智能體,不只是“想明白”,還必須“看得見、做得到、反應快”,並且“記得住”。今天,由清華大學、無問芯穹、正行創新聯合發起的具身智能體基礎設施RPent正式開源。RPent面向真實物理世界,將通用大模型的任務理解與規劃能力、VLA等專家模型的精細操作能力,以及記憶、工具和機器人接口連接起來,形成從感知、決策、執行到反饋糾錯的完整閉環,使智能體能夠持續適應環境變化,並將經過驗證的經驗沉澱為可複用的能力,在與物理環境的持續交互中不斷學習和進化。在LIBERO-PRO基準測試中達到92.6%的任務成功率,並將端到端任務完成速度優化7倍以上。

RPent由大規模具身強化學習框架RLinf的核心團隊打造,延續了該團隊在具身智能基礎設施領域的技術積累。開源代碼鏈接:https://github.com/RLinf/RPent RPent真機效果展示:從“會動”到“會做事” 在這一視頻中,RPent展示了多個有趣的開放式任務:機器人將鋼珠倒入碗中,雙臂協同擦拭盤子,還會主動移開遮擋物,找到藏在碗下的勺子。值得注意的是,這些任務並不是為每一種場景單獨訓練一個專用策略。機器人真正發生的變化,是開始從“執行學過的動作”,走向“理解任務、調用能力,並根據環境變化調整行動”。

1、例如,當任務變化為“將乾淨餐具放入紙箱”時,面對同一只藍色盤子,凍結VLA只會沿用訓練時學到的動作,將它錯誤地放入金屬籃中; 而在RPent中,智能體會先觀察當前環境,再根據新的目標選擇放置位置。執行過程中,如果視覺定位出現偏差,它還會檢查結果、排除錯誤目標,並重新定位手中的盤子。任務變了,機器人也能隨之改變行動。2、另一個任務中,機器人需要讀取瓶身和袋子上的品牌標籤,將不同飲料放入對應的袋子。抓起瓶子後,它會先進行小幅試抬,確認夾持穩定; 當原有運動路徑不可行時,再調整腕部姿態繼續執行。接著,面對被碗遮擋的勺子,機器人也不會直接嘗試抓取,而是先移開兩個碗,讓目標重新變得可見、可達。

這裡展示的已經不再是一條預先寫死的動作序列,而是一個完整的“觀察-判斷-執行-糾錯”閉環。3、最後兩個任務則進一步展示了RPent對已有能力的複用。機器人可以將原本用於“拿起並放置容器”的技能重新組合,用於傾倒鋼珠;又把抓取動作與雙臂協同、持續接觸組合起來,完成持盤、擦拭和收納。探索成功後,RPent會把經過驗證的任務邏輯沉澱為任務卡(Task Card);再次執行時,RPent可以啟用Flash Mode,通過任務卡直接複用這套流程,只根據當前視覺狀態做必要調整,避免每一步都重新調用大模型,有效降低了具身智能體執行的延時。

這一整套Demo想展示的,並不是“機器人又學會了幾個動作”,而是一個更重要的問題:當機器人走向開放世界,新的任務、物體和障礙不斷出現時,它能否像人一樣將已有技能重新組織起來,完成訓練分佈之外的任務?RPent所探索的,正是這樣的具身智能體形態。機器人不再只是執行一條固定指令,而是能夠理解目標、調用能力、應對變化,並將一次成功沉澱為下一次可以複用的經驗,這正是具身智能體的雛形。RPent核心設計思路 當前具身智能的發展,正在逐漸呈現兩種不同的技術路線。一條是純VLA端到端。用一個視覺-語言-動作模型直接吃下觀測、吐出動作,精細操作做得很好,但一旦任務變長、語言變花、場景被擾動就迅速退化。

另一條是純大模型Agent(如CAP-X這類工作)。隨著GPT-6這一代通用模型對具身任務的覆蓋率快速提升,大模型直接輸出動作已經能跑通不少任務——但它在亞釐米級的精度、執行時延與“越用越強”這幾件事上仍有明顯短板。

兩條路線之間並非簡單的替代關係,而是對應了不同層次的能力: RPent並不是在兩種路線之間進行折中,更不是讓某一個模型變得無所不能,包辦從任務理解到機械臂控制的全部工作,而是將具身智能拆解為不同層次的能力,讓不同模型各自承擔最擅長的事情: 通用大模型負責理解任務、制定計劃; VLA、WAM等專家模型負責高精度動作執行; 記憶系統沉澱經驗,推動智能體持續優化; 框架負責連接模型、工具與真實環境,形成閉環。由此,它們形成“觀察-規劃-執行-反饋-再規劃”的閉環,讓智能體從一次性執行任務,走向在真實世界中持續成長。

其背後算法,源於團隊於7月份提出的Harness VLA工作(鏈接:https://arxiv.org/abs/2607.08448) 01開放的模塊化架構,讓模型、工具和硬件各司其職 RPent採用開放的模塊化設計,將系統劃分為用戶層、智能層、接口層和環境層四大層級。在用戶層,可以通過交互式命令行或Web Dashboard下達任務,並查看視覺輸入、推理過程和動作軌跡。智能層中的規劃器結合基礎模型、Memory與工具庫拆解任務,動作原語則把VLA、WAM和程序化技能封裝成可調用工具。在環境層和接口層,機器人控制、模型服務和仿真環境可以獨立部署,通過輕量級通信連接。

上層任務邏輯不必綁定某一種機器人或仿真器,新增設備只需實現標準動作、狀態與環境接口。當前RPent已覆蓋LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真環境,以及Franka、雙臂Franka、YAM、SO101等真實設備。用戶層(User Layer):智能體交互入口 用戶層提供類似Claude Code/Codex的交互式CLI,以及可選Web Dashboard。用戶可以下達任務指令,並實時查看智能體推理過程、視覺輸入和動作軌跡,實現對智能決策過程的可觀測及實時交互。

智能層(Intelligence Layer):任務規劃與能力調度中心 智能層由Agentic Planner和Action Primitive組成。Agentic Planner結合基礎模型、Memory和Tool Library,實現任務理解、規劃與工具調用,並通過Agentic Loop完成“規劃 → 執行 → 反饋 → 記憶更新”的持續優化。Action Primitive將VLA、WAM等學習型操作模型,以及Code as Policy等程序化技能統一封裝為標準工具,使大模型負責複雜任務理解與規劃,專家模型負責高精度動作執行,從而兼顧泛化能力與操作精度。

接口層(Interface Layer):統一連接模型與機器人 接口層將智能體決策轉換為機器人可執行指令,為不同設備提供統一調用接口,包括動作執行、狀態讀取、環境渲染和設備復位等能力。無論是真實機器人還是仿真平臺,上層Agent、提示詞和工具均無需針對設備重新開發,實現跨機器人、跨環境遷移。環境層(Environment Layer):連接真實與仿真世界 環境層負責任務執行,目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真環境,以及Franka、雙臂Franka、YAM等真實設備。新增機器人只需作為獨立模塊接入robots/ 目錄,即可被框架自動識別和調用。

此外,智能層與環境層採用獨立進程架構,支持模型服務、機器人控制和仿真環境的獨立部署、遷移與重啟,為持續研發和長期運行提供工程保障。通過模塊化架構與統一接口設計,RPent不綁定單一模型或機器人,而是構建了一個開放、可擴展的具身智能基礎設施,讓不同模型、技能與硬件能夠靈活組合、高效協同。同時,每一次任務執行產生的反饋都可以沉澱到記憶系統,為後續任務提供經驗支持,使智能體在真實環境中持續學習與優化,將智能體的能力從“一次性部署”推向了“持續演進”。02統一接口設計,讓智能體以標準方式連接物理世界 在數字世界中,Agent的能力邊界很大程度上取決於它能調用哪些工具。

MCP的出現,讓大模型可以通過統一的工具協議訪問搜索、代碼、數據庫等數字資源。但進入物理世界之後,問題變得複雜得多。機器人、相機、傳感器、仿真器和各種物理設備都有各自的接口。即使是完成同一個任務,不同機器人也可能使用完全不同的控制方式。如果每接入一種設備,都需要重新開發一套Agent,那麼智能體很難真正規模化擴展。因此,RPent將“工具-機器人-環境”進一步抽象,通過分層接口把智能決策與物理執行解耦。將“大模型決策”與“物理設備執行”連接起來,實現智能體、工具和硬件之間的統一協作。RPent用三層接口把智能決策與設備執行分開: MCP統一描述可調用能力。

無論底層是VLA、程序化技能還是其他工具,規劃器都通過統一定義進行選擇和調用。RPC連接工具、模型服務與機器人環境,使真實設備、仿真平臺、本地進程和遠程服務可以獨立部署。MHS面向更廣泛的物理設備提供統一讀寫與控制抽象,使智能體未來能夠從機器人擴展到實驗儀器、家庭設備和工業系統。(在開頭的真機視頻中展示的Franka和YAM的操控,都來自於統一接口。) 通過MCP、RPC與MHS的分層設計,RPent正在構建一套連接模型、工具、機器人與物理設備的統一接口體系,讓智能體能夠像調用數字工具一樣調用物理能力,從“操作數字資源”進一步走向“操作真實世界”。

03 Memory機制驅動,讓一次成功沉澱為長期能力 能完成一次任務,並不意味著真正擁有了這項能力。在物理世界中,試錯的成本遠高於數字環境。一次失敗的抓取可能需要重新佈置場景,一次錯誤操作甚至可能造成設備損壞。如果每次執行結束後經驗隨即消失,智能體就只能反覆從零開始。RPent的Memory系統希望改變的正是這一點:讓一次探索產生的經驗,成為未來任務執行的基礎。RPent將經驗按複用範圍組織為三層記憶,併為記憶記錄適用範圍、類型、可信度和支撐證據。新經驗需要經過驗證後才能提高可信度;相互衝突的記錄會被保留和隔離,避免偶然成功汙染已有能力。

記憶機制中包含Recipe,也就是可遷移的任務方案,而不是某一次執行中的固定座標。例如,系統可以記錄“先根據任務描述和當前畫面確認目標,再調整夾爪位置,調用VLA完成抓取,並檢查抓取結果”的操作過程。當物體位置改變時,智能體重新觀察環境,再複用相同邏輯,而不是直接沿用原來的座標。探索模式允許更新記憶;評測模式只讀使用已經凍結的經驗,使演進過程更加可控。在LIBERO-Pro Goal實驗中,引入記憶機制後,RPent在任務擾動環境下表現出明顯提升:在位置交換任務中,成功率從31.0%提升至87.0%。此外,RPent支持記憶資產分發。

一次探索產生的經驗可以同步至其他智能體,使單個智能體獲得的能力能夠成為整個系統持續進化的基礎。通過Memory系統,RPent將智能體從“一次性完成任務”推進到“持續學習和積累經驗”。智能體的能力不再完全依賴模型預訓練,而是在真實世界交互中不斷增長。04開啟Flash Mode,讓智能體跟上物理世界節奏 將大模型引入機器人控制迴路,為智能體帶來了更強的理解和規劃能力,但也帶來了新的挑戰。大模型推理速度通常遠慢於機器人動作執行速度。在物理環境中,等待模型生成下一步決策可能成為整個系統的主要延遲來源。

因此,RPent並不是單純追求更快的大模型,而是通過架構優化減少不必要的調用,讓智能體運行節奏更加貼近真實世界。在實際應用中,大量機器人任務具有較強重複性:任務目標和執行邏輯基本穩定,變化的主要是物理位置、姿態和環境狀態。對於這類任務,如果每次都從頭進行完整規劃,無疑會產生大量重複推理。RPent通過Flash Mode來解決Agentic Planner應用於真機的這一加速問題,其核心技術載體是任務卡(Task Card)。在探索階段,RPent允許規劃器調用大模型、VLA和程序化技能,嘗試不同動作組合,並將成功且經過驗證的任務流程壓縮為Task Card。

Task Card保存任務階段、動作原語、關鍵目標與檢查條件,不保存只能在一次場景中使用的固定座標。進入Flash Mode後,系統優先按照Task Card執行:視覺模塊重新定位關鍵物體,執行模塊根據當前狀態調整動作;只有在檢查失敗、環境偏離或流程無法繼續時,才重新調用規劃器處理。這樣既保留了大模型應對變化的能力,也避免在穩定流程中反覆進行高成本推理。在LIBERO Object的200次評測中,開啟Flash Mode將平均執行時間從283.6秒降低至40.9秒,在成功率僅下降3.5個百分點的情況下,實現約7倍加速。

這也是開頭真機視頻中Flash Mode的技術含義:把探索得到的成功方案轉化為可以快速複用、同時保留環境適應能力的執行流程。RPent將已經驗證的任務邏輯沉澱下來,在環境發生變化時僅做必要調整,讓具身智能體從“每次重新規劃”走向“經驗複用執行”——不只是記住過去做過什麼,更能將已有經驗轉化為更高效的行動。05 Leaderboard:展示模型與系統協同後的能力 社區當下對於Agentic Planner存在相同的問題:到底進展到哪一步了?為了回答這個問題,RPent推出了Leaderboard板塊(https://rpent.readthedocs.

io/zh-cn/latest/rstsource/leaderboard.html),採用不同技術路線、不同基座模型的方案在性能和延時的對比一目瞭然。△性能Leaderboard:目前展示了LIBERO-Pro、LIBERO、RoboCasa365 Target50與RoboTwin △延時Leaderboard:目前展示了LIBERO-Pro、RoboCasa365與RoboTwin GPT-6 Astra在RPent中展現出突出的長程任務與擾動適應能力。在更強調指令變化、佈局變化和長程執行的LIBERO-Pro上,RPent/GPT-6 Astra達到92.

63%,相比圖中第二名RPent/Opus-4.7的82.4%高出10.23個百分點;相比πRLinf的50.0%高出42.63個百分點。此外,開啟了Flash Mode的RPent明顯降低了延時。在RoboCasa365 Target50的廚房長程任務中,RPent/GPT-6 Astra達到59.20%,位列圖中第一,高於RPent/GPT-5.5的57.1%。這說明更強的基礎模型經過RPent的工具組織、記憶與執行閉環後,能夠有效轉化為物理任務能力。其餘榜單也顯示了RPent對不同模型與執行配置的兼容性:RPent/Opus-4.7在LIBERO達到96.0%;RPent/GPT-5.

5在RoboTwin達到62.4%,均處於圖中領先位置。結果更值得關注的不是某一個模型單獨完成了全部控制,而是通用模型、專家模型、工具和記憶系統可以在同一框架內協同發揮作用。為物理世界中持續進化的智能體,構築開放的基礎設施 從Codex、Claude Code到RPent,AI正在從“在數字世界完成任務”,走向“在物理世界完成任務”。當智能體走向真實世界,變化的不只是模型能力的邊界,也包括支撐這種能力運行的基礎設施形態。機器人需要看見環境、理解任務、調用不同能力、完成精細動作,還需要根據真實反饋不斷調整策略,並把已經驗證過的經驗保留下來。

所以,圍繞這一完整過程來組織智能體系統的RPent,並非只是一個開源的“讓大模型控制機器人”的框架,而是一套能夠連接模型、工具、機器人與環境,並支持智能體在真實世界中持續運行、積累經驗和不斷遞歸演進的智能中樞。從一次任務,到一類任務;從一次執行,到持續進化。RPent所代表的,正是大模型真正走進物理世界之後,需要重新構建的下一層基礎設施。開源地址:https://github.com/RLinf/RPent *本文系獲授權刊載,觀點僅為原作者所有。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放

AI資訊AI新聞資訊正文Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放發佈於AI新聞資訊發佈時間 :2026年9月21號 16:12閱讀 :1分鐘Kimi Code 桌面客戶端 macOS 和 Windows 版同步上線,用戶訪問 kimi.com/code 即可開始安裝使用。針對開發者的實際工作流,桌面端提供內置終端、瀏覽器和 Git 狀態查看等功能,支持直接運行和調試項目、審閱代碼改動,並可關聯 PR 狀態,方便跟蹤代碼評審與合併進度。相關推薦法國興業銀行押注 AI:預計最多省下 6 億歐元成本法國興業銀行稱,AI應用擴大將帶來可觀降本空間,潛在規模約5億至6億歐元,其中已規劃到2029年實現約3.5億歐元降本。該行與Anthropic戰略合作,分批部署Claude模型。2026年9月21號 16:1476.8k特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速特斯拉得州超級工廠Optimus人形機器人生產設施建設取得新進展:無人機拍攝顯示,主體鋼結構已接近建築北側邊緣,距北側外圍梁約5個柱網;廠房上方三層結構正進行混凝土澆築。該工廠規劃年產能達1000萬臺,預計2027年晚些時候啟動生產。2026年9月21號 9:58147.0k階躍甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把開源旗艦的性價比邊界往外推了一格階躍全量開放旗艦基座 Step5Preview,定位真實世界 Agentic 任務主力模型。它針對能力、效率、成本三角難題,採用稀疏 MoE 架構外推帕累託前沿。模型總參數達600B,每次激活更少參數以平衡性能與成本。2026年9月21號 9:52139.5kOpenAI 一次性攤開六份失準報告:模型越界不再是偶然,而是三種可復現的機制OpenAI近日發佈模型失準披露框架及六份真實報告,公開

剛剛

法國興業銀行押注 AI:預計最多省下 6 億歐元成本

AI資訊AI新聞資訊正文法國興業銀行押注 AI:預計最多省下 6 億歐元成本發佈於AI新聞資訊發佈時間 :2026年9月21號 16:14閱讀 :1分鐘據彭博社報道,法國興業銀行(Societe Generale SA)預測,人工智能應用範圍不斷擴大,將為該行的降本工作帶來可觀貢獻。這家總部位於巴黎的銀行表示,藉助 AI 實現降本的當前潛在空間介於 5 億至 6 億歐元(約合 38.47 億至 46.16 億元人民幣)之間。其中,到 2029 年為止已經落實規劃的降本規模約為 3.5 億歐元(約合 26.93 億元人民幣)。與 Anthropic 戰略合作,分批部署 Claude法國興業銀行稱,該行將得益於與美國 AI 巨頭 Anthropic 開展的戰略合作,合作內容包括持續分批部署其 Claude 大模型。該行認為,AI 可以在多個業務領域釋放潛力:自動生成報告、關鍵績效指標監控、削減代碼開發成本,以及擴充面向客戶的諮詢服務能力。銀行業普遍押注 AI,崗位或縮減兩成不少銀行都表態,人工智能將在提升運營效率方面發揮越來越重要的作用,少數機構甚至已經據此預判了對就業崗位的影響。摩根士丹利分析師今年早些時候估算,受 AI 因素影響,歐洲銀行業的員工規模最高可能縮減五分之一。本次相關表態是法國興業銀行首席執行官斯拉沃米爾·克魯帕(Slawomir Krupa)為提升盈利能力所作承諾的一部分。克魯帕還於週一公佈了新一輪削減成本計劃;部分降本舉措預計將通過裁員完成,但他並未披露具體的裁員規模。相關推薦Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放Kimi Code桌面客戶端同步上線macOS和Windows版,訪問kimi.com/code即可安裝。其面向開發者工作流,內置終端、瀏覽器和Git狀態查看,支持運行調試項目、審閱代碼改動,並可關聯PR狀態跟

剛剛
IT之家生成式AI

AI 幫銀行省錢:法國興業銀行預計最多可省下 6 億歐元成本

作者:遠洋 責編:遠洋 評論: 9 月 21 日消息,據彭博社報道,法國興業銀行(Societe Generale SA)預測,人工智能應用範圍不斷擴大,將為該行的降本工作帶來可觀貢獻。這家總部位於巴黎的銀行表示,藉助人工智能實現降本的當前潛在空間介於 5 億至 6 億歐元(注:現匯率約合 38.

剛剛
量子位生成式AI

國產數據庫跑出AI新能力!OceanBase登頂國際Data Agent榜單

OceanBase團隊提交的Data Agent方案登頂國際數據智能體基準Data Agent Benchmark 近日, OceanBase團隊提交的Data Agent方案登頂國際數據智能體基準Data Agent Benchmark(簡稱DAB),以90.62%的準確率位列第一,成為該榜單首個準確率突破90%的參評方案。

剛剛