讓AI研發下一代機器人!成立三個月登頂物理AI評測榜單,押注Physical RSI
作者 | 許麗思 編輯 | 漠影 9月24日報道,物理智能公司Simate硅基夥伴,剛剛交出了一份成立三個月以來的亮眼技術答卷。據Simate披露,其利用AI自動研究系統AutoResearch參與研發的通用物理快系統模型,已登頂物理AI智能評測榜單RoboDojo,並通過真機展示了複雜長程任務執行、記憶、高精度操作等能力。這家公司已完成累計數億元融資,核心團隊彙集了自動駕駛端到端量產、世界模型及人形機器人控制等領域的技術人才。在技術路線選擇上,Simate將目光投向了一個近期備受關注的研究方向:讓AI參與下一代AI的研發。
就在前幾天,Anthropic披露,截至2026年8月,Claude已經能夠在人類監督下“主導”約26%的AI研發工作。Simate正在做的,就是將類似的研發範式引入物理世界,讓AI參與研發下一代機器人智能。該公司提出了Physical RSI(物理智能的遞歸自我改進)路線,嘗試將模型研發、數據處理、實驗評測及真實機器人部署連接起來,讓AI Agent承擔更多科研工作,並利用每一輪研究積累的經驗,持續改進模型與研究方法。
一、一線自動駕駛公司技術負責人創業,集結世界模型、真機控制領域核心人才 Simate創始人張穎,此前在行業某一線自動駕駛公司,如今,他將這些技術與工程經驗帶入物理智能領域,創立SiMate,探索以Physical RSI推動機器人智能的持續迭代。自動駕駛與物理智能有著相似的技術需求:智能系統都需要感知真實環境、作出決策,並根據外界變化持續調整行動。但機器人面對的任務更加多樣。以抓取為例,物體的形狀、材質、擺放位置發生變化,都可能影響機器人的執行效果,對物理世界理解、精細運動控制等能力提出了新的要求。
要將Physical RSI進一步推進至真實機器人能力的持續迭代,Simate還需要補充世界模型、機器人控制等領域的技術能力。為此,Simate集結了來自學術界和產業界的研究人員。其中,佔方能是香港科技大學助理教授、World Mind Lab負責人,研究涉及世界模型、三維感知及物理AI智能,曾在SIGGRAPH、CVPR、ICCV、TPAMI等學術會議和期刊發表超過50篇論文。團隊另一位核心成員是00後青年科學家季馬澤宇,畢業於加州大學聖地亞哥分校,研究方向覆蓋三維感知、靈巧操作及人形機器人全身控制,曾參與通用人形控制器的真機驗證工作。
季馬澤宇還曾任硅谷物理智能公司Assured Robot Intelligence(ARI)創始成員,該公司後被Meta收購。總的來說,這個團隊就形成從基礎模型認知、工程化到物理真機落地的完整閉環,支撐Simate的Physical RSI技術路線。二、讓AI研究機器人,成立數月拿下RoboDojo評測榜一 最近,Simate披露,其通過AutoResearch自動研究系統,以人機共駕的弱RSI範式開展物理智能模型研發,旗下通用物理快系統模型在RoboDojo評測榜單取得第一名。
RoboDojo是一個面向通用機器人操作能力的評測基準,涵蓋泛化、記憶、精細操作、長程任務執行及開放任務等不同維度,能夠從多個角度觀察模型的綜合操作能力。Simate通過真機演示,展示了模型利用歷史信息連續執行、保留歷史觀測,執行“泡茶”這一連續多步驟任務的能力。在長程任務中,機器人需要記住已經完成的步驟、當前任務進展,並根據環境變化決定下一步動作。如果只依靠當前畫面,模型可能無法獲得完成後續操作所需的全部信息;如果持續累積歷史觀測,又會增加實時計算負擔。為此,Simate在通用物理快系統中引入了4D物理感知與記憶機制。
模型通過處理深度、幾何、運動及接觸關係等信息理解物理環境,同時圍繞任務進展、連續狀態追蹤和即時變化反饋組織歷史信息,探索長程任務一致性與實時反應之間的平衡。為了讓更大規模的模型服務於端側實時操作,該公司還探索了高效視覺編碼、時空建模和特徵壓縮等技術。按照規劃,這套物理快系統未來還將與通用推理慢系統協同,向零樣本、少樣本的通用操作推進。具體模型規模及架構仍有待後續技術報告公佈。這些模型成果背後,還有一個值得關注的變化:Simate嘗試讓AI Agent承擔更多機器人模型研發工作。過去,研究人員需要反覆修改模型、調整數據、訓練評測,再根據結果尋找新的優化方向。
Simate開發的AutoResearch,嘗試將這些環節連接起來,讓Agent承擔更多科研執行工作。從AutoResearch的界面來看,這套系統已經不只是簡單的實驗腳本集合。畫面中既出現了“From Experiments to One Policy”的流程看板,也展示了跨場景評測結果頁面,用來管理不同實驗分支、追蹤評測表現,並將多輪實驗逐步匯聚成更穩定的策略。根據研究目標與約束,Agent可以讀取模型代碼、訓練配置及歷史實驗記錄,通過SiPAI修改組件與配置,調用基礎設施完成訓練和評測,再根據結果決定繼續、調整或停止實驗,並將新發現納入下一輪研究。
通過這種方式,Simate嘗試提高科研執行的自動化程度,讓研究人員將更多精力投入假設判斷和關鍵技術決策。其階段性成果也為AI Agent在人類指導下參與物理智能研究,提供了初步的工程驗證。據該公司介紹,AutoResearch目前已對外開放試用,並已有清華、MIT、香港科技大學等高校研究人員使用。三、押注Physical RSI,讓機器人智能持續自我進化 如果AI能夠修改模型、執行實驗,並根據結果調整下一輪研究,那麼再往前走一步,它能否自主發現問題,甚至改進自己的研究方法?這正是Simate探索Physical RSI的核心思路。
RSI全稱Recursive Self-Improvement,即遞歸自我改進,關注智能系統如何利用已有能力改進自身,並讓這些改進進一步提升下一輪的研究與學習能力。圍繞不同研究問題,Simate將RSI研究任務劃分為弱、中、強三類。弱RSI:主要面向邊界明確、反饋週期較短的問題,比如實現一個函數、修改數據處理邏輯,或在固定約束下優化一段計算,自主完成修改、測試與反饋。中RSI:面向需要多階段規劃的人機協同研究,類似改善模型記憶、尋找數據配比,Agent 承擔上下文整理、實現與實驗推進,研究員參與假設篩選、矛盾結果解釋與關鍵取捨。
強RSI:系統面對寬泛目標,例如提升新任務泛化,需要持續理解目標本質、發現值得研究的問題,並在較長時間內保持方向、修正路徑;這目前仍需要資深研究人員主導。Simate強調,這三類劃分主要用於區分研究問題的類型,可以同時存在於一項研發工作中。其長期目標,是逐步減少人類參與,讓模型、工具與研究方法的改進持續增強下一輪研究能力。從弱RSI走向強RSI,關鍵挑戰在於Agent能否從執行既定實驗,進一步發展出自主發現問題、提出有效假設和判斷研究方向的能力,這也構成了自動化科研與更高自主程度科研之間的重要區別。
對此,Simate搭建了一套覆蓋模型框架、數據處理、自動化研究與真實部署的技術體系,為Physical RSI的持續迭代提供支撐。首先是SiPAI可插拔模型框架,通過清晰的模塊邊界、接口及驗證流程,讓Agent能夠理解模型結構、定位需要修改的組件,並在完成改動後執行統一的訓練與評測。SiPAI採用可插拔設計,支持已接入的世界模型、世界動作模型、視覺語言動作模型(VLA)及視覺語言模型(VLM)等架構。例如,當研究目標是改善模型記憶機制時,Agent可以圍繞相關組件開展修改;當問題涉及數據配比時,則可以調整訓練配置。
在此基礎上,團隊探索可遷移的感知與動作表徵,推動模型形成新任務適應、技能組合及意外恢復等能力。但機器人模型的能力提升,最終仍需要經過實際操作驗證。真實物理交互往往需要更復雜的實驗條件,也對科研反饋的速度和可靠性提出了新的要求。為此,Simate利用世界模型與仿真環境提供較快的實驗反饋,再通過真實機器人執行檢驗模型表現,將實際操作中的失敗案例重新納入研究過程。同時,AutoResearch通過模型與數據實驗驗證假設,利用評測結果識別能力瓶頸,推動下一輪數據採集與模型訓練,形成持續迭代的研究閉環。
結語:AI驅動機器人進化,物理智能規模化落地加速 當數據、模型和算力持續Scaling,研究過程本身能否也實現Scaling?Simate正在通過Physical RSI探索這一新的可能。以AutoResearch為切入點,Simate嘗試讓AI Agent參與模型研發、實驗與評測,並將真實機器人運行中的反饋轉化為下一輪研究的依據。據瞭解, AutoResearch 科研平臺已經開啟內測招募。隨著Physical RSI技術路線逐步成熟,機器人有望以更低的研發和部署成本適應更多任務與場景,為物理智能規模化落地探索一條新的路徑。
Related
相關文章

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
AI資訊AI新聞資訊正文谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底發佈於AI新聞資訊發佈時間 :2026年9月24號 15:42閱讀 :1分鐘在 The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊·卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,目前已進入開發流程中的"後訓練初期"。所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。Gemini 4 將成為自去年底 Gemini 3 系列之後谷歌首款下一代旗艦;今年 2 月谷歌發佈了 Gemini 3.1 升級版,此後又推出多款規模更小、成本更低但複雜推理較弱的 Flash 模型。回顧來看,今年 5 月谷歌 CEO 桑達爾·皮查伊曾在 I/O 大會宣佈重大更新 Gemini 3.5 Pro 將於 6 月發佈,但最終並未亮相。卡武克奧盧解釋,Gemini 3 與 3.1 推出後,谷歌沒有繼續發佈 3.5 Pro,而是"稍微退了一步",把精力轉向 Flash 模型,"對我們來說,當時最重要的是儘可能加快學習速度"。他未說明 3.5 Pro 是否被正式取消,但明確當前重點是推出 Gemini 4。已用於內部編程工具,安全測試進行中被問及是否擔心谷歌落後於同行,卡武克奧盧回應稱對團隊"百分之百有信心","我們的團隊強得不可思議,我對團隊有最大的信任,我們始終會站在技術前沿"。目前 Gemini 4 正處於防護機制開發與安全測試階段,谷歌工程師已在內部用其運行 Antigravity AI

消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市
AI資訊AI新聞資訊正文消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市發佈於AI新聞資訊發佈時間 :2026年9月24號 15:44閱讀 :1分鐘據外媒報道,兩位知情人士透露,國內頭部大模型公司DeepSeek的年化收入已突破10億美元大關,相比數月前不足5億美元的水平實現翻倍增長。該業績躍升主要得益於近期產品定價的上調,以及其系列模型在開發者與企業端持續攀升的採用率。DeepSeek首席執行官梁文峰在近期舉辦的投資者會議上披露了這一核心財務數據。此舉被視為在資本市場關鍵節點提振投資人信心的重要舉措——目前DeepSeek正接近完成第二輪融資,並緊鑼密鼓地籌備在上海證券交易所上市。按照規劃,公司目標在10月底前完成本輪融資,計劃募資金額達500億元人民幣(約合75億美元),投後估值預計達到5000億元人民幣。在生成式AI商業化普遍面臨變現與盈利審視的當下,DeepSeek年化收入的高速增長不僅印證了其大模型技術的商業落地能力,高達5000億元人民幣的估值預期與鉅額募資計劃,更將創下國內大模型初創企業一級市場的資本規模新紀錄,對本土AI企業衝刺公開資本市場具有風向標意義。相關推薦谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底谷歌DeepMind負責人卡武克奧盧在AI峰會透露,新一代旗艦模型Gemini 4即將推出,目前已進入後訓練初期,該階段用於提升模型行為可靠性。谷歌跳過3.5 Pro,直接押注Gemini 4,計劃遠早於年底發佈,正加速拿出早期成果。2026年9月24號 15:4278.7k高通聯手 PrismML 發佈 1-bit Bonsai:AI 眼鏡離線識圖,內存佔用降到 1/42026驍龍峰會上,高通與PrismML在驍龍AR1 Gen 1智能眼鏡平臺本地運行20億參數1-bit量化Bonsai視覺模型

OpenAI 發佈 MentalHealthBench:1215 段對話評估 AI 心理健康應對能力
MentalHealthBench 由 80 多名持證心理學家參與制定,包含 5262 條專家評分標準,覆蓋 19 種語言。GPT-6 Astra 得分最高 57.3%,但臨床醫生撰寫的參考回答僅得 38.5%,差距引發深思。#OpenAI# #AI心理健康#

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底
作者:清源 責編:清源 評論: 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。

ChatGPT 移動端上新語音智能體:動動嘴就能寫文檔、總結郵件
據瞭解,Pro 和 Plus 訂閱用戶可在手機上使用"工作"創建文檔、撰寫電子郵件或總結 Slack 消息,還能執行創建網站、製作 PPT、使用雲端瀏覽器等進階操作;Free 和 Go 訂閱用戶則可使用插件與已連接的應用。OpenAI 表示,ChatGPT 的語音對話將提供更豐富的文本輸出,Plus 訂閱用戶可在文本與語音之間輕鬆切換,或者先在手機上處理工作、再轉移到電腦上繼續。

騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間
騰訊混元團隊最新研究把目光投向了一個被忽視已久的老問題:當模型自己生成訓練數據、且rollout生成與訓練本身以不同節奏縮放時,批大小這門手藝該怎麼重做。研究從經典的臨界批大小理論出發,把它重新推演到在線大語言模型強化學習這個新場景。結論很務實:在GRPO和PPO這兩類主流算法裡,只要在擴大批大小的有界範圍內重新調一調學習率,就能保住"每條響應"該學到的東西不被稀釋。