大曉機器人聯合香港大學發佈StreamPI,重構機器人時序智能
大曉機器人宣布攜手香港大學,正式發表一項名為 StreamPI 的連續物理智能研究成果。這項技術主要針對當前視覺語言行動模型(VLA)長期存在的「單幀智能」瓶頸提出解方,被視為補上機器人決策過程中「時間維度」的關鍵一步。過去,許多機器人模型在運作時,僅能針對當下接收到的畫面進行判斷,缺乏對連續動作以及歷史狀態的整合能力,導致機器人在執行較為複雜的任務時,常常無法有效串起前後步驟,StreamPI 的提出,正是希望從根本改變這個長期以來的限制,讓機器人在實際執行動作的過程中,能夠真正「記得」自己在做什麼、做過什麼。
長期以來,VLA 模型的發展雖然讓機器人在視覺理解與語言指令跟隨上有了長足進步,但一個始終未被完整解決的問題在於:模型的判斷依據往往局限於單一時間點的靜態資訊。這樣的做法在面對靜止或簡單場景時或許足夠,但一旦進入需要連續動作的真實世界,機器人便容易因為缺乏對前一秒動作的掌握,而產生判斷失準或行為不連貫的情況。StreamPI 的設計理念,正是試圖打破這種片段式的感知模式,為機器人的認知系統注入時間上的連續性。根據研究團隊所公布的實驗結果,StreamPI 在真實機器人平台,以及 LIBERO、CALVIN 等公開基準測試中,均展現出顯著的能力提升。
特別是在時序記憶、精細空間操作,以及長程連續任務等項目上,StreamPI 的表現比起既有方法更為突出。這意味著,導入 StreamPI 的機器人不僅能看懂眼前的環境,更能將多個步驟之間的因果關係串聯起來,在需要逐步完成複雜操作的情境下,維持更穩定且合理的行為表現,大幅提升了機器人應對真實世界任務的可靠性。進一步觀察這些實驗成果,可以發現 StreamPI 的核心價值,在於它改變了機器人理解任務的方式。
過往模型在處理多步驟任務時,往往像是每一次決策都是從零開始,缺乏對整體進程的掌握;而 StreamPI 則讓機器人建立起一種對「過程」的認知,使其在執行任務時,能夠清楚知道自己已經完成了哪些步驟,下一步又該銜接什麼動作。這種對連續狀態的掌握,正是機器人能否在複雜環境中流暢運作的關鍵,也是這項技術在測試中表現突出的主要原因。從架構運作的角度來看,StreamPI 的核心機制在於讓資訊隨機器人的持續行動不斷流動。具體而言,新的環境訊息會被即時寫入系統,而重要的歷史狀態則會被保留,每一次的當下決策,都會建立在先前累積的狀態之上,由此形成一個具連續性的感知與行動迴路。
這種設計讓機器人的行為不再是孤立的單點反應,而是一連串具有前後關聯性的決策過程,使得整體動作序列更加協調。這與傳統靜態判斷模式最大的差異,在於 StreamPI 賦予了機器人一種動態的記憶能力。它不再是每次看到畫面時才開始思考,而是在動作持續進行的過程中,不斷更新與累積對任務狀態的理解。這讓機器人在執行長鏈結任務時,能夠克服「做到後面、忘了前面」的困境,確保每個動作都能在完整的脈絡下被執行,進而提升任務成功率與動作的精準度。當然,作為一項仍在持續演進的研究,StreamPI 目前也並非毫無限制。
研究團隊坦言,在超長時間跨度的訓練情境,以及極端異步的輸入場景下,StreamPI 仍有進一步優化的空間。這說明了連續物理智能在面對現實世界高度複雜且不可預測的環境時,仍存在許多待克服的挑戰。不過,研究團隊也表示,未來將持續從架構與演算法層面著手,朝向更穩健的連續智能方向推進。整體而言,StreamPI 的發表為機器人時序智能的發展指出了一個明確的方向。在機器人逐漸從實驗室走向工廠、倉儲、家庭等真實應用場域的過程中,如何讓機器人具備更接近人類的連續感知與決策能力,已成為產業關注的焦點。
大曉機器人此次與香港大學的合作,不僅展現了學研與產業結合的成果,也為機器人如何在時間維度上理解與行動,提供了全新的思考路徑。可以預見,隨著連續物理智能相關技術持續成熟,未來機器人將不再只是被動接收指令的執行工具,而是能夠在時間流中持續感知、記憶與決策的智慧系統。StreamPI 作為這條道路上的重要一步,其實驗成果與未來發展,都值得機器人領域的研究者與產業界持續關注。
Related
相關文章

世界模型成了具身智能的新風口
世界模型近期成為具身智能領域的新風口,業界希望讓機器人先在內部模擬與預測環境動態,再規劃行動,以應對未見過的情境。然而核心技術路線仍有分歧,包括與視覺語言動作模型(VLA)的定位分工,以及訓練所需的真實操作數據成本高昂、合成數據遷移效果未明等挑戰,整體尚未形成共識。

機器人賽場開始淘汰“偏科生”
機器人競賽的評判標準已從單一強項轉向全面均衡,只在特定領域突出的「偏科生」開始被淘汰。北京人形機器人藉由技術研發與落地應用、本體能力與智慧系統的同步推進,在全面性考核中取得領先優勢。

“羞答答”的機器人奪冠背後,熊友軍聊了聊人形機器人的下一程
一場名為「羞答答」的機器人競賽近日落幕,冠軍背後藏著的是人形機器人產業對下一階段的深刻思考。身為優必選科技創辦人暨前技術長、現任大象機器人董事長熊友軍,在賽後分享了對人形機器人未來發展路徑的觀察,他認為,技術突破固然重要,但場景落地與商業化節奏才是決定產業能走多遠的關鍵。 熊友軍指出,外界看待人形機器人,往往容易被炫目的運動能力或外觀設計吸引,但真正困難且珍貴的,是讓機器人在動態環境中穩定完成任務。這次比賽中冠軍隊伍的表現,恰恰體現了工程整合與軟體演算法的扎實功力。
大曉聯合香港大學發佈StreamPI,讓 VLA 真正理解時間,邁向連續物理智能
當 VLA 模型理解語言、感知環境並直接生成機器人動作,一個更基礎的問題開始浮現:機器人如何理解一個持續變化的物理世界?物體從哪裡移動而來、杯子此前遮住了什麼、機械臂正在接近還是遠離目標——真正決定下一步動作的信息,往往不只存在於當前一幀,而存在於連續的時間之中。

甩掉遙控器,超越博爾特,“硅基”邁入全自主時代:沒有“人”的“機器人”該如何奔跑
人形機器人的發展正迎來一個關鍵轉折點。過去很長一段時間,這類機器人出現在公眾視野中時,往往需要工程師在背後手持遙控器,或是依靠預先寫好的程序在固定場景中完成表演性質的動作。然而,隨著人工智能大模型與具身智能技術的快速融合,機器人正在逐步擺脫人類的「牽引」,從被動執行指令的裝置,蛻變為能夠自主感知、思考與行動的智能體。行業內將這一階段的到來視為「硅基生命」真正邁入全自主時代的開端。 所謂的「全自主」,並不僅僅是讓機器人自己站起來走路那麼簡單。

Figure用一款APP建立全球「數據採集經濟體」,中國具身企業誰會搶先跟進?
Figure 推出 APP 收集家庭日常活動數據,形成新的「數據採集經濟體」,以低成本獲取人類動作示範來加速人形機器人訓練。此舉為中國具身智能公司提供新思路,但能否落地取決於隱私保護、數據品質與激勵機制的成熟度。