大曉聯合香港大學發佈StreamPI,讓 VLA 真正理解時間,邁向連續物理智能

2026年8月28日 07:17
站內 AI 整理稿

大曉聯合香港大學正式對外發表一項名為 StreamPI 的最新研究成果。這是一款專門聚焦於視覺-語言-行動(VLA)模型的創新技術,目標是針對機器人系統長期以來在時間理解能力上的不足,提出一套全新的解決方案。研究團隊表示,這項成果試圖從根本層面,補齊機器人認知架構中一塊關鍵的拼圖,讓機器人不僅能看懂靜態畫面,更能理解動態世界的連續變化。所謂 VLA 模型,指的是結合視覺、語言與行動三大模態的機器人學習架構。近年來,隨著多模態大模型技術的快速進展,VLA 模型已經展現出相當成熟的基礎能力:機器人可以依據人類的自然語言指令,感知周圍環境的物體與空間關係,並直接輸出對應的動作指令。

然而,研究團隊指出,現階段大多數 VLA 模型雖然具備上述能力,卻仍然難以真正掌握物理世界持續變化的本質,這種落差成為機器人在複雜環境中做出精準決策時的主要障礙。研究團隊進一步說明,真正決定機器人下一步該怎麼做的關鍵訊息,往往並不存在於當前那一幀畫面之中,而是隱藏在連續時間的脈絡裡。以實際操作場景來看,一個物體究竟是從哪裡移動過來的、一個杯子在畫面切換之前蓋住了什麼東西、一隻機械臂當下到底正在接近還是遠離它的目標,這些帶有過程性質的細節,幾乎都無法單純從一張靜止的幀畫面中判斷出來。若機器人只能依賴瞬間影像來理解世界,便容易在動作銜接與意圖判斷上出現嚴重落差。

StreamPI 的核心突破,正是在於讓模型不再只是「觀看當下」。這套方法引入了沿時間軸追蹤變化的機制,使模型能夠將視覺訊息視為一段連續流動的過程,而不是一連串彼此孤立的靜態快照。透過這種時間維度的感知能力,機器人可以在動作執行的同時,持續累積對環境變化的理解,進而更完整地掌握眼前場景的前因後果。這項設計讓模型在面對動態環境時,不再只是被動地反應眼前畫面,而是能夠基於時間脈絡做出更具連續性的判斷。研究團隊強調,這種對時間的感知能力,是通往所謂「連續物理智能」的關鍵基礎。物理世界的運作邏輯本質上就是連續的:物體不會無緣無故出現或消失,所有狀態的改變都來自於一系列過程的累積。

如果機器人無法理解這些過程,便難以在真實世界中勝任複雜任務。StreamPI 的問世,正是要讓機器人從「能看見」進化到「能理解」,從對空間的感知延伸到對時間的感知。從技術層面來看,StreamPI 的設計思路也反映出近年來機器人學習領域的一種重要趨勢,也就是將時間建模視為與空間感知同等重要的核心能力。過去,視覺模型大多專注於在單幀影像中提取語意訊息,但真實世界中的機器人面對的卻是不斷流動的場景。研究團隊認為,唯有讓模型在時間維度上建立起連貫的表徵,機器人的動作決策才能更接近人類的直覺判斷,也才能在更廣泛的應用場景中展現真正的自主性。

這項研究成果的公布,為機器人領域提供了一個明確的思考方向:未來的 VLA 模型若要走向更高階的智能表現,勢必得在時間理解上有所突破。StreamPI 所提出的框架,不僅解決了眼前的技術瓶頸,也為後續相關研究鋪設了一條可行的路徑。隨著機器人逐步進入更複雜、更貼近人類生活的應用場域,如何讓它們理解世界的連續性,將成為決定系統實用價值的關鍵因素之一。大曉與香港大學此次的合作成果,正是朝這個方向邁出的重要一步。

Related

相關文章

專訪商湯首席科學家林達華:多模態的湧現時刻會在一兩年內到來

40分鐘前機器人賽場開始淘汰“偏科生”3小時前閱讀更多內容,狠戳這裡查看AI測評DeepSeek商湯日日新點點選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇CHIC 2026觀察:DADE Capital的產業AI棋局,從依明科技首秀開始浮現依明科技攜服裝產業AI亮相CHIC展重構產業秩序1小時前關於城市合作項目推薦我要入駐投資者關係商務合作關於我們聯繫我們加入我們歐洲站歐洲站歐洲站Ai產品日報網絡謠言信息舉報入口熱門推薦熱門資訊熱門產品文章標籤快訊標籤合作伙伴APP下載iOS & Android本站由 阿里雲 提供計算與安全服務 違法和不良信息、未成年人保護舉報電話:010-89650707 舉報郵箱:jubao@36kr.

剛剛

全球超萬個創業項目廝殺,HICOOL 2026揭榜!北京攢了多大一盤棋?

作者 | 李水青 編輯 | 漠影 8月28日報道,8月26日晚8時,HICOOL 2026全球創業者峰會在中國國際展覽中心(順義館)開幕。 200個獲獎項目集體亮相,AI、機器人、醫藥健康、量子信息、生物技術等前沿領域的硬科技項目登臺;四項重磅發佈接連亮相:全球創業趨勢洞察報告發布,全球創業服務聯盟成立並啟動全球OPC支持計劃,全景數字生命國際大科學計劃發起籌備,機器人自主進化學院預發佈…… 這場屬於全球創業者的“嘉年華”,用一個夜晚集中展示了HICOOL如何把創新創業從源頭推向產業。

2 小時前

一段視頻,讓機器人學會開門並穿越:Video2DoorTraversal 如何打通 Real-to-Sim-to-Real

對人來說,推門近乎是一種下意識動作。對移動操作機器人來說,這是一道把感知、移動、操作和控制綁在一起的綜合題。機器人需要找到並靠近把手,完成接觸與旋轉,在門體移動時協調底盤、機械臂和夾爪,還要避開門框、連續穿過狹窄門口。任何一步出現誤差,都可能讓整段任務中斷。

4 小時前
何夕2077研究與前沿

StreamPI補上時序

機器人模型近年來在視覺語言動作(VLA)領域進展迅速,但單幀模型往往缺乏對時間序列的掌握,難以應付需要連續判斷的真實世界操作。根據業界消息指出,一項名為「StreamPI」的新框架正試圖補上這塊缺口,透過機器人時序框架的設計,讓原本只處理單一畫面的VLA模型也能具備「流式記憶」,也就是在動作決策時能參考過去一段時間的觀察與狀態,而非只看當下瞬間。 這項進展對機器人實務應用格外關鍵。

12 小時前
何夕2077研究與前沿

代碼世界模型亮相

據消息指出,代號「代碼世界模型」的人工智慧模型近日正式對外亮相。這則動態由「」在AI資訊日報中提及,消息本身雖然十分簡短,但「代碼世界」的命名引人聯想,是否代表該模型將專注於程式碼的理解、生成或執行,成為外界討論的起點。 消息中並未進一步說明模型背後的開發單位、技術架構或實際應用場景,僅以「亮相」作為關鍵資訊。

12 小時前