雷峰網生成式AI

智源悟界·RoboBrain Orca:AI進入Next State Prediction時代

2026年7月8日 03:35

重點摘要

大語言模型學會了預測“下一個詞”,於是有了會寫代碼、會做題、會對話的ChatGPT、DeepSeek、Qwen。視頻生成模型學會了預測“下一幀”,於是有了越來越逼真的圖像和視頻生成模型,例如Seedance、Sora。具身模型學會了預測“下一個動作”,於是機器人開始能完成越來越複雜的任務。

站內 AI 整理稿

大語言模型學會了預測「下一個詞」,於是誕生了能寫程式、解題、對話的 ChatGPT、DeepSeek、Qwen;影片生成模型學會了預測「下一幀」,讓 Seedance、Sora 等工具生成越來越逼真的影像與動畫;具身模型學會了預測「下一個動作」,機器人因此能執行日趨複雜的任務。如今,智源研究院推出的「悟界·RoboBrain Orca」要跨出更底層的一步——讓人工智慧在「腦海中」形成一個能高度濃縮當前世界狀態的表徵,並基於此表徵建模世界狀態向前與向後的演化。這正是悟界·RoboBrain Orca 作為多模態表徵世界模型的核心哲學:「The World is in Your Mind」。

從預測「下一個具體模態輸出」到預測「下一個世界狀態」,悟界·RoboBrain Orca 的運作邏輯截然不同。當它看到一段影片、一張圖片、一句指令或一段事件描述時,模型會在內部先建立一個統一的世界潛在表徵空間。這個空間就像 AI 腦海中的世界模型,能將視覺、語言、事件、任務意圖等多模態信號組織起來,學習物體如何運動、場景如何變化、動作會帶來什麼後果,以及事件間的因果關係。更重要的是,模型能判斷當前狀態如何走向未來狀態,甚至在某些條件下,世界是否會朝另一個方向演化。

簡言之,悟界·RoboBrain Orca 的核心轉變就是從 Next Token / Next Frame / Next Action 邁向 Next State Prediction。這套技術哲學的核心步驟是先利用多模態世界信號學習世界表徵,再以此表徵為基礎完成所有任務。為此,悟界·RoboBrain Orca 將世界學習拆成兩條互補路徑:無意識學習與有意識學習。無意識學習的概念就像嬰兒觀察自然世界——看到東西掉落、人走動、門被推開、球滾到桌子下面,這些經驗並非透過標籤習得,而是連續觀察真實世界所累積。

悟界·RoboBrain Orca 也以同樣方式客觀地觀看世界,透過海量真實世界的影片,先讓模型學會「世界自己怎麼動」。另一方面,有意識學習則是主觀地與世界互動,利用語言描述的事件、任務指令以及 VQA(視覺問答)問答,幫助模型學習稀疏但具有具體意義的狀態轉移。支撐這套架構的數據規模相當龐大。悟界·RoboBrain Orca 使用了 12.5 萬小時的影片,以及 1.6 億條事件標註,預訓練過程持續進行擴展(Scaling)。研究團隊指出,隨著訓練數據的增加,模型在下游任務上的能力也隨之提升,具備持續成長的潛力。

更關鍵的是,悟界·RoboBrain Orca 學到的世界表徵可以透過多種解碼器讀取出來,應用在不同類型的任務上。在文本解碼方面,悟界·RoboBrain Orca 擅長理解狀態轉移以及動態運動的推理;在影像解碼方面,模型能展現真實場景中的交互預測能力;在動作解碼方面,儘管預訓練階段完全沒有接觸過動作標籤,它仍能幫助下游機器人任務獲得更好的泛化表現。這意味著悟界·RoboBrain Orca 所學習的「世界表徵」並非專屬於某一種模態,而是一個可跨模態使用的通用基礎。這套世界學習範式有可能從具身智慧進一步延伸至科學發現、複雜系統建模,甚至更廣闊的認知邊界。

悟界·RoboBrain Orca 目前仍是多模態表徵世界模型的早期版本,但研究團隊認為,它有望成為通用世界基礎模型的一塊重要基石。當 AI 不再只是預測下一個詞或下一幀,而是能理解世界狀態如何流變,許多過去被視為艱鉅的任務——如機器人在真實環境中自主導航、醫學影像的因果推論、甚至物理模擬——都將迎來全新的突破契機。這項成果揭示了人工智慧發展的一個新方向:不再執著於模態對應模態的預測,而是回歸到對世界本質的理解。悟界·RoboBrain Orca 的問世,不僅為具身機器人帶來更強大的認知基礎,也為未來通用人工智慧的實現鋪設了一條可行的路徑。

隨著訓練數據持續增加、模型架構不斷優化,世界有望看到更多基於「下一狀態預測」的突破性應用。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

39 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前