智源悟界·RoboBrain Orca:AI進入Next State Prediction時代
重點摘要
大語言模型學會了預測“下一個詞”,於是有了會寫代碼、會做題、會對話的ChatGPT、DeepSeek、Qwen。視頻生成模型學會了預測“下一幀”,於是有了越來越逼真的圖像和視頻生成模型,例如Seedance、Sora。具身模型學會了預測“下一個動作”,於是機器人開始能完成越來越複雜的任務。
大語言模型學會了預測「下一個詞」,於是誕生了能寫程式、解題、對話的 ChatGPT、DeepSeek、Qwen;影片生成模型學會了預測「下一幀」,讓 Seedance、Sora 等工具生成越來越逼真的影像與動畫;具身模型學會了預測「下一個動作」,機器人因此能執行日趨複雜的任務。如今,智源研究院推出的「悟界·RoboBrain Orca」要跨出更底層的一步——讓人工智慧在「腦海中」形成一個能高度濃縮當前世界狀態的表徵,並基於此表徵建模世界狀態向前與向後的演化。這正是悟界·RoboBrain Orca 作為多模態表徵世界模型的核心哲學:「The World is in Your Mind」。
從預測「下一個具體模態輸出」到預測「下一個世界狀態」,悟界·RoboBrain Orca 的運作邏輯截然不同。當它看到一段影片、一張圖片、一句指令或一段事件描述時,模型會在內部先建立一個統一的世界潛在表徵空間。這個空間就像 AI 腦海中的世界模型,能將視覺、語言、事件、任務意圖等多模態信號組織起來,學習物體如何運動、場景如何變化、動作會帶來什麼後果,以及事件間的因果關係。更重要的是,模型能判斷當前狀態如何走向未來狀態,甚至在某些條件下,世界是否會朝另一個方向演化。
簡言之,悟界·RoboBrain Orca 的核心轉變就是從 Next Token / Next Frame / Next Action 邁向 Next State Prediction。這套技術哲學的核心步驟是先利用多模態世界信號學習世界表徵,再以此表徵為基礎完成所有任務。為此,悟界·RoboBrain Orca 將世界學習拆成兩條互補路徑:無意識學習與有意識學習。無意識學習的概念就像嬰兒觀察自然世界——看到東西掉落、人走動、門被推開、球滾到桌子下面,這些經驗並非透過標籤習得,而是連續觀察真實世界所累積。
悟界·RoboBrain Orca 也以同樣方式客觀地觀看世界,透過海量真實世界的影片,先讓模型學會「世界自己怎麼動」。另一方面,有意識學習則是主觀地與世界互動,利用語言描述的事件、任務指令以及 VQA(視覺問答)問答,幫助模型學習稀疏但具有具體意義的狀態轉移。支撐這套架構的數據規模相當龐大。悟界·RoboBrain Orca 使用了 12.5 萬小時的影片,以及 1.6 億條事件標註,預訓練過程持續進行擴展(Scaling)。研究團隊指出,隨著訓練數據的增加,模型在下游任務上的能力也隨之提升,具備持續成長的潛力。
更關鍵的是,悟界·RoboBrain Orca 學到的世界表徵可以透過多種解碼器讀取出來,應用在不同類型的任務上。在文本解碼方面,悟界·RoboBrain Orca 擅長理解狀態轉移以及動態運動的推理;在影像解碼方面,模型能展現真實場景中的交互預測能力;在動作解碼方面,儘管預訓練階段完全沒有接觸過動作標籤,它仍能幫助下游機器人任務獲得更好的泛化表現。這意味著悟界·RoboBrain Orca 所學習的「世界表徵」並非專屬於某一種模態,而是一個可跨模態使用的通用基礎。這套世界學習範式有可能從具身智慧進一步延伸至科學發現、複雜系統建模,甚至更廣闊的認知邊界。
悟界·RoboBrain Orca 目前仍是多模態表徵世界模型的早期版本,但研究團隊認為,它有望成為通用世界基礎模型的一塊重要基石。當 AI 不再只是預測下一個詞或下一幀,而是能理解世界狀態如何流變,許多過去被視為艱鉅的任務——如機器人在真實環境中自主導航、醫學影像的因果推論、甚至物理模擬——都將迎來全新的突破契機。這項成果揭示了人工智慧發展的一個新方向:不再執著於模態對應模態的預測,而是回歸到對世界本質的理解。悟界·RoboBrain Orca 的問世,不僅為具身機器人帶來更強大的認知基礎,也為未來通用人工智慧的實現鋪設了一條可行的路徑。
隨著訓練數據持續增加、模型架構不斷優化,世界有望看到更多基於「下一狀態預測」的突破性應用。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。