考拉悠然無界再登WorldArena 2.0全球前列,兩項核心指標全球第一

2026年9月20日 03:05
站內 AI 整理稿

9月16日,WorldArena 2.0全球終榜揭曉,考拉悠然旗下悠然無界世界模型在Track 1視頻質量賽道獲得全球第二,並在Background Consistency與JEPA Similarity兩項核心指標中位列第一。在看來,這進一步驗證了其在長時場景一致性、狀態演化與物理規律建模方面的能力。基於結構化4D世界建模、動態場景記憶等技術,悠然無界正進一步與Geek Mind具身大腦結合,將世界模型能力從榜單評測延伸至工業巡檢等真實場景,推動具身智能從“能推演”走向“能執行、能複製”。9月16日,WorldArena 2.0全球終榜正式揭曉。

考拉悠然旗下悠然無界世界模型在Track 1(視頻質量賽道)中綜合得分位列全球第二。本次評測彙集了來自阿里巴巴、中國科學院等頂尖科技企業、科研機構及具身智能獨角獸公司的80個模型,圍繞世界模型的視頻生成質量、時序一致性與物理演化能力展開統一評估。在多項核心指標上,悠然無界世界模型同樣展現出領先性能。其中,Background Consistency(背景一致性)位列第一。長視頻生成最常見的失效是場景漂移——推演到幾十幀後,背景的紋理、光照或物體擺放在無聲中發生改變;這一指標居首,意味著模型能在整段生成過程中穩定維持全局環境與場景佈置。

更具含金量的是 JEPA Similarity 位列第一:該指標不比對像素,而是在高層表徵空間中度量生成結果與真實世界演化過程的距離,考察場景語義、物體狀態與動作變化是否被正確保留。兩項第一疊加指向同一個結論——模型不只是畫得像,而是學到了物理世界隨時間演化的規律。視頻質量賽道比的不是"生成的畫面像不像",而是模型在長時推演中能否保持場景幾何、紋理外觀、物體與交互狀態的物理一致性——也就是世界模型最核心的能力:理解物理世界如何隨時間演化。

考拉悠然的技術路線,是以"世界模型+智能體+場景複製"回應這一轉折:底層是悠然無界世界模型,上層是Geek Mind極客心智具身大腦,中間由跨空間、跨任務、跨本體的"三跨"能力打通。世界模型的勝負手是架構,不是算力語言模型像"讀過萬卷書"的學者,靠統計規律預測下一個詞;世界模型要做的,是在腦子裡先"預演一遍"——給定當前場景與一個動作序列,推演出接下來會發生什麼。前者比拼語料與算力規模,後者比拼對物理約束的建模能力。考拉悠然團隊把問題拆成兩個具體挑戰:長時推演中的誤差累積,以及面對未見環境時的分佈漂移,並做了兩層針對性的架構設計。

不僅看生成畫面的清晰度,同時從視覺質量、運動質量、內容一致性、物理遵循性、3D空間準確性、可控性等6大維度、15項指標進行綜合評估。一是結構化4D世界建模:協同建模首幀3D場景幾何與運動軌跡,把靜態空間結構與動態動作過程建立關聯,為後續每一幀生成提供持續的幾何與運動約束。通俗講,就是給生成過程裝上"定位與慣性導航",抑制物體位置漂移、軌跡發散與誤差隨時間累積。二是動態場景記憶:持續保持並更新場景的紋理、外觀、佈局等關鍵環境特徵。長時生成中,模型容易逐漸"忘記"場景自身的樣子,向訓練分佈回縮;動態記憶相當於不斷刷新對當前環境的認知,從而提升長程一致性與域外泛化能力。

訓練策略上採用由粗到精兩階段:第一階段用大規模、多樣化數據學習通用場景表徵與運動規律,建立基礎生成與泛化能力;第二階段篩選高質量數據精細化微調,強化幾何一致性、時序連貫性與運動準確性,完成從廣泛學習到精確推演的躍遷。在Track-1(視頻質量賽道)上,悠然無界世界模型在場景、運動與交互層面展現出高度一致的未來推演能力,有效緩解了複雜長程生成中的狀態漂移、誤差累積與物理失真。具體來看,它能夠應對多類高難度具身任務:分佈外泛化任務:面向未見過的場景,模型能夠基於初始場景狀態與給定動作序列進行未來推演,在長時生成過程中保持場景幾何結構、紋理外觀及機器人與物體交互的物理一致性。

長程任務:面向長時間、多階段的連續操作,沿給定動作序列持續推演未來狀態,抑制誤差累積與狀態漂移,保持場景、物體及交互狀態的長期一致性。複雜綜合任務:在分佈外場景、雙臂協同與長程操作的綜合挑戰下,實現穩定、連續且物理一致的未來推演。基於悠然無界世界模型構建的GeekMind,已率先實現行業落地WorldArena回答的是“模型能力能不能被統一驗證”,真實場景進一步回答的是“這些能力能不能真正用起來”。在工業巡檢中,長期面臨人力成本高、危險區域作業受限、人工記錄難以標準化等問題。製造企業需要的不是單點檢測工具,而是具備自主感知與決策能力的巡檢體系。

考拉悠然將悠然無界世界模型構建的通用具身智能體 Geek Mind 集成於四足機器人平臺,面向大型央企製造車間提供巡檢解決方案,核心能力體現為三個層面:快速部署:方案不依賴產線改造,通過預訓練模型與場景自適應機制,實現巡檢路線的快速配置與任務切換,縮短從進場到運行的實施週期。深度推理:基於世界模型驅動的感知—推理閉環,系統不僅採集溫度、振動、儀表等狀態數據,還能對異常現象進行因果分析,輸出可追溯的判定依據,降低誤報與漏報。空間無界:四足平臺具備跨樓層、跨地形機動能力,覆蓋人工難以抵達的高空、狹小與危險區域,擴展巡檢的空間邊界。

具身智能在工業場景的價值,不在於替代某一崗位,而在於構建一套可複製、可規模化的無人巡檢範式。央企製造車間,正在成為這一範式最早驗證的場域。空間智能技術的競賽才剛開始空間智能領域三個條件正在同一時間窗口成熟:算力成本下行讓邊端部署具備可行性,具身硬件供給趨於充足,行業客戶從看演示轉向算產出。考拉悠然目前握在手裡的,是一個架構原創、經國際榜單驗證的世界模型底座,一套把技術複用到多本體的"三跨"機制,以及一個把技術變成低門檻產品的平臺。真正的考驗在於,跨本體泛化的上限能否在更多極端場景中保持穩定——這將決定世界模型從"能推演"走向"能幹活、能複製"的速度。

Related

相關文章

Unity 官宣 Claude Code 與 Codex 插件:31 項開發技能把 AI 代理綁上游戲引擎

其中 Codex 版本一口氣裝了31項技能,覆蓋多個開發領域,既能從零拉起新項目,也能把舊項目往 URP(通用渲染管線)上遷,插件適配 Unity6及更高版本,走各自對應渠道就能裝上。這套官方插件的痛點很明確:通用 AI 代理寫 Unity 代碼時,常常照著過時的教程和文檔生成內容,跑起來效果不佳,儼然一個"背錯書本的考生"。

剛剛
IT之家生成式AI

階躍發佈旗艦模型 Step 5 Preview:躋身 AA 榜單全球開源模型前三,10 月 15 日開源

作者:潞源 責編:潞源 評論: 感謝網友 Agent、Alita的迷弟、不一樣的體驗、候風不渡 的線索投遞!9 月 20 日消息,階躍今天宣佈推出旗艦模型 Step 5 Preview,面向 AI 編程、軟件工程、專業知識工作、金融等場景,提升模型執行真實世界 Agentic 任務表現,10 月 15 日開源完整權重。

剛剛

階躍星辰發佈Step5Preview,單任務成本僅為Claude Opus5的1/8

該模型在Artificial Analysis Intelligence Index(AA綜合智能指數)中躋身全球開源模型前三,單任務成本僅為Claude Opus5的1/8,計劃於10月15日正式開源。架構方面,Step5Preview採用稀疏MoE架構,總參數量600B,激活參數僅27B,支持100萬Token上下文窗口,並原生支持文本與視覺輸入,在軟件工程、專業工作流和金融等場景針對複雜任務進行了優化。

剛剛

特朗普宣佈組建“人工智能部隊”:AI 未來或佔美國 GDP 的 25%

特朗普表示,為組建“人工智能部隊”,他將在不久後任命一名人工智能事務“總管”。他稱,人工智能代表著下一場工業革命或互聯網浪潮,其規模和影響力將更大,甚至可能佔到美國國內生產總值的 25%。抨擊“企圖摧毀 AI”的民主黨人特朗普還在帖文中抨擊激進的民主黨人“企圖摧毀人工智能”,稱“我們絕不會以任何方式阻礙或扼殺這個令人矚目的產業發展。

剛剛