剛剛,全球首個具身專屬的MoE視頻模型,開源了!

重點摘要
全球首個專為具身智能設計的混合專家(MoE)影片模型正式開源,可動態調用不同專家子網路,提升機器人與自動駕駛等動態場景的理解與回應能力。該模型已公開完整程式碼與預訓練權重,有望降低具身智能研究門檻並加速產業創新。
全球首個專為具身智能場景打造的混合專家(Mixture of Experts,MoE)架構視頻模型,今日正式對外開源。這款模型打破過去通用視頻模型在機器人與自動駕駛等動態環境中的效能瓶頸,藉由MoE機制實現即時、精確的視覺理解,被業界視為推動具身智能走向應用的關鍵基礎設施。開發團隊指出,這款模型從設計之初即鎖定具身智能系統的核心需求——也就是在變化莫測的真實世界裡,讓機器人能「看懂」周圍環境,並迅速做出反應。與傳統單一架構的視頻模型不同,MoE模型內部由多個專門化的「專家」子網路組成,在處理每一幀畫面時,系統會動態選擇最適合的專家來執行運算。
這種架構不僅大幅降低不必要的算力浪費,還能同時維持甚至提升推理的準確度,特別適合要求低延遲、高可靠度的即時感知任務。在技術細節上,這款模型針對具身場景中常見的挑戰進行了專項優化。例如物體與環境的互動辨識、機器人在空間中的導航判斷,以及對下一步動作的預測等,傳統模型往往需要靠大量後處理或外部模組才能勉強應對,而MoE模型則能透過專家網路的協同分工,在單一模型中完成這些高複雜度的視覺理解工作。這也填補了長期以來具身智能領域缺乏專用視頻模型的空白。目前該模型的完整程式碼與預訓練權重已於GitHub等主流開源平台上架,開發者可以直接下載、部署與修改。
團隊強調,開源是為了讓學術研究與產業實務之間的界線變得更模糊,加速技術從實驗室走向真實場景的循環。過去,要訓練一個能應付複雜環境的視覺模型,需要大量的硬體資源與數據標註成本,如今這款開源模型提供了即戰力,讓更多中小型團隊或個人開發者也能投入機器人、自動駕駛、智慧製造等領域的應用開發。業界分析認為,這項開源舉措將顯著降低具身智能研究的進入門檻。過去由於缺乏專用且高效的視頻理解工具,許多團隊必須從頭設計視覺管線,或者依賴通用視頻模型再自行改寫,過程冗長且效果有限。現在有了這款MoE模型作為基礎,後續的研究者可以更專注於上層的決策規劃、控制演算法等關鍵環節,而不用重複造輪子。
值得注意的是,這款模型在訓練階段即使用了大量真實與模擬的具身場景數據,確保專家網路對不同工業環境、家庭場景甚至戶外動態都有一定的泛化能力。根據開發團隊透露的初步測試結果,該模型在標準機器人視覺基準上,無論是互動偵測的成功率還是空間導航的路徑預測誤差,都優於同等規模的通用模型,且在運算效率上提升了數倍。從技術趨勢來看,MoE架構近年已在大型語言模型中展現出驚人的效益,但在視頻與具身智能領域的應用仍屬少數。這款模型的出現,不僅驗證了MoE在視覺理解任務中的可行性,也為後續更大規模的具身基礎模型鋪平了道路。
業內人士預期,隨著開源社群的回饋與貢獻,模型的專家網路將能持續擴充,甚至出現針對特定機器人硬體或場景的客製化版本。對於開發者而言,這款模型的使用門檻並不高。只要具備基本的深度學習框架操作經驗,即可透過官方提供的範例程式碼快速上手。模型支援常用的輸入格式,並預先整合了常見的數據預處理流程,減少開發者在環境設定上的繁瑣步驟。此外,開源頁面上也附有詳細的技術文件與使用教學,幫助新手理解MoE架構的運作原理與調參技巧。此次開源也標誌著具身智能領域從「各團隊閉門研發」逐步走向「開放協作」的轉折點。過去幾年,儘管機器人與AI的結合屢有突破,但大多數進展仍集中在頂尖實驗室或大型企業內部。
如今一款專用的、高效能的基礎模型被無償對外公開,可望激發更多跨領域的合作案例,例如將該模型與邊緣運算裝置結合,或者整合進現有的機器人作業系統中,實現真正的即時感知與控制。這款模型的開源時間點也格外具有意義。全球正處於生成式AI與機器人技術加速融合的階段,各國都在積極布局具身智能的基礎設施。誰能率先掌握高效、通用的視覺理解能力,誰就更有機會在下一波智慧機器人浪潮中取得先機。而開源策略不僅能快速累積社群動能,也有助於建立廣泛的生態系,讓模型在實際應用中不斷迭代進化。總結來說,全球首個具身專屬MoE視頻模型的開源,為機器人與自動駕駛等領域提供了一個強而有力的新工具。
其混合專家架構帶來的效率與精準度雙重優勢,填補了專用模型的缺口;而開放原始碼的作法,更讓整個產業的研發節奏有望進一步加快。對於任何正在探索真實世界視覺理解問題的團隊而言,此刻正是投入測試與開發的最佳時機。
Related
相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”
眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?
宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態
首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了
三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。
宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品
AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。
IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118
進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。