3B模型碾壓英偉達谷歌後,Om AI端側原生VLX模型:小參數實現物理世界精準感知

2026年8月10日 09:19
3B模型碾壓英偉達谷歌後,Om AI端側原生VLX模型:小參數實現物理世界精準感知
站內 AI 整理稿

從雲計算到雲原生,產業真正的躍遷從來不是簡單堆算力,而是找到更適合新世界的架構。田晏林 發自 凹非寺 | 公眾號 QbitAI 具身智能圈,又傳來兩條重磅消息。8月6日,Om AI聯匯完成數億元融資,前海母基金領投。同一天,該公司旗下全球首款端側原生模型VLX-Seek 1.5宣佈正式開源。表面看,這是融資、開源兩件事。資本在下注一種新路線,開發者正在獲得一個新入口。但放在一起看,很難不讓人想起20年前亞馬遜AWS開啟雲計算時代的那一刻。當年,AWS一邊全面開放API吸引海量開發者接入,一邊獲得資本投入驗證路線價值。最終,雲計算沒有成為簡單的服務器租賃生意,而是演變成一套新的基礎設施範式。

如今的物理AI,也在尋找自己的「原生時刻」。Om AI聯匯定義了一種怎樣的範式?在物理AI的全局座標軸中,它處於什麼位置?全球物理AI,圖譜更新 過去幾年,AI行業的競爭經常圍繞更大的模型、更多的數據、更強的雲端算力展開。從大語言模型到多模態模型,參數規模一度成為衡量能力的重要指標。但當AI走向真實世界,機器人面對的不是一張張靜態圖片,也不是一次次文本問答。它需要在工廠、倉庫、家庭、戶外等複雜環境中持續運行。這時,競爭規則也發生了變化。決定模型價值的不再只是參數量,而是幾個更加現實的問題: 響應延遲夠不夠低?端側算力能不能承受?部署成本能不能規模化?設備能不能脫離雲端獨立運行?

因為在物理世界裡,每增加一臺機器人、無人機或智能終端,都意味著真實的硬件成本、能源成本和維護成本。如果我們把今天全球物理AI模型的路線放在一張地圖上會發現,圍繞「如何讓AI理解並行動於物理世界」這一大命題,全球玩家正在形成幾條不同方向。NVIDIA Cosmos選擇的是「雲端世界模型」路線。它的核心目標,是幫助AI理解物理環境,通過世界模型能力構建更加豐富的空間認知基礎。Physical Intelligence的π系列,則探索「雲端通用機器人策略模型」,希望通過大規模訓練讓機器人具備跨任務泛化能力。

Google Gemini Robotics則沿著「雲端VLA」方向推進,將語言理解、視覺感知和機器人動作連接起來,讓機器人能夠根據自然語言完成任務。而另闢蹊徑的Tesla Optimus,更強調模型與機器人本體之間的閉環,通過自有硬件平臺推動機器人能力迭代。這些路線並沒有誰絕對領先。它們分別回答了不同問題:如何讓AI理解世界?如何讓機器人獲得通用能力?如何讓模型與硬件協同?但在這張圖譜裡,有一個關鍵座標此前並未有過專門的回答,那就是: 如何讓一個AI模型從誕生開始,就適應端側環境?這是Om AI聯匯想填補的位置。

其自研的VLX端側流式多模態模型系列強調「端側原生」路線,它不依賴雲端大算力,也不綁定單一硬件平臺。模型也並非先在雲端訓練完成,再被壓縮部署到設備。而是在模型設計階段,就把端側算力、延遲、功耗和部署成本作為約束條件。這兩者看似只是部署方式的不同,本質上卻是兩種不同的技術哲學。前者是在問:如何讓一個強大的AI模型跑到設備上?後者是在問:如果AI生來就在設備上,它應該長成什麼樣?這也是「端側部署」和「端側原生」最大的區別。畢竟機器人真正進入千家萬戶、進入大量工業場景,不可能永遠依賴遠端的雲端大腦。當前,在全球物理AI模型競爭版圖中,端側原生正在成為一個新的關鍵方向。

而Om AI聯匯最先看到圖譜上的缺口,用VLX補上了。拆解“端側原生第一家” 對於「端側」的探索,不少AI模型很早就展開了。大家都清楚,雲端大模型雖然強大,但也有天然限制。機器人如果每一次感知都需要上傳雲端,再等待結果返回,就像讓一個人在運動時,每個動作都要先打電話詢問遠方的大腦。網絡延遲存在,數據傳輸成本存在,隱私問題也存在。但工廠裡的機器人,需要全天候工作;巡檢無人機,需要在沒有穩定網絡環境的地方執行任務;家庭機器人,需要保護用戶隱私。這些場景決定了,物理AI不能永遠依賴雲端大腦。業內之前的解決方案通常是:先訓練一個大模型,再通過壓縮、蒸餾、量化等方式,讓它適配端側。

這種「遷移式部署」的方式,模型本身仍離不開雲端,只是努力讓自己「變得更輕」。Om AI聯匯想徹底打破限制。VLX從模型架構層就開始考慮端側環境,把延遲、功耗、算力、部署成本作為設計前提,而非優化目標。也就是說,模型不是一個被迫「減肥」的大模型,而是一個天生適合端側環境的AI。這個區別決定了物理AI能不能大規模、快速地走出實驗室。端側原生帶來的價值是直接的:更快響應、更低成本、更強自主性,以及讓物理AI進入工廠、家庭、無人機巡檢、智能終端。而這種大規模落地要求模型具備本地理解能力、持續交互能力和低成本部署能力。這也是為什麼端側原生並非一個營銷概念。

它實際上代表了一條新的架構路線,決定著未來物理AI如何進入千千萬萬個真實設備。不過,路線判斷最終需要技術驗證。一個面向端側設計的模型,是否真的能挑戰更大的模型?VLX-Seek 1.5:我能!3B模型碾壓英偉達、谷歌 VLX-Seek 1.5有3B、10B兩個版本,參數規模都不大。如果說端側原生架構是其戰略選擇,那麼流式多模態就是其以小搏大的戰術優勢。傳統VLM的工作流是這樣的:攝像頭拍一張照片,上傳到雲端,等待模型推理,返回結果。這是典型的批處理模式,英偉達、Google等巨頭的路線本質上都是這個邏輯。由此帶來的問題則是延遲高、帶寬依賴大、隱私不可控。

並且,它把物理世界的連續感知切割成了一幀幀的靜態快照。VLX-Seek 1.5的流式多模態架構完全不同。它接收的是視頻流持續輸入,在端側實時理解,動態輸出決策。三層心智鏈路構成了完整閉環: Flow=持續注意力,讓模型從看不見到看得清; Seek=精細推理,讓模型從看不準到看得準; Go=執行控制,讓模型從動不了到自主行動。從「拍照識別」到「視頻流理解」的範式變化,反向驗證了同參數級別能贏巨頭的關鍵,不在參數,而在架構。在VLX-Seek 1.5公開的評測中,Om AI聯匯測試了3B和10B兩個版本,覆蓋通用目標檢測、指代表達理解、無人機視角感知、具身空間推理以及目標幻覺等多個方向。

同場比較的模型,不僅包括自家上一版的VLX-Seek,還有英偉達的LocateAnything等檢測增強型VLM,以及多個更大的開源或閉源模型。結果顯示,VLX-Seek 1.5不僅提升了細粒度視覺理解能力,同時在無人機定位、具身設備空間推理等場景中展現出競爭力。其中,最具代表性的,是3B參數版本與同規模模型(LocateAnything-3B)的比較。在通用檢測任務中,VLX-Seek 1.5-3B在LVIS Mean指標(衡量開放集定位模型對上千種物體,包含大量稀有物體的框選能力)達到57.5,相比LocateAnything-3B(50.7),提升13.4%。

這意味著,在複雜長尾目標識別中,小參數模型並沒有因為規模限制而退化。在更接近真實交互的指代表達理解任務中,VLX-Seek 1.5-3B在RefCOCOg test Mean(語言描述定位目標物體)達到80.2,相比LocateAnything-3B,提升3.4%。簡單來說,人類說一句:找到那個靠近桌角的小盒子。模型不僅要識別盒子,還要理解空間關係。這考驗的不是單純視覺能力,而是視覺和語言之間的深層關聯。真正拉開差距的是無人機視角場景。對於無人機來說,目標往往非常小、距離遠、視角高、環境複雜。傳統模型很容易出現漏檢或者誤判。而在RefDrone測試中,VLX-Seek 1.

5-3B的F1指標達到73.2,相比LocateAnything-3B的52.3,提升40%。實例準確率Acc達到58,相比LocateAnything-3B(35.6)提升62.9%。這些結果說明,在極端視角和小目標場景下,端側原生架構正在展現不同於傳統路線的效率優勢。VLX-Seek 1.5驗證了一件事:巨頭路線依靠更大規模解決問題,但端側原生路線通過更適合物理世界的架構,也能提高單位參數價值。不過,在實際部署時,僅有強識別能力還不夠。模型最大的風險是「過於自信」。對於聊天機器人,有時候過於自信的結果,就是給出一次錯誤的回覆。

但對於機器人、無人機和安防系統,模型的一次錯誤判斷可能直接觸發錯誤動作,對真實世界安全造成不可挽回的影響。為了解決這個問題,VLX-Seek 1.5引入目標幻覺指標,用於衡量模型是否會產生不存在目標的誤報。該指標定義為:Object Hallucination = FP/Number of GT Objects。其中,FP代表針對實際不存在請求目標產生的假陽性檢測,數值越低,說明模型產生的目標幻覺越少。在RefDrone目標幻覺評測中,VLX-Seek 1.5的FP/GT為18,而LocateAnything-3B為71.3。這意味著,在同等條件下,VLX-Seek 1.

5能夠顯著減少錯誤目標判斷。它選擇了一條不同的智能路線:不強行給答案,且在信息不足時,敢說「我不知道」。拒絕識別,並不是模型變弱。恰恰相反,知道什麼時候說不知道,反而才是智能走進真實物理世界的重要標誌。在安防機器人、無人機巡檢等高可靠場景中,亂報警可比漏報危險得多。融資、開源與商業化 資本對範式投票,往往比技術社區的判斷更早。Om AI聯匯此次完成數億元的融資,釋放的信號很明確:資本市場開始為端側原生範式定價。類比雲原生早期,投資人押注的,也不是某一款PaaS產品,而是範式遷移本身。而Om AI聯匯要做「定義標準」的那個。

這與Kubernetes的邏輯一致:不靠售賣標準賺錢,靠免費把標準做成行業共識。當全行業都遵循這套標準,定義方的雲基礎設施、託管服務就獲得巨大商業增益。目前,VLX-Seek 1.5的這套能力已向開發者開放。當越來越多的開發者接入VLX-Seek 1.5,這套模型在更多真實場景被驗證,數據反饋、持續迭代。飛輪一旦轉起來,生態位就穩了。VLX-Seek 1.5開源,本質上是在爭奪未來物理AI的基礎能力標準的定義權。除了模型本身,OmAI聯匯也在基於VLX模型基座構建更大的端側智能生態。其「一腦多形」智能體平臺OmAgent,試圖推動AI走進物理世界。

在具身場景的商業化驗證上,OttoPlex御行已經落地。消費端,OttoBox攜手聯想、蘋果推出AI PC「OttoBox AI Studio」。同時,其自研可穿戴AI視覺中樞Homer AI,已經服務全國近10萬視障用戶,平臺月均AI調用達到千萬次。這些探索,表明Om AI聯匯並不只是想成為一家模型公司,更希望成為端側原生智能時代的基礎設施提供者。從雲計算到雲原生,產業真正的躍遷從來不是簡單堆算力,而是找到更適合新世界的架構。如今,物理AI也走到了類似節點。融資,是資本對新路線的投票。開源,是生態對新範式的第一次接入。

當模型開始離開雲端,進入千千萬萬個真實設備,端側原生或許會成為物理AI走向規模化的關鍵答案。下一場競爭,不只是大模型之爭。未來真正擁有最大價值的,也未必是參數最多的模型,而是那個讓機器人、無人機和智能終端真正規模化運行的基礎設施。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

鈦媒體生成式AI

王興興“錯配”梁文鋒?

王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛