智元全模態大模型,登頂全球第一!力壓谷歌英偉達,跑贏大廠

重點摘要
智東西(公眾號:zhidxcom) 作者 | 江宇 編輯 | 漠影 當一臺機器人站在多人交談的展廳裡,它能不能從嘈雜聲中聽出誰在和自己說話,判斷一句話是否需要回應;能不能在對方停頓時接過話頭,被突然打斷後自然續上;還能不能一邊回答,一邊配合語氣做出恰當的手勢和表情? 這些看似尋常的交流細節,是具身智能的核心能力,也是機器人跨越自然交互門檻時最難補齊的一環。
當一臺機器人站在人聲嘈雜的展廳裡,它能否從多人的交談中準確辨識出誰在對自己說話,判斷哪一句話需要回應;又能否在對方停頓的瞬間自然接話,被打斷後流暢續上;甚至一邊回答問題,一邊配合語氣做出恰當的手勢與表情?這些看似平凡的互動細節,其實正是機器人從「能動」邁向「能交流」的關鍵門檻,也是業界長久以來最難突破的瓶頸。長期以來,機器人領域陷入一個尷尬的悖論:單項能力不斷突破,像是視覺辨識、語音理解、自然語言生成、動作控制各自都有亮眼進展,但要將「看、聽、說、動」融為一體,形成像人類一樣連貫、即時、自然的互動,始終差臨門一腳。
這道鴻溝的本質在於交互能力跟不上——感知、推理、語音、動作各走各的路,從未真正在同一條時間軸上協同運作。近日,專注於具身智能的上海智元機器人公司,給出了一份極具分量的答案。智元自研的全模態大模型「WITA-Omni Preview」正式亮相,並在業界公認的具身全模態理解權威榜單 DailyOmni 上,以 85.21 分的綜合成績登頂全球第一。這項成績不僅超越中國本土的千問、豆包等大模型,也壓過 Google Gemini、NVIDIA 等國際巨頭,在八項細分指標中拿下六項第一。
這項突破的意義在於,一家專注於具身智能的企業,在「看懂環境、聽懂聲音、邊聽邊想、邊說邊動」這條核心交互能力主線上,跑到了通用大模型廠商的前面。過去,業界普遍認為大型語言模型或多模態模型在通用任務上表現優異,但要真正落地到機器人身上,需要解決「感知-決策-行動」的閉環問題。WITA-Omni 的出現,證明了專為物理世界交互設計的模型,反而能在這條賽道上取得領先。DailyOmni 榜單由北京大學與上海人工智慧實驗室等機構聯合發布,是目前最具權威的具身全模態理解評測基準。它涵蓋了視覺問答、語音理解、手勢辨識、情感感知、動作預測、多輪對話等多個維度,總共八項細分任務。
智元模型在六項任務中拿下第一,特別是在需要同時處理視覺與聽覺資訊的「跨模態情感理解」與「多模態語境推理」等項目上,分數明顯領先,展現了其將不同感官資訊即時融合的能力。WITA-Omni Preview 的核心技術路線,是讓機器人不再依賴各自獨立的模型來處理不同任務,而是建構一個統一的端到端全模態架構。這個架構能夠同時接收視覺、聽覺、本體感知等多種訊號,並在同一時間軸上進行聯合推理,輸出自然語言回應與動作指令。這意味著機器人可以在聽到一句話的同時,看到說話者的表情與手勢,並根據當下的場景狀態決定下一步行動。這項技術的突破,直接呼應了本文開頭描述的場景。
當機器人站在展廳裡,它不再需要先啟動語音辨識、再調用語言模型、最後查詢動作庫,而是能像人類一樣,在聽的同時就在看、在想、在準備回應。這種「即時全模態協同」的能力,正是機器人從工具變成夥伴的關鍵一步。值得一提的是,智元機器人早在 WITA-Omni 之前,就已推出自研的世界模型「Genie Envisioner-Sim」,用於模擬物理世界中的機器人行為。如今全模態大模型的問世,進一步補齊了「感知與理解」這塊拼圖。兩者結合,可望讓機器人在虛擬環境中訓練後,直接部署到真實世界,大幅降低開發成本與安全風險。
業界分析指出,全球機器人交互領域長期存在「模態鴻溝」,大多數廠商仍停留在將不同模態模型簡單拼接的階段,導致延遲高、反應僵硬、容錯率低。智元選擇從底層架構著手,打造統一的全模態模型,這是一條技術難度更高但潛力更大的路徑。如今在權威榜單上獲得六項第一,證明這條路已經走通。從市場格局來看,這項突破也讓智元在全球具身智能賽道中站穩腳跟。過去,外界對這家中國新創公司的印象多停留在「人形機器人硬體」上,但 WITA-Omni 的表現,讓外界看到其軟體與演算法實力同樣不容小覷。尤其在大廠紛紛投入通用大模型之際,智元選擇專注於物理世界交互的垂直領域,反而找到差異化優勢。
目前,WITA-Omni Preview 已開放部分測試,智元也透露後續將持續迭代,並計畫在今年內推出更完整的商用版本。隨著這套全模態模型逐步整合到智元的人形機器人產品中,機器人與人類之間的互動,將不再是冷冰冰的指令執行,而是有溫度、有節奏、有來有往的對話。對整個行業而言,這或許是機器人真正走入日常生活的關鍵一步。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。