智東西模型更新

智元全模態大模型,登頂全球第一!力壓谷歌英偉達,跑贏大廠

2026年7月29日 22:10
智元全模態大模型,登頂全球第一!力壓谷歌英偉達,跑贏大廠

重點摘要

智東西(公眾號:zhidxcom) 作者 | 江宇 編輯 | 漠影 當一臺機器人站在多人交談的展廳裡,它能不能從嘈雜聲中聽出誰在和自己說話,判斷一句話是否需要回應;能不能在對方停頓時接過話頭,被突然打斷後自然續上;還能不能一邊回答,一邊配合語氣做出恰當的手勢和表情? 這些看似尋常的交流細節,是具身智能的核心能力,也是機器人跨越自然交互門檻時最難補齊的一環。

站內 AI 整理稿

當一臺機器人站在人聲嘈雜的展廳裡,它能否從多人的交談中準確辨識出誰在對自己說話,判斷哪一句話需要回應;又能否在對方停頓的瞬間自然接話,被打斷後流暢續上;甚至一邊回答問題,一邊配合語氣做出恰當的手勢與表情?這些看似平凡的互動細節,其實正是機器人從「能動」邁向「能交流」的關鍵門檻,也是業界長久以來最難突破的瓶頸。 長期以來,機器人領域陷入一個尷尬的悖論:單項能力不斷突破,像是視覺辨識、語音理解、自然語言生成、動作控制各自都有亮眼進展,但要將「看、聽、說、動」融為一體,形成像人類一樣連貫、即時、自然的互動,始終差臨門一腳。這道鴻溝的本質在於交互能力跟不上——感知、推理、語音、動作各走各的路,從未真正在同一條時間軸上協同運作。 近日,專注於具身智能的上海智元機器人公司,給出了一份極具分量的答案。智元自研的全模態大模型「WITA-Omni Preview」正式亮相,並在業界公認的具身全模態理解權威榜單 DailyOmni 上,以 85.21 分的綜合成績登頂全球第一。這項成績不僅超越中國本土的千問、豆包等大模型,也壓過 Google Gemini、NVIDIA 等國際巨頭,在八項細分指標中拿下六項第一。 這項突破的意義在於,一家專注於具身智能的企業,在「看懂環境、聽懂聲音、邊聽邊想、邊說邊動」這條核心交互能力主線上,跑到了通用大模型廠商的前面。過去,業界普遍認為大型語言模型或多模態模型在通用任務上表現優異,但要真正落地到機器人身上,需要解決「感知-決策-行動」的閉環問題。WITA-Omni 的出現,證明了專為物理世界交互設計的模型,反而能在這條賽道上取得領先。 DailyOmni 榜單由北京大學與上海人工智慧實驗室等機構聯合發布,是目前最具權威的具身全模態理解評測基準。它涵蓋了視覺問答、語音理解、手勢辨識、情感感知、動作預測、多輪對話等多個維度,總共八項細分任務。智元模型在六項任務中拿下第一,特別是在需要同時處理視覺與聽覺資訊的「跨模態情感理解」與「多模態語境推理」等項目上,分數明顯領先,展現了其將不同感官資訊即時融合的能力。 WITA-Omni Preview 的核心技術路線,是讓機器人不再依賴各自獨立的模型來處理不同任務,而是建構一個統一的端到端全模態架構。這個架構能夠同時接收視覺、聽覺、本體感知等多種訊號,並在同一時間軸上進行聯合推理,輸出自然語言回應與動作指令。這意味著機器人可以在聽到一句話的同時,看到說話者的表情與手勢,並根據當下的場景狀態決定下一步行動。 這項技術的突破,直接呼應了本文開頭描述的場景。當機器人站在展廳裡,它不再需要先啟動語音辨識、再調用語言模型、最後查詢動作庫,而是能像人類一樣,在聽的同時就在看、在想、在準備回應。這種「即時全模態協同」的能力,正是機器人從工具變成夥伴的關鍵一步。 值得一提的是,智元機器人早在 WITA-Omni 之前,就已推出自研的世界模型「Genie Envisioner-Sim」,用於模擬物理世界中的機器人行為。如今全模態大模型的問世,進一步補齊了「感知與理解」這塊拼圖。兩者結合,可望讓機器人在虛擬環境中訓練後,直接部署到真實世界,大幅降低開發成本與安全風險。 業界分析指出,全球機器人交互領域長期存在「模態鴻溝」,大多數廠商仍停留在將不同模態模型簡單拼接的階段,導致延遲高、反應僵硬、容錯率低。智元選擇從底層架構著手,打造統一的全模態模型,這是一條技術難度更高但潛力更大的路徑。如今在權威榜單上獲得六項第一,證明這條路已經走通。 從市場格局來看,這項突破也讓智元在全球具身智能賽道中站穩腳跟。過去,外界對這家中國新創公司的印象多停留在「人形機器人硬體」上,但 WITA-Omni 的表現,讓外界看到其軟體與演算法實力同樣不容小覷。尤其在大廠紛紛投入通用大模型之際,智元選擇專注於物理世界交互的垂直領域,反而找到差異化優勢。 目前,WITA-Omni Preview 已開放部分測試,智元也透露後續將持續迭代,並計畫在今年內推出更完整的商用版本。隨著這套全模態模型逐步整合到智元的人形機器人產品中,機器人與人類之間的互動,將不再是冷冰冰的指令執行,而是有溫度、有節奏、有來有往的對話。對整個行業而言,這或許是機器人真正走入日常生活的關鍵一步。

Related

相關文章

智東西模型更新

黃仁勳力挺開源同一天,螞蟻百靈扔出124B“執行模型”

智東西(公眾號:zhidxcom) 作者 | 王涵 編輯 | 漠影 最近一週,硅谷AI圈的兩件大事將AI的路線之爭推至頂點。 先是黃仁勳首條X推文轉發25家巨頭聯署公開信,呼籲審慎監管開源AI模型;緊接著,OpenAI與Anthropic罕見聯手,超1100名員工聯署呼籲“控速”,Meta創始人兼CEO扎克伯格則公開反擊稱這是扼殺創新。

剛剛

AI辦公,為什麼成了大廠新戰場?

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體模型更新

小米大模型拿下“全球第一”,有實力也是僥倖

小米大模型拿下“全球第一”,有實力也是僥倖唐辰同學2026.07.29 18:53 · 來自北京全文3371字00:00 / 09:59小米AI的“務實生存法則”。文 | 唐辰同學小米又“贏了”,這次是大模型。近日,小米公關“一號位”徐潔雲轉發了一個榜單。多模型聚合平臺OpenRouter數據顯示,上週(7月20日—7月26日),全球調用量排名前五均為中國AI大模型:小米MiMo-V2.

剛剛

DeepSeek Harness開啟內測?看來V4正式版也不遠了

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體模型更新

阿里、騰訊、360同時出手:你的辦公桌,成了大廠的新戰場

阿里、騰訊、360同時出手:你的辦公桌,成了大廠的新戰場大模型之家2026.07.29 17:40 · 來自北京全文3774字00:00 / 10:12中國科技巨頭的商業化“肉搏”,在億萬職場人幾平米的工位上打響。文 | 大模型之家7月27日,阿里“千問辦公”低調開啟小範圍測試;幾乎在同一時刻,企業微信內部孵化的AI助理“大圓”也悄然啟動內測。

剛剛

釘飛企三巨頭集齊AI,然後呢?

今年7月,企業協同辦公領域的AI戰火燒得格外猛烈。釘釘、飛書、企業微信三大巨頭接連出招,幾乎在同一月份內密集更新AI功能,外界看似熱鬧,但業界更關心的是:這究竟是功能疊加的舊戲碼,還是一場足以改寫市場規則的新戰局?更深一層的問題在於,AI辦公的終極意義,到底只是幫打工人減輕負擔,還是能真正驅動業務成長、為企業創造營收?市場顯然還在等待更明確的答案。 7月27日,企業微信正式啟動AI智能助理「大圓」的內測。使用者只要在任何介面向左滑動,或在電腦端點擊左側邊欄,就能喚醒這個原生AI助理。

剛剛