全天候科技生成式AI

對話騰訊首席科學家張正友:AI仍是“缸中之腦”,騰訊Tairos欲破具身落地難題

2026年7月20日 07:56
對話騰訊首席科學家張正友:AI仍是“缸中之腦”,騰訊Tairos欲破具身落地難題

重點摘要

騰訊首席科學家張正友在WAIC表示,當前AI仍屬「缸中之腦」,缺乏與真實世界互動的閉環,具身智能尚在起步階段且落地場景有限。為突破難題,騰訊推出具身智能開放平台Tairos,並發布一系列新模型,試圖打通感知、身體與行動的完整閉環。

站內 AI 整理稿

在2026年世界人工智能大會(WAIC)上,各式機器人大秀「十八般武藝」,具身智能的熱度達到新高。然而,騰訊首席科學家、騰訊Robotics X實驗室及福田實驗室主任張正友在WAIC期間的媒體交流會中指出,具身智能目前仍處於起步階段,真正的落地應用相當有限,且各個廠商在場景選擇與機器人形態上出現明顯的同質化趨勢。他認為,這並非壞事,因為任何新興產業在起步期都會有大量企業湧入,後續自然會經歷大浪淘沙,不至於阻礙行業發展。 張正友多次強調,他個人最看好的落地場景是養老照護,但也坦言養老場景極為複雜,對機器人的感知、互動與執行能力要求極高,是當前最具挑戰性的領域之一。針對市場上備受關注的超仿生人形機器人,張正友明確表示騰訊並未涉足,他認為提供情緒價值不一定需要透過超仿生外觀,應該從第一性原理出發,思考技術的本質需求。 騰訊早在2018年便成立Robotics X實驗室,專注機器人前沿技術。儘管這波具身智能浪潮洶湧,騰訊始終保持清晰的邊界意識。2025年初,騰訊董事會主席兼首席執行官馬化騰即表明,騰訊希望成為所有機器人廠商的合作夥伴,而非親自投入硬體製造,這與騰訊整體戰略一致。在此方針下,2025年WAIC期間,騰訊正式推出國內首個以模塊化方式提供大模型、開發工具與數據服務的具身智能開放平台「Tairos鈦螺絲」,透過即插即用的設計,向機器人行業開放核心能力。 過去一年,騰訊Robotics X實驗室已與宇樹、智元、越疆、松延動力、樂聚、華沿等機器人企業,以及博世、藍思、景德鎮、敦煌等場景合作夥伴,共同探索具身智能在不同機器人本體與產業場景中的落地。到了2026年WAIC,騰訊進一步推出具身智能系列新模型與智能體成果,首次系統性地打通「感知—身體—行動」的完整閉環。張正友解釋,這一系列產品沿著一條主線展開:先讓智能體看懂物理世界,再讓它想像目標狀態,最後將想法轉化為穩定的動作,並將這些能力整合成持續在線、可複用的智能體。 此次發佈的具身基座模型包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0與Hy-Embodied-VLA-0.5,三者皆基於騰訊混元大模型打造。其中,VLM模型類似「右腦」,負責理解圖像、空間與場景;RxBrain模型則扮演具身「大腦」,統一認知、規劃與對未來狀態的想像;VLA模型連接「小腦」與身體,將高層目標轉化為連續且可糾錯的動作。張正友指出,Hy-Embodied-VLA-0.5的核心競爭力並非單純訓練更大的模型,而是構建「數據—模型—訓練—部署」協同發力的完整學習棧,並透過亞毫米級高精度UMI採集系統,累積超過一萬小時的人類示教數據。 張正友認為,真正的智能必須讓語言、視覺、空間認知、身體控制與環境反饋相互連通,並在「感知—身體—行動」的閉環中接受驗證。這正是騰訊Robotics X探索具身原生智能的基本思路:從離身走向具身,從分裂的模塊走向整體的閉環。他直言,當前最聰明的人工智能本質上仍是「缸中之腦」——大模型雖然在知識層面表現驚人,但一旦進入真實世界,問題便浮現:它未必真正理解物體的位置、空間關係與可操作性,也很難在持續變化的環境中一邊行動、一邊接收反饋並即時調整。這就像一個被養在缸裡的大腦,擁有豐富知識卻沒有身體,缺乏與世界直接互動的閉環,張正友稱之為「離身智能」。 數據稀缺是阻礙具身智能變聰明的關鍵因素。張正友指出,在具身智能的數據金字塔中,最底層是互聯網數據,往上依次是第一人稱視角操作視頻、帶傳感器手套收集的數據,最頂層則是遙操作數據。遙操作數據雖然採集效率最低,但被視為訓練機器人效果最好的數據。要讓機器人變得更加智能,這四類數據需要相互打通,形成完整的數據生態。 與大語言模型技術棧已經收斂到業界普遍認可的範疇不同,張正友觀察到,具身智能模型的技術方案尚未達成共識。去年業界興起VLA(視覺語言動作模型)範式,今年則開始討論世界模型。騰訊推出的Hy-Embodied-RxBrain-1.0,正是其在世界理解模型上的探索。張正友強調,整個行業仍處於邊摸索邊前進的階段,大家對落地應有耐心與信心,隨著技術逐步成熟,具身智能終將在更多真實場景中發揮價值。

Related

相關文章

智東西生成式AI

阿里甩出“配音”神器:能調整情緒,還會說方言

阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

剛剛

關於面壁智能,聊聊我的一些新思考

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

Token收費,不再“天經地義”?

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
全天候科技生成式AI

AI眼鏡繼續進化:不只看見,還要辦事

過去兩年,大模型技術加速導入智慧眼鏡,翻譯、拍攝等應用功能密集問世,成為市場主流。然而,隨著這些能力逐漸成為標配,AI眼鏡所面臨的新課題也隨之浮現——業界開始思考,如何讓眼鏡從「看見」進化到「辦事」,真正成為能主動協助用戶完成任務的隨身裝置。

剛剛

16萬Star的OpenCode徹底重寫:API全部重做、Bun換Node、桌面端遷移Electron

擁有超過 16 萬顆 GitHub 星星、每月活躍開發者高達 750 萬人的開源專案 OpenCode,在 2026 年 7 月正式推出了 2.0 版本。這不僅是一次例行更新,而是從底層架構到使用者體驗的全面翻新。聯合創始人 Dax Raad 在近期受訪時坦言,這是他職業生涯中「第三次才做對」的產品:0 是原型試水,1.x 是市場驗證,而 2.0 則是在徹底理解整個領域後,從零開始的推倒重來。 這次重寫的核心變革之一,就是完全重構了應用程式介面(API)。

剛剛