對話COCO Matrix高宇翔:難以提前窮舉世界,不如「學習適應」世界

2026年8月31日 19:22
對話COCO Matrix高宇翔:難以提前窮舉世界,不如「學習適應」世界
站內 AI 整理稿

這是今天很多泛化研究在解決的問題。另一個問題是,碰到真的不會的東西,它要多久才能學會?這是我們更關心的問題。比如一個機器人從來沒有見過某種咖啡機。第一種思路是希望訓練數據足夠豐富,讓它以前見過類似的咖啡機,所以第一次就能操作。這個能力當然非常重要。但總有一天它會遇到一個真的沒見過的東西。這時候怎麼辦?如果旁邊的人操作一遍,它就能模仿,然後告訴它“這個按鈕要最後按”,它下一次就能修正。我們認為這種能力對於機器人進入開放世界同樣重要。所以我們認為機器人不可能靠預訓練解決未來遇到的所有問題。我們的初衷是,希望能夠泛化它的學習能力本身,而不只是機器人已經學到的任務。

白鯨實驗室:那怎麼衡量ICL做得好不好?高宇翔:這個問題我們想得很樸素。它可以簡化為,給機器人一個從來沒見過的新任務,教幾次,它才能學會?這其實可以變成一個很直接的技術指標。假設第一次機器人完全不會。給它一次示範以後,成功率提高多少?三次、五次以後,又提高多少?如果做錯了,人糾正一次,它能不能馬上改正?今天可能一個任務需要收集幾百條數據、重新訓練才能做好。未來如果變成十次示範,再往後變成兩三次,甚至看一遍、糾正一次就會,那就是學習效率在不斷提高。所以我們很關注learning efficiency。傳統 benchmark更多是在模型訓練完成以後,評測它會不會。

我們希望增加一個更深的維度,看它學得有多快。我覺得這可能會成為未來衡量機器人智能非常重要的一個維度。白鯨實驗室:大語言模型發展了這麼多年,現在才開始越來越關注記憶、持續學習這些能力。具身智能還處在更早期的階段,為什麼你們反而認為現在就必須做ICL?高宇翔:我們對這個方向的押注主要來自兩個判斷。第一,我們判斷,具身可能比大語言模型更早遇到數據問題。大語言模型有一個非常重要的前提。互聯網上已經積累了幾十年的人類語言、知識和代碼數據。過去四五年,大模型一直在快速消化這些存量數據,再疊加後訓練和強化學習,已經把模型推到了一個能夠真正產生經濟價值的階段。但具身不一樣。

機器人真正可用的高質量交互數據非常少,而且新數據的生產速度和規模,也遠遠比不上互聯網數據。所以我們判斷,具身可能會更早遇到一個瓶頸,離線數據繼續增加、訓練規模繼續擴大,帶來的能力收益開始遞減,但模型本身還沒有達到足夠通用、足夠好用的程度。這其實是一個很危險的gap。大語言模型是在已經“很好用”之後,開始越來越關注記憶和持續學習。具身有可能在還“不夠好用”的時候,就先碰到數據和學習效率的瓶頸。具身也會更早面臨這個問題,如果不能靠提前收集更多數據、訓練更多任務來解決,機器人如何在進入真實世界以後繼續學習?這也是我們為什麼現在就開始佈局ICL、交互數據和持續學習能力。

第二,具身其實天然比語言更需要上下文。語言模型面對的上下文主要是文字、圖像這些數字世界的信息,但機器人面對的是一個持續變化的物理世界。它看到什麼,剛剛做了什麼,人做了什麼示範,哪一步被糾正了,物體發生了什麼變化,這些其實全部都是上下文。所以具身的上下文不僅信息量更豐富,而且和行動直接相關。怎麼表示這些信息,記住重要的經驗以及從一次示範或者糾正中快速學習,我覺得這裡還有非常大的模型創新空間。好的一點是,我們不需要從零開始。過去幾年大語言模型和視頻生成模型已經幫我們驗證了很多東西,包括上下文學習、長上下文、記憶以及推理能力、流式生成。

具身過去一直跟在大語言模型和視頻模型後面兩三步,但現在這個距離正在縮短。在ICL和持續學習這件事上,我甚至認為具身的需求會更加緊迫。因為語言模型答錯一個問題,你可以再問一次。而機器人真正進入一個新的物理環境以後,它必須不斷面對訓練數據裡沒有出現過的東西。我們的判斷是,持續學習對大語言模型可能是能力的進一步延伸,但對具身智能,它更可能是走向真正通用和落地所必須補上的一塊。04白鯨實驗室: 這次你為什麼決定要創業?這應該是你的第二次創業了。高宇翔:是,上一次是當CTO,但這次是CEO了。我覺得當下是一個非常少見的範式轉換的窗口機會。另一個原因是,我在行業探索上有了眉目,終於可以放開手做這件事了。

25年大家把VLA數據Scale上去發現效果沒想象那麼好,開始找其他路。但這個過程也沒那麼容易。PI(Physical Intelligence )決定具身VLA的範式,現在回看它的設計似乎非常簡單。但每一步為什麼這麼設計,為什麼有效,都非常依賴經驗。而世界模型目前還沒有這樣一個範式存在,需要從頭探索。這也是我在傅利葉主要做的方向,我們在自己機器人上做了實驗和探索,得到了比較正向的結果。白鯨實驗室:過去三年,你從創業公司做CTO,到具身公司的模型負責人,再到現在CEO。身份變化還挺大,會不適應嗎?高宇翔:一開始肯定不適應,但最近好多了,畢竟我也需要“ICL”我自己。

當然,也是因為最近團隊搭建快速走上正軌,也看得到自己的想法被一點點驗證。白鯨實驗室:你有焦慮過嗎?高宇翔:每天都會焦慮一會會。(笑)白鯨實驗室:焦慮什麼?高宇翔:看到行業裡的新論文,我就很焦慮,他們怎麼這麼快。白鯨實驗室:你會怎麼平衡這種焦慮?高宇翔:我自己有一個小技巧,我從CEO的角度跳出來變成研究者,去看他們的工作是不是solid的,研究他們的發佈邏輯是什麼,宣傳了什麼能力,一旦進入分析和學習的過程,其實就沒有那麼容易焦慮。白鯨實驗室:你緩解焦慮的方式就是讀論文?高宇翔:對。(笑)

Related

相關文章

IT之家生成式AI

DeepSeek-V4-Flash-Vision-Exp 模型已開源,多模態 Agent 能力接近 Opus-4.8

Domado、陳倔強123 的線索投遞!8 月 31 日消息,剛剛,DeepSeek V4 首個多模態模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上線,採用 MIT License 開源。公開內容包括模型文件、Tokenizer、Prompt Encoding 參考實現,以及最小化 PyTorch 推理實現,覆蓋視覺編碼器、Aligner、DFlash Attention、MoE、Hyper-Connections 與 DSpark 等核心模塊。

剛剛

今天,“人工智能”這個學科誕生70年了

24分鐘前剛剛,OpenClaw 2. 0來了,龍蝦升級1小時前Mac mini缺貨原因找到了,OpenAI、Anthropic都在搶7小時前閱讀更多內容,狠戳這裡查看AI測評ECDeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇Claude Max 20x在哪兒? 200刀只管5小時Claude Max 20x 虛假宣傳:真實周額度只有 5x 的兩倍!

剛剛

一塊GPU,Claude爆肝48小時自我對齊,效率狂飆15000倍

一款名為 Claude 的 AI 模型近日在一項實驗中展現出驚人的自我對齊能力,僅憑單張 GPU 的算力,便花了 48 小時完成自我調整,整體效率據稱提升了 15,000 倍。這個結果在 AI 圈引發熱議,也讓外界再度關注模型在自動優化與對齊上的可能性。所謂對齊,指的是讓 AI 的行為更貼近人類意圖,過去這類工作往往需要大量人工標註與回饋,成本極高。 這次的做法則是讓 Claude 自行運作、在有限的運算資源下持續修正自己的輸出。

剛剛
IT之家生成式AI

阿里千問創作上線 Agent Teams 功能:用戶提出創意,Agent 規劃任務完成視頻製作

首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 阿里千問創作上線 Agent Teams 功能:用戶提出創意,Agent 規劃任務完成視頻製作 2026/8/31 14:59:55 作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 西窗、未央 的線索投遞!

剛剛