樂享以太大模型,讓中國具身智能坐上定義席

本文作者: 叢末 2026-09-23 09:46 導語: 從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。作者丨幸麗娟 編輯丨董子博 具身智能行業一直在等一個 ChatGPT 時刻。但這個時刻,未必長得像 ChatGPT。決定這個時刻的,不是機器人會聊天,也不是機器人學會了幾個動作,而是在不確定環境裡,機器人能不能自主思考、判斷和執行,在無序的事件中,持續完成任務。過去兩年,行業積累的幾乎全是“能力上限”的展示:選好場景、選好時機、反覆調試,再拍出一條完美的Demo。
上限可以“被編輯”出來展示。真實效果如何,卻少有人敢公開測。但機器人真正進入現實世界,考驗的不只是最好時能做到什麼,更是環境不斷變化時,它還能不能把事情做下去。9 月 16 日傍晚。上海閔行一家燒烤店門口,樂享科技讓兩臺機器人擺起了燒烤攤。接下來近一個小時,它們要接單、烤串、上菜。這場直播的規則,測的正是機器人在這種真實環境裡的應變能力。沒有剪輯,沒有遙控,沒有預設腳本。更絕的是,觀眾可以實時干預:隨機出題,自由改造場地佈局,隨手改道具擺放位置,臨時打斷正在進行的任務並追加需求。現場 3 桌、6 名顧客的主線任務,就是“干擾”,看機器人能不能像人一樣自己“圓場子”。
而就在不久前,這家公司剛剛站在了一場輿論風暴的中心。故事線是這樣的:7 月,樂享上線以太大模型官網並公開完整技術路線;8月26日,一段機器人協作收拾房間的10分鐘一鏡到底 Demo,在具身圈傳開。9 月 3 日,OpenAI 上線 GPT-6 Astra 官網;三天後,首席科學家 Jakub Pachocki 發表萬字長文《異星心智》。9 月 10 日,樂享創始人郭人傑發文,三問 OpenAI:技術理念為何高度重合?概念表述為何如出一轍?官網設計為何似曾相識?他稱對方“像素級搬運”“直接蒸餾”,並稱法律團隊已啟動程序。輿論隨之分成兩派。
一派說這是硬實力,另一派說這是“蹭熱度”、“demo造假”。面對這些質疑聲,樂享決定讓搭載以太大模型的機器人自己上場回應。於是,這場戶外燒烤直播來了。被推到臺前的,還有一組更根本的追問:當計劃被打破、條件被臨時改寫、任務被中途打斷,機器人還能不能重新收斂到目標?如果能,又憑什麼能?樂享敢把場子開放出來,就是因為以太大模型的架構從一開始就不是為“把預設流程跑完”設計的。這一點,在近一個小時的直播裡看得最清楚。01開放環境直播:一次可被幹擾的硬核測試爐子支起來,名為“二爺”和“五弟”的兩臺機器人各就各位。一臺點單送餐,一臺負責守爐。
整條任務鏈是:接單、分析顧客需求、勘探場地、分揀食材和工具、烤制、動態翻面控溫、成品整理、送餐歸位。為了證明現場沒有遙操,創始人郭人傑把攝像機帶進後廚,翻轉鏡頭拍現場人員,又掀開背景幕布,展示那個唯一能藏人的小房間——裡面各種食材廚具堆得到處都是,完全沒有人遙操的空間。他在開場直言直播的倉促:“我們週日才跟燒烤店老闆聊好,花幾萬塊錢租下這塊場地。”然後,機器人的五項核心能力在這場直播中,被反覆測試:主動感知。服務機器人在完成點單、將需求傳遞給燒烤機器人後,會注意顧客的等餐時間,當感知到顧客等候較久,會主動上前詢問出餐進度。
更細緻的一個瞬間是:在沒有人開口要求的情況下,它想到吃燒烤的顧客會需要紙巾,主動把紙巾送了過去。多模態理解。有顧客在點單時臨時提出“少放辣”。這個需求首先以語言形式進入服務機器人,它需要理解這句話的語義,同時結合視覺信息確認顧客指的是哪一份訂單,然後將新要求轉身傳遞給負責燒烤的同伴。燒烤機器人收到調味指令後,精準識別食物位置,均勻完成撒料操作。這背後是對物體尺寸、材質、位置及相互約束關係的多模態空間理解。流式記憶。一個小時的直播被打散來做:3 組顧客輪流點單、多輪上菜、臨時打斷穿插其中。服務機器人全程沒丟掉手裡的任務鏈,能把進度推進到收尾。
更直觀的一幕是:服務機器人正在給顧客點單,突然被要求“拿瓶水”。它停下點單,先去遞水,再接著把單點完。整個過程沒有猶豫,也沒有等下一條指令。這件事看起來簡單,但對機器人來說不是。打斷一次,上下文就可能被覆蓋,任務狀態歸零,它得重新知道“我剛才在做什麼”“做到哪了”“為什麼做到那一步”。對於其他依賴單步觀測做決策的機器人而言,這幾乎是不可能完成的任務。動力學建模。燒烤機器人自主為食材刷塗醬汁,這個過程非常考驗空間感知和力度控制,因為模型需要理解物體的物理屬性,結合動力學模型輸出符合物理規律的動作。另一個更能說明問題的瞬間是翻面:機器人第一次給食材翻面時沒有翻好,食材掉落爐架。
第二次調整了抓取和翻轉姿勢,成功了。這背後,是動力學建模在實時求解:系統不是從記憶裡檢索一個“標準翻面動作”,而是在當前的重心偏移、摩擦係數和夾持條件下,重新解出了一組能讓動作成立的力矩參數。持續自進化。燒烤機器人翻面第一次失敗、第二次調整姿勢成功的瞬間,同樣是模型持續自我迭代能力的直接寫照。這種並不完美的過程,恰恰能讓人直觀地看到模型是如何通過失敗反饋,自主進化,最終順利完成任務。這五項能力,看似在測五個不同的維度,實際上指向模型從數字世界走向物理世界的真正門檻:機器人能不能在約束不斷變化的情況下,依舊能把事情做對。過去,這個判斷靠人寫規則、靠數據擬合、靠預設流程。
而這場直播驗證了,模型在不同的約束條件下,靠自主智能就可以把“對的動作”解出來。這兩臺機器人默契完成協作任務的畫面,很容易讓人想到八月底那段在具身圈刷屏的視頻。10分鐘,一鏡到底。狹小的空間裡,兩臺不同品牌和型號的機器人,全程自主協作收拾房間。視頻裡發生了這些事,值得反覆琢磨——一臺機器人用刮水器擦玻璃,有一處怎麼都擦不乾淨。它重複幾次後停下來,判斷髒東西可能在玻璃外面,於是把刮水器伸出窗外;接著,它收拾桌面,雙手被佔滿時,另一臺主動拿起桌上的圍巾掛到它脖子上,發現圍巾太長,還用雙手把圍巾捧起來,被幫助的機器人看懂了,彎下了腰......
雙方通過自主協同,完成了這次物品“遷徙”;隨後,較矮的機器人要把圍巾放進櫃子上方隔層,可它只有 1.3 米,夠不到。它找到旁邊的箱子推到地上,想彎腰搬起來墊腳,卻發現自己彎不下腰,於是它選擇用腳踢過去;箱子踢歪了,機器人又開始琢磨怎麼把箱子回正,這時候,身高 1.7 米的另一臺機器人走了過來:它似乎看出了同伴的困境,放下了手上的活,主動幫忙把圍巾放到目標位置。中途鬧鐘響了,兩臺機器人轉去處理桌面和冰箱收納任務,做完再回來接著做沒做完的事,進度沒被清零。一個在室內,一個在戶外;一個做家務,一個要烤串上菜。
展示的卻是同一件事:以太大模型可以讓機器人自主思考,自主決策,並在試錯中完成自我進化,以及實現跨本體協作。這背後,還有一個更深層的追問:它憑什麼做到?要回答這一點,得先看市面上現有的具身智能主流方案為什麼做不到。02VLA 和 WAM ,繞不開“預測”這道坎當前具身智能有兩條主流路線:VLA 和 WAM。2026年4月,英偉達研究科學家Jim Fan在紅杉AI Ascent大會上宣告:VLA 已死,WAM 當立。這番論斷將兩條路線的爭論推到了臺前。但無論是哪條路線,兩者的底層邏輯卻是同一件事:預測。
▎VLA 預測動作分佈從 RT-1、RT-2 到 OpenVLA,再到 Π0 系列,VLA 的思路是:把圖像和語言指令編碼進一個多模態主幹,直接解碼出動作序列。數學上,它學的是一個條件動作分佈 p(a|o,l)。給定當前觀測 o 和語言指令 l,輸出動作 a。這條路的好處很直接:快。鏈路短,延遲低,能接高頻控制;語言模型的語義能力可以直接複用,機器人“聽得懂”開放詞彙的指令。但隨著模型走向更加開放的真實環境,一些結構性缺陷也開始暴露。第一個缺陷,是語言被架空。ICML 2026上的一篇論文(LangForce)給這個缺陷起了一個學術名字:信息坍縮。
在目標驅動的數據採集範式下,語言指令往往僅憑視覺觀察就能高度預測——看到櫃子就對應“開櫃子”,看到瓶子就對應“拿瓶子”。指令與動作之間的條件互信息趨近於零,模型實際上忽略了語言,退化成了一個純粹的視覺策略。在 RoboCasa 基準上,一個完全忽略語言指令的純視覺模型,成功率與接收完整語言指令的模型幾乎相同。這意味著,VLA 學到的不是“理解指令然後行動”,而是在特定視覺場景下匹配特定動作。它把“聽懂”和“看見”悄悄合併成了同一件事。而合併的代價是:分佈外的新場景、新任務,泛化會顯著下滑。第二個缺陷,是它跳過了對環境的動力學建模。它不預測動作執行後世界會怎麼變,只學“這個場景對應什麼動作”。
所以它沒法回答“我把手伸出去會不會撞到窗框”這類問題,因為它壓根沒在算這件事。▎WAM 預測未來世界狀態與動作WAM 就是為了補 VLA 的第二個缺陷來的。它採用“先預演、後動作”的推演式架構:先預測動作執行後世界狀態會如何變化,再反推最優控制指令。數學上,它學的是一個未來狀態與動作的聯合分佈 pθ(s{t+1:t+H}, a{t:t+H-1} | o{≤t}, a{<t}, l)。給定歷史觀測 o{≤t}、歷史動作 a{<t} 和語言指令 l,同時輸出未來 H 步的狀態序列 s{t+1:t+H} 和動作序列 a_{t:t+H-1}。這條路補上了 VLA 缺失的物理預測。
它學的是“物體被推、被抓、被丟棄時會怎樣移動”,這種物理知識比語義知識更通用。但它依舊沒有解決信息坍縮問題。WAM 的視頻預測同樣綁在具體本體的相機視角上,語言指令在其中的權重依然很低。它補了物理,沒補語義。而且代價很大。基於視頻擴散 Transformer 的 WAM,推理時要逐幀預演未來狀態。NVIDIA 的 DreamZero 訓練一次要 8 張 H100 跑 25 天。而且長程預測的誤差會逐步累積,最終誤導決策。VLA 快,但語言被架空、不做動力學;WAM 補了物理,但代價高、語義弱。兩者都在用“預測”驅動決策——一個預測動作,一個預測世界狀態。而真實世界的變體是無窮的。
光照角度、物體擺放、地面摩擦、人的隨機干預,這些變量的組合空間不可能被窮舉。預測範式的天花板就壓在這裡:分佈外,沒有高概率樣本可取。也就是說,預測範式依賴的是訓練數據裡見過的情形。分佈外沒有數據,模型就沒有可參照的概率分佈,決策也就失去了依據,預測出“下一個對的動作”更是無從談起。那還有別的解法嗎?樂享沒有執著於在“預測”這道題上找最佳答案,而是直接換一個題:不預測“下一個最可能的動作”,求解的是“約束條件下,什麼狀態會更接近目標”。03以太大模型:從“預測”到“求解”作為機器人的大腦,以太大模型的核心機制是 Energy-Driven(能量驅動),底層由神經元分配來支撐。
兩者各回答一個問題:用什麼來判斷一個狀態是不是“對的狀態”,以及這個判斷在哪裡被計算出來。▎能量驅動:用什麼來判斷“對的狀態”“能量”這個詞容易讓人聯想到物理能量,但它在以太大模型裡是一個數學對象:任務完成度、物理約束、記憶狀態和動作可行性,被整合進一個統一的能量函數。每個項都是一個數字,描述當前狀態在某個維度上“有多好”或“有多差”。加起來,得到一個總分。總分越低,狀態越好。機器人的決策過程,就是在這個能量地形上找低點。哪個行動能讓總分降得更多,就執行哪個。對比來看,VLA 和 WAM 的底層都是概率對象,都受同一個數學性質的約束:分佈是歸一化的,所有可能結果的概率加起來必須等於 1。
這就帶來一個限制:兩個分佈無法直接加在一起,得到一個新的合法分佈。“把杯子拿起來”是一個分佈,“不要碰到旁邊的碗”是另一個分佈。把這兩個分佈相加,在數學上無法構成一個新的合法分佈,更不可能自動獲得“拿起杯子同時不碰碗”的語義。從機制上看,這就是 VLA 和 WAM 在“多任務”上吃力的根本原因。每多一個約束,要麼往訓練集里加數據,要麼加一個適配模塊。約束進的是訓練集,不是目標函數。而能量是標量,標量天然支持複合:任務目標是一個能量項,物理約束是另一個能量項。加起來,就得到一個新的目標函數。不需要重新訓練,不需要為每個任務單獨微調。
這是能量驅動和預測範式最根本的分野:預測範式把約束塞進數據,能量範式把約束寫進目標。決策方式也跟著變了。擬合分佈的模型本質上在做條件檢索:給定當前觀測,從訓練分佈裡找出概率最高的動作——這也是它在分佈外會塌掉的原因,分佈外沒有高概率樣本可取。而能量最小化是一個優化過程:它在當下的具體環境裡當場找一個低能量解,而且求解自帶剪枝,能量高的候選會被迅速淘汰,不必把成千上萬條路徑都推演完。回到出租屋裡擦玻璃那個瞬間。VLA 如果沒見過“玻璃外側有汙漬”,不會主動把手伸出窗外,因為“伸出窗外”從未與“擦玻璃”配對過。
但在能量框架下,“擦玻璃”的目標是把玻璃表面的狀態從“髒”推向“乾淨”,物理約束包括“汙漬可能在任一側”,內側達不到目標,系統自然搜索到外側。搬箱子那個瞬間更清楚。機器人要把圍巾放進上方的櫃子,夠不到,它就找到箱子,想搬起來墊腳,但發現自己彎不下腰。試了幾次之後,它一腳把箱子踢到了櫃子邊。這“一腳”不是被檢索出來的。如果訓練數據裡沒有“用腳踢箱子到櫃子邊”這個動作,VLA 和 WAM 都不會主動做這件事。但在能量框架下,“目標物不可達”是一個能量項,“箱子可以承重”是一個物理約束,“彎不下腰”是一個本體約束,“腳可以推動箱子”是另一個物理約束。系統在當下環境裡,用這些約束解出了一條可行路徑。
它判斷下一步行動的方式,不是從記憶裡翻答案,是當場“解題”:在約束不斷變化的當下,重新解出什麼才是對的狀態。▎神經元分配:“對的狀態”在哪裡被算出來能量驅動定義了“用什麼來判斷一個狀態是不是‘對的狀態’”,但還有一個工程問題沒解決:這個判斷需要在每一步決策中實時計算。如果每一次評估都要激活整個 4B 模型,算力根本撐不住實時閉環。以太大模型的解法是神經元分配。它按需調度計算資源,不讓整個模型始終處於活躍狀態。
架構上,它搭了一條仿生神經通路:前額葉皮層負責意圖解析和長時序規劃,角回與內嗅皮層負責流式長時記憶,頂上小葉與上丘負責主動感知,運動皮層與小腦負責運動規劃與動態補償,脊髓層負責力位控制與本能反射。這套架構真正的關鍵,不在分層本身,而在分層之間的運行方式:信息是雙向的。它不是“感知層→理解層→決策層→控制層”的單向管道。思考的結果流向軀體,軀體的傳感器反饋回傳上層認知。腦子在想的時候,身體已經在響應;身體遇到突發擾動的時候,認知也在同步更新。時間尺度被解耦了。高層推理是慢的,它處理的是“擦不乾淨要不要換一面”這類需要認知參與的問題。
而碰到外力、抓取打滑、姿態失衡這類響應,下沉到脊髓層,不走完整的高層推理。主動感知是“能量項”,不是“功能模塊”。傳統機器人是“拿到什麼圖像就處理什麼”。而以太大模型會自己轉視角、移動機身、換觀測姿態去補盲區。這件事在能量框架裡的邏輯很清晰:信息不足意味著不確定性高,而不確定性本身就是一項能量,所以“去看一眼”是降低能量的自然解,不需要額外寫一條“探索策略”。直播裡,機器人面對陌生調料瓶花了幾次嘗試才摸到合適抓法,翻面在失敗一次後重新調整姿勢後成功。這些瞬間背後都是同一個機制:不是每個決策都走完整推理,抓取打滑下沉到脊髓層快速響應,高層認知同時判斷要不要換一種抓法。
而自我思考、自主進化的關鍵,也藏在這個機制裡。機器人嘗試失敗後,通過實時調整策略取得成功,這個過程裡,模型參數沒有變,變的是它在當下重新解出來的動作。它不需要等下一次訓練才能變好,在幹活的過程中就能持續修正自己。這也許才是“自進化”在工程層面的真實含義:不是預先訓練出來的,而是運行中當場“解”出來的。Yann LeCun 近期在 ECCV 2026 主旨演講中說過一句話,恰好點到了同一件事:如果機器人經過預先訓練才完成任務,那只是在套用“配方”。這不是智能,只是陳述性知識和技能的堆積。因此,真正的智能,不是在見過的情形裡做對,而是在沒見過的時候,依然有辦法。
▎監督信號從哪來:物理後果本身就是評分這套機制裡還有一個很少被展開、但很關鍵的差異:監督信號的來源變了。它是理解 200/0/4 這三個數字的鑰匙。VLA 想進化,需要動作標籤。而動作標籤的高質量來源,目前仍然主要依賴真機軌跡——每條軌跡背後都是遙操作、人力、設備成本。這是當前 VLA 訓練鏈條中成本最高、也最難規模化的一環。WAM 想變強,需要未來畫面。人類視頻可以用,但視頻裡沒有動作標籤,所以它只能學“世界怎麼變”,再反推該做什麼。能量驅動的模型不一樣:能量值本身就是評分。執行結果和預期不符、物理約束被違反、任務完成度沒到,這些在能量面上直接體現為“能量沒降下去”。
不需要有人告訴它“這次做錯了”,環境本身給出了反饋。這就是 Evolution Manager 能成立的底層邏輯。這套邏輯,在學術上已有驗證。2023年,Google DeepMind 發表了一項關於能量模型作為機器人策略的論文,證偽了“高維連續空間中的能量模型不可訓練”的長期說法,並給出了可用的訓練目標。EBT-Policy 則進一步驗證:用標量能量做機器人策略,部分任務上兩步推理就收斂,相比擴散策略常見的 100 步減少了 50 倍。並且在沒有任何專門訓練的情況下,能從失敗動作序列中零樣本恢復。回到那三個數字。
200 小時人類視頻,一個人要連續 8 天才能看完;0 小時真機數據,意味著沒有一條遙操作軌跡;4B 參數,是當前通用 VLA 和 WAM 的十分之一到幾十分之一量級。行業對 Scaling 的默認假設是能力來自數據和參數的堆疊,所以這組數字容易被讀成“樂享在挑戰 Scaling Law”。這個說法帶偏了重點。重點是:模型從什麼東西里學。過去,機器人要學會一個動作,需要有人告訴它“看到這個場景,手腳應該怎麼動”。這個“告訴”的過程,就是標註。標註越細,成本越高。Aether 換了一種學法:它不看人怎麼動,看結果對不對。
東西有沒有烤好、盤子有沒有端穩、調料有沒有撒上——這些事情的成敗,結果本身就說明了一切。不需要有人額外標註“這一下對了”或“這一下錯了”。人類視頻裡確實沒有動作標籤,但充滿了結果:重力讓東西下落,接觸讓物體移動,工具被使用後會留下痕跡,汙漬被擦掉後表面會變乾淨。這些都是物理後果。任務有沒有完成、動作有沒有違反物理規律,可以從結果裡反推出來。所以數據需求下降,是換了一種學法之後自然發生的事。▎跨本體成為“水到渠成的結果”VLA 學的是動作空間,而動作空間是本體相關的——雙臂、靈巧手、輪式底盤、人形,關節維度和構型都不一樣,所以跨本體通常需要額外編碼本體信息。
WAM 的視頻預測同樣綁在具體本體的相機視角上。但能量函數定義在任務狀態和物理約束這一層,是本體無關的。換一臺機器人,不變的是目標項和物理項,變的只是“這臺身體的力矩上限、可達空間、重心穩定性”這幾個約束項。這也解釋了以太的 Self Model(自我模型)為什麼要顯式表徵“本體能力邊界”:它不是要表示自己是什麼形狀,而是要表示“哪些動作在我這個身體上不可行”。正是有了這個自我模型,同一個“大腦”進入不同的身體,只需要重新求解一次能量最小化。
戶外燒烤直播裡,烤串和上菜由兩臺不同的機器人完成,烤到什麼程度該出餐、顧客改了口味該怎麼同步,沒有一步是提前設定的,是兩臺機器人在現場根據彼此的任務狀態實時協調出來的。來自兩家互為競品廠商的機器人,身高不同,構型不同,共用一套模型,自主分工。機器人拎拖鞋拎的是掛繩、把毛巾試三次掛上自己肩頭,這些細節反過來也是它“瞭解自己身體”的證據。回過頭來看戶外燒烤直播測試和10分鐘一鏡到底Demo 展示的五項能力,都並非從數據集中訓練而來,是這四個底層機制裡湧現出來的。跨本體不是一個需要額外攻克的工程模塊,它是能量函數定義在本體之上的一個水到渠成的結果。一個燒烤攤,比任何一間實驗室都難。
風一吹,炭火忽大忽小;烤串在爐子不同位置,火力不一樣,得挪來挪去;地面不平,端著盤子走的時候會晃;顧客站在旁邊,隨時改主意。如果這些它都能應付,那“Physical AI 的第三條路”就不再只是一個完美預設的 Demo,而是一臺真真切切在戶外幹起了活的機器人。04重塑具身智能的“解題範式”200 小時人類視頻、0 小時真機數據、4B 參數,在戶外開放環境裡跑通了長時序任務和跨本體協作。以太這個模型的出現,在具身圈是地震式的。它的意義不僅僅是,在 VLA、WAM 之外,開闢了Physical AI的第三條路,更在於它重新定義了具身智能的整套“解題範式”。
具身模型過去的問題是:機器人下一步該做什麼?模型學的是一套從觀測到動作的映射,遇到沒見過的場景,就只能靠檢索、靠猜。以太大模型直接換了一個問題:當前狀態下,機器人做什麼才是對的?問題一換,跨本體、長時序、自進化這些原本各自為戰的能力,就變成了同一個機制在不同約束下的表現。它是一個更強的機器人模型,更是一條截然不同的解題思路。這套“解題範式”對於整個具身行業的意義,具體體現在三個方面。第一,“大腦”和“身體”的關係變了。過去兩年具身智能的默認假設是:先有一個聰明的通用模型,再想辦法適配到機器人上。
這個路徑下,“跨本體”永遠是一個後置的工程問題:不同身體構型不同、動作空間不同,模型要重新適配,成本永遠降不下來。而能量驅動的做法把目標定義在本體之上:同一個“大腦”可以進入不同的身體,跨本體從“要攻克的技術難題”變成了“架構設計下自然發生的事”。這件事如果成立,行業的價值鏈會重新排布:大腦和本體解耦之後,“誰的模型能上更多的身體”,會比“誰的身體更靈巧”更關鍵。第二,機器人能力的評價標準要換。如果核心競爭力是“動作庫有多大”,那比的是數據和算力。誰的數據多、算力大,誰就領先。這是資源競賽,大玩家有天然優勢。如果核心競爭力是“計劃被打亂之後能不能自己找回來”,那比的是架構。
架構對了,小團隊也能做出大玩家做不到的事。這也是樂享一個二十人的團隊,能在現在這個時間點,做出以太大模型這樣硬核的具身大模型的原因。第三,“智能從哪兒來”這個問題從根本上被重構。從 Transformer 到大模型時代,主流敘事一直是從視覺或語言出發。“以太”這個名字本身就是一種表態:樂享認為能量比語言更本質。在單細胞生物階段,沒有視覺、沒有語言,能量就已經在引導動作和交互。雖然這條路線還在早期,但方向已經清晰。能量函數怎麼設計、跨本體約束怎麼協同、自進化怎麼在部署中保持穩定——這些問題的答案,會在更多真實場景的迭代中被解開。
而這場直播已經證明了一件事:當環境不再可控、計劃不斷被打斷,一臺機器人可以不等指令、不靠檢索,靠自己在現場解出“下一步怎麼做才是對的”。(公眾號:)從公開質疑OpenAI“像素級搬運”,到把機器人推到上海閔行燒烤店門口直播,背後是樂享對自身技術路線的篤定,也是中國具身智能從“追隨”走向“定義”的一次突圍。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 樂享科技 人形機器人 openai 獨家丨前華為天才少年李元慶加入樂享科技,負責創新 ...科沃斯機器人南京人工智能研究院正式成立 構建行業精 ...做真正懂你的“家人” 科沃斯機器人完美收官德國IFA ...
德國市佔率第一的科沃斯攜最新掃地機器人亮相IFA展 叢末 編輯 發私信 當月熱門文章 誰在為人形機器人鋪「全開源生態」?李飛飛押注的空間智能:生成的世界,如何「經得起折騰」?IJCAI 2026 覆盤局:中國人投了最多的稿,卻到不了最多的場 通用模型竟然比醫療專用模型更懂醫療?
一篇 ACL 論文的兩個反直覺發現 | GAIR Paper 123 IJCAI 2026 四項論文獎、三項個人成就獎,回答 AI 的「來路」與「去路」 最新文章 ECCV 2026 開幕:李飛飛團隊獲時間檢驗獎,7000人擠爆馬爾默 Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026 AI4S青年志① | 搖瓶子的手與調參數的腦:兩個95後和一場物質科學的化學反應 誰在為人形機器人鋪「全開源生態」?給 AI 一張陶罐碎片圖,它能還原破裂過程嗎?Minimax H3 vs Seedance 2.
0 Fast 實測 李飛飛、吳佳俊再聯手,打破世界模型和機器人動作的「巴別塔」 熱門搜索 美團 FAIR 汽車 吳恩達 遊戲 電池 智能眼鏡 Android遊戲 無線充電 Nest iPhone 5C
Related
相關文章

Meta Muse 爆紅,為什麼騰訊股價大漲?
深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。

Opus 5.5來了,性能趕超Fable,成本低至40%
字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.

OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌
正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日核實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。

AI變天,Kimi怎麼補齊“月之暗面”?
光錐智能2026.09.23 10:15 · 來自廣西全文7430字00:00 / 20:20模型強只是入場券,月之暗面還需要補更多課文 | 光錐智能,作者|魏琳華,編輯|劉俊宏AI圈的規則就是用來打破的,市場變化之快,讓公司們經常猝不及防。

DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰
據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026
本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻!只靠語言和 token,AI 永遠跨不過物理世界這道門檻!作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。