對話橡木果機器人姜嶢:讓機器人像人一樣,憑“本能”幹活

智客ZhiKer2026.08.11 11:15 · 來自北京全文5042字00:00 / 15:59觸覺是第一“目擊者”,視覺只是旁觀者。智客ZhiKer獲悉,具身智能企業橡木果機器人(Acorn Robot)已完成天使輪融資,領投方為招商局創投和蔚來資本,本輪融資將主要用於面向工業柔性生產的機器人產品研發、品牌體系構建與市場拓展。2024年底,姜嶢作為發起人,與其他8位清華大學機械工程系博士成立橡木果機器人公司。他是清華機械工程系博士、哈佛大學工程與應用科學學院博士後,深耕機器人操作領域近15年。
同時,他也是清華唯一一個機械工程背景投身具身創業的人,與當前絕大多數來自計算機、軟件、自動化和電子背景的具身創業者不同。在他看來,操作底層本質上是個接觸力學問題行為,因此在2017年提出了"本能驅動"路線。這是一條與主流VLA和世界模型路線完全差異化的技術路徑。以觸覺為感知底座,自下而上地讓機器人通過本能反射"長"出操作能力。具體而言,橡木果機器人將任務規劃與操作執行解耦,上層大模型負責任務理解與分解,輸出關鍵幀和語義約束;操作執行層則由橡木果自研的Natus本能模型和Magis技能模型承擔,在物理世界中以毫秒級精度完成操作。
這與主流VLA端到端方案把感知、決策、執行塞進一個黑箱模型的做法截然不同。姜嶢判斷,操作的底層邏輯是交互行為,交互無窮無盡,跟語言不是一套邏輯。VLA本質是模仿,無法從底層理解操作。模型越大越脆弱,本體差異、接觸特性一變就會崩。觸覺是第一"目擊者",視覺只是旁觀者,VLA裡連觸覺數據都沒有,只能照貓畫虎。2026年3月,公司完成近億元種子輪融資。5月,完成首個柔性產線POC驗證。6月,正式發佈"本能驅動"技術路線。姜嶢說,從提出本能驅動到現在,團隊在這件事上投入了八年的時間。
在本輪融資發佈之前,我們見到了他,聊到了"本能驅動"的神經科學起源、為什麼VLA路線走不通、任務規劃與操作執行為什麼要解耦,以及一個做了15年機器人操作的人,為什麼選擇在2024年底才走出來創業。橡木果機器人(Acorn Robot)發起人姜嶢▎以下為與姜嶢的對話全文,略有刪減:關於路線選擇智客ZhiKer:你在機器人領域做了十五年,為什麼到2024年底才成立公司?姜嶢:當時我們沿著這條技術路線已經探索了多年,創業是為了給這個技術找到一條最快的迭代路徑。從2025年我們正式啟動商業化,一年內就走完了從技術積累到落地的閉環。
智客ZhiKer:2017年你就提出"本能驅動"這條路線了,最早是什麼觸發了您對這個方向的思考?姜嶢:2016年我從清華機械工程系博士畢業,又去哈佛讀博士後,方向是神經科學,研究人的操作行為和運動行為。課題裡我發現了一個機器人領域長期忽略的事實,操作行為和語言行為,底層機制完全不同。語言沒有先天本能。一個人不經過語言訓練,一輩子學不會說話,這是後天數據驅動習得的能力。操作行為不一樣,它是本能,出生就有,不需要教。把一個新生兒放到陌生環境裡,只要他能看見東西,就會伸手去抓。全世界所有人抓東西的行為模式基本一致,有信號刺激就有反射。李飛飛最早不是做計算機視覺的。
她先學物理,後來在加州理工學院讀博研究人的視覺神經機制,發現人能在幾十毫秒內識別物體,而且是從全局到局部。後來她構建ImageNet驗證計算機能不能達到人的水平。她說,生物進化是從0到1,真正進化出智能,我非常認同這個觀點,本能驅動的底層邏輯,跟這個一脈相承。智客ZhiKer:怎麼證明"本能驅動"用在機器人操作上,確實比走大腦決策那條路更好?姜嶢:人的觸覺信號傳到大腦要200到250毫秒,大腦決策再傳回來,就算決策本身無限快,往返也要差不多500毫秒。我們設計了一個最簡單的實驗來驗證這個數字,讓機器人抓一個從來沒見過的物體,力度必須剛好,力氣大了捏扁,力氣小了掉落。傳統方法無非兩條路。
要麼物理建模,解質量、質心、摩擦係數,但現實中你不可能裝配前先解方程,而且完全沒有泛化性。要麼數據驅動,數據量大、模型大,實時性和泛化性都不行。在實驗中,從擾動出現到響應的時間遠低於500毫秒,說明信號根本沒傳回大腦,而是在手部就完成了類似肌肉反射的執行。這些證據證明本能反射的存在,不需要大量數據傳回訓練後再指導動作。之後我們又花了4年時間,在2021年,我們發現觸覺中有一個"滑移"通道,抓東西時要掉不掉的感覺,這是一個最底層的本能感覺。智客ZhiKer:當前主流的VLA端到端路線你怎麼看?
姜嶢:主張VLA路線的人,大多來自大語言模型、自動駕駛、圖像生成這些領域,認為數據能解決一切,把工具看得比事情本身更重,這是路徑依賴。但操作的底層邏輯是交互行為,交互的可能性無窮無盡,跟語言完全不是一套邏輯。VLA本質是模仿,沒辦法從底層理解操作。你看Figure AI做的動作,會有很多莫名其妙的小動作,比如無緣無故扶眼鏡,因為訓練數據裡混入了這些行為,它只是在擬合數據,找不到最流暢的執行方式。操作不存在所謂的通用大模型,本體差異、接觸特性一變,模型就會崩。模型越大越脆弱。觸覺是第一"目擊者",視覺只是旁觀者。VLA裡連觸覺數據都沒有,只能照貓畫虎。
智客ZhiKer:為什麼要把任務規劃和操作執行解耦,背後的思考是什麼?姜嶢:任務泛化和硬件泛化的邏輯完全不同。乒乓球規則全世界都一樣,這是任務;但每個選手的打法千差萬別,這是硬件適配。任務規劃是人類社會定義的概念,什麼叫疊衣服、什麼叫衣服,這是自上而下的,通過大量數據驅動,見得多懂得多,能做到規則統一。操作執行是從本能出發、自下而上,解決的是怎麼幹,需要適配硬件、接觸不同環境,可能性無窮無盡,靠本能去適應。所以對操作來說,沒有最好的預訓練模型,只有最適配硬件的模型。它們不能在同一個黑箱裡訓練,必須各自獨立演進,通過標準化接口協同。這是我們把任務規劃和操作執行徹底解耦的根本原因。
智客ZhiKer: Natus和Magis是對應任務規劃和操作執行嗎?姜嶢:不,兩者都在操作執行層,但分屬不同階段。Natus是端側自主決策模型,它能做到"零數據冷啟動",保證機器人一上來就會做。Magis是通用操作技能模型,依託Natus在真實物理世界探索產生的數據訓練,實現一上來就熟練。關係是Natus先通過本能催生行為湧現,讓機器人自主"長"出操作能力,Magis再在此基礎上積累技能,實現跨物體、跨場景的遷移。舉個例子,抓香蕉。Natus通過多次自主探索完成抓取,過程中不僅記錄視覺圖像,還通過觸覺感知自動完成語義打標:香蕉重120克,質心偏左,表皮粗糙,硬度中等。
這些力學語義被實時疊加到視頻幀上,讓Magis能真正理解物理世界的力學屬性,而不只是外觀。基於這個,機器人可以直接選最佳抓取位置、施加恰當抓力,高效完成任務,而且具備跨物體的泛化能力。智客ZhiKer: Natus模型如何實現0數據啟動?姜嶢:模型裡定義的不是具體動作,是本能規律。通過“信息感知”的刺激直接構建出“本能”,即感知的期望,繼而驅動機器人自主探索、收斂於該期望,最終自發湧現出操作行為。本能給了機器人一種渴望收斂的終點狀態。拿疊衣服舉例:先定向找到要疊的角,再探索怎麼捏住,最後執行捏褲腿和摺疊。不管從哪個環節出發,動作最終都會受本能支配回到期望狀態。
我們刻意不直接定義動作,因為動作無窮無盡,而是定義期望,讓本能驅動執行過程,核心是信息感知到動作輸出的映射。智客ZhiKer: 也就是說,這個模型裡沒有預先採集和訓練好的數據?姜嶢:是的。Natus 不依賴任何離線的、預採集的數據集,但不意味著它不接觸任何數據。數據與預訓練模型的數據完全不同。VLA等預訓練模型收集的是樣本數據,這些數據是脫離物理交互的、靜態的、被所人類定義的,與真實物理世界存在Sim-to-Real鴻溝,且無法包含交互過程中豐富的、時變的力學信息。
Natus是在工作中實時處理交互感知信息,其包含了大量豐富的力學語義,這些信息是在真實物理世界“探索-交互”的過程中,實時在線產生的。是100%真實、100%與硬件適配的,因為它就是機器人自己“摸”出來的。這裡有一個我們反覆強調的觀點,沒有人能在教室裡學會游泳,必須親自下水。最好的數據是真實物理世界中執行產生的數據,任何仿真器都無法100%還原。就像自動駕駛不可能在工廠裡學會,必須把車賣出去讓用戶在各種路上開,數據不斷迴流反哺模型。智客ZhiKer: 聊一下硬件。操作執行中採集數據的載體是什麼?姜嶢:夾爪。智客ZhiKer: 你們的觸覺有什麼特別的?
姜嶢:我們從2019年開始自研視觸覺傳感器,用視覺方案做機器人手指觸覺。這條路線走了七年,產品迭代了十幾次。迭代在兩個層面同時進行。一個是拓展感知能力,從只能感知形面,逐步做到分佈力、滑移、軟硬等五大行為維度。另一個是產品化打磨,穩定性、耐久性、可靠性、魯棒性,還有成本。智客ZhiKer: 抓取速度有優勢嗎?姜嶢:肯定快。兩個原因。模型非常小,能以250赫茲也就是4毫秒週期持續迭代,視頻表現非常絲滑,而且整個模型跑在手指端側,決策鏈路極短,響應更快,VLA模型太大,每一步都在"想"了再執行。智客ZhiKer: 傳感器怎麼維護?
姜嶢:傳感器在在末端操作執行器中,兩個末端執行器分別作了做快拆快換設計,如果壞了客戶更換末端執行器就行。傳感器表面是硅膠材質,通過工藝和塗層處理保證兩到三年力學穩定且耐磨,壽命達到千萬次級別,這是工業現場的基本要求。關於商業化智客ZhiKer: 2025年就完成了商業化落地,你們聚焦哪些場景?姜嶢:柔性生產場景,尤其是SKU上千種的客戶。這類客戶動銷需求高,換產時怎麼快速適應是核心痛點。比如快消品,迭代週期極快。我們不做原材料加工,我們只做組裝環節,零部件已經加工好,我們負責把它們組裝在一起。智客ZhiKer: 最終交付給客戶的是什麼?部署需要客戶怎麼配合?
姜嶢:交付的是解決方案和服務,任務規劃加操作執行一體化,能處理上下料、組裝等完整任務。多個生產單元可以組成生產集群,實現分佈式柔性生產。形態上我們不做人形。工人對人形有牴觸,而且人形增加了無價值的成本。我們用標準雙臂形態,核心能力在末端操作和模型上。部署方面,我們走過彎路。最早試過在客戶已有產線裡見縫插針式地改造,發現節拍跟不上上下游,配合出問題。現在分兩步走。第一步獨立接單生產,在旁邊作業,好處是採集數據、深度綁定客戶。第二步推動客戶下一代產線全部用我們的生產單元方式構建,集成調試時間大幅縮短,換產靈活。智客ZhiKer: 採集的數據迴流到模型,客戶會介意嗎?姜嶢:模型分兩層。
底層通用模型不涉及業務數據,可以拿走訓練。上層執行層的技能模型涉及客戶工藝數據,屬於客戶資產,放在客戶側使用完全合理。客戶最擔心的就是數據被拿去給競爭對手用。智客ZhiKer: 團隊規模多大?融資後資金主要投向哪裡?姜嶢:團隊不到30人,70%是研發。融資後的資金投兩端:一是產品定義和設計,真正理解用戶需求,把柔性生產單元產品定義好、設計好;二是品牌建設,影響市場、構建體系,產品生產全部外包。智客ZhiKer: 最後一個問題,你最終想做成一傢什麼樣的公司?姜嶢:我們的使命是以「具身本能」驅動機器人操作革命,躍升全球生產力。也就是將現代工業柔性生產的效率極致提升。
工業自動化已經將它能做的做到了極致,但成本和有上限。我們基於具身本能的技術路徑做創新產品,用生產單元作為載體,去處理柔性化、多品類、批量換款的任務。切入點選擇上,就像ImageNet證明了視覺識別能力、AlphaGo證明了圍棋能力,我們要在商業上證明價值,讓用戶真正掏錢買,商業化能閉環。好的抓取不是簡單抓起來,而是不需要大量數據就能探索、能力不斷提升、適應各種物體和環境,絲滑柔順、魯棒可靠。這覆蓋加工上下料、物流分揀、農業採摘、商超上架等全場景。長期目標是成為全球具身智能產業不可或缺的底層基座,讓每一臺機器人在物理世界的操作像電力一樣成為即插即用的基礎能力。
(本文首發APP,文 | 智客Zhiker,作者|郭虹妘,編輯|楊琳)
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。