李飛飛教機器人摸麻將擠牙膏,AI終於有“手感”了

2026年8月2日 16:51
李飛飛教機器人摸麻將擠牙膏,AI終於有“手感”了

重點摘要

李飛飛團隊發布機器人研究T-Rex,透過高頻觸覺反饋讓機器人完成翻書頁、擠牙膏、摸麻將等精細任務。研究發現,視覺負責規劃「要做什麼」,而觸覺則以更高頻率即時修正動作,避免物體滑落或損壞。這項技術突破讓AI從單純的圖片識別,邁向理解物理世界中物體互動與空間關係的關鍵一步。

站內 AI 整理稿

李飛飛教機器人摸麻將擠牙膏,AI終於有「手感」了

2009年,李飛飛團隊推出ImageNet,讓人工智慧透過海量圖片學會辨識世界。十五年後,她在一場演講中提出「空間智能」的概念,認為AI的下一步,不該只是認出圖片中有什麼,而是要理解物體在哪裡、彼此如何關聯,以及人在其中行動後,世界會發生什麼變化。今年,這條研究路線又往前推進了一步。六月份,李飛飛參與的一項名為T-Rex的機器人研究正式發表,團隊為機器人加入高頻觸覺反饋,讓它成功完成翻書頁、拿雞蛋、擠牙膏、抽取薄卡片與擰燈泡等精細任務。一位以電腦視覺聞名的科學家,為何開始反覆談論觸覺、模擬器與機器人?這並不代表視覺已經過時。

事實上,當前的具身智能廠商仍在為機器人安裝更多攝影機、更高精度的深度感測器與雷射雷達。真正的變化在於,業界逐漸意識到,「看」只是智慧進入物理世界的第一步,一張圖片也僅僅是世界留下的表面痕跡。AI可能根本沒有在「看」。今年三月,李飛飛參與的一項研究設計了一個實驗:研究人員向多模態模型提出視覺問題,但故意沒有傳入圖片。理論上,模型應該回答「我沒有看到圖片,無法判斷」。然而,許多前沿模型仍然開始一本正經地描述圖像內容,給出完整的分析過程,甚至能在部分視覺問答測試中取得高分。例如,在一個胸部X光問答基準測試中,模型從未看過任何X光片,成績卻依然名列前茅。

研究者將這種現象稱為「幻景推理」,模型並不一定依據視覺證據回答問題,而是利用問題中的文字線索與訓練數據中的常見搭配,猜測一張「通常會與這個問題同時出現的圖片」應該長什麼樣。這就像大模型並不一定知道自己在說什麼,而是在推測「下一個最有可能出現的字」。題目問「圖中車輛正在等待什麼信號」,即使沒有圖片,人也能憑常識猜出答案無非是紅綠燈。模型吃過足夠多的圖片說明、診斷報告與問答數據後,也可能繞過真正的視覺觀察,直接從問題跳到答案。它說得非常像看見了,不代表它真的看見了。在聊天視窗中,只要答案聽起來合理,用戶未必關心模型是否真的看圖;但進入物理世界後,兩者的差異會立刻顯現。杯子究竟在桌子左邊還是右邊?

距離手臂還有十公分還是二十公分?這些問題無法靠語言常識蒙混過關,尤其對機器人而言,差幾公分就會直接抓空。這也是為什麼今天的機器人身上出現越來越複雜的感知系統。宇樹G1採用深度相機與3D雷射雷達,分別負責判斷物體遠近與建立空間距離地圖;智元靈犀X2除了RGB-D相機與雷射雷達,還使用前視雙目、後視相機與觸摸感測器,從不同方向補充環境資訊。這些配置看似是一場針對感測器的軍備競賽,實則是在彌補視覺的不同盲區。頭部攝影機適合觀察整個房間,但機械臂靠近物體時容易被自己的手擋住;雷射雷達能測量距離與建立地圖,卻無法辨識桌上的東西是杯子還是蘋果。

對人類來說,轉頭、瞇眼或伸手試探幾乎不需思考,但機器人需要將來自不同攝影機、雷達與關節感測器的資訊拼湊在一起,才能確認自己面對的是同一個、持續存在的物理空間。這兩年,「世界模型」成為AI行業最熱門的詞彙之一。影片生成模型可以根據一句提示詞,生成機器人走進客廳、拿起籃子、湊近玩具、再將玩具放進籃子的畫面,光影、運動與鏡頭都非常自然。觀眾容易產生一種錯覺:既然模型能生成這段過程,它大概已經理解環境與物體如何運作。然而,杯子有多重、櫃門鉸鏈能承受多大的力、機械手碰到杯壁時是否會打滑,這些都不是必須回答的問題,只要下一幀看起來合理,任務就算完成。但對機器人來說,這些細節恰恰決定了任務能否成功。

World Labs今年將目前被統稱為「世界模型」的技術拆分成三類:第一類是渲染器,負責生成給人看的像素;第二類是模擬器,負責表示幾何結構、物理屬性與動態變化;第三類是規劃器,根據目標決定機器人下一步該做什麼。這個分類說明了模型如果只會畫出一個世界,並不等於能在裡面幹活。一輛車可以在生成影片中順利穿梭城市,但鏡頭外的街道是否持續存在、建築是否有穩定的三維結構、車輪與地面之間是否存在真實的摩擦力,模型未必知道。對觀眾來說,像真的就夠了;對機器人來說,世界必須可以被計算、可以碰撞,也必須在它轉過身後繼續存在。

World Labs推出的Marble已能從文字、圖片或影片生成可探索的三維環境,除了供人觀看的畫面,還能輸出碰撞網格,讓物理引擎判斷物體能否穿過牆壁、落地後會停在哪裡。英偉達的Cosmos則將世界生成、影片預測與機器人訓練整合在同一套Physical AI體系中,希望用大量合成場景填補真實機器人數據不足的問題。這條路線聽起來宏大,但落到機器人公司的研發流程中,其實非常樸素:先讓機器人在虛擬世界裡反覆失敗。一臺雙足機器人學會走路,不可能只靠工程師每天將真機推倒幾千次。

逐際動力的TRON 1支援NVIDIA Isaac、MuJoCo與Gazebo等模擬平台,開發者可以在虛擬環境中測試不同地面、坡度與碰撞情況;智元則發布了AgiBot Digital World,用模擬環境生成操作數據、訓練模型並評估機器人策略。在現實中讓機器人摔倒一次,可能意味著零件磨損、維修成本與安全風險;在模擬器中,同一個動作可以由成千上萬個虛擬機器人同時嘗試。桌子的高度、地面的摩擦係數、物體擺放的位置都可以不斷變化,機器人不必真的打碎一萬隻杯子,才能學會如何端穩一隻杯子。不過,模擬器並非答案本身,虛擬世界中的地面永遠比真實地面乾淨,模型設定的摩擦力也無法覆蓋每一種材料。

機器人在模擬器裡練得再熟,進入工廠、商場與家庭後,依然會遇到參數表中沒有的意外。這正是機器人行業長期面對的「仿真到現實差距」。World Labs在7月21日收購SceniX,關鍵也在於此,它不再只滿足於生成可觀看與探索的三維空間,而是開始將模擬出來的世界與真實機器人的行動反饋連接起來。即使視覺與模擬已經足夠成熟,機器人真正碰到物體後,仍會遇到攝影機難以獨立解決的問題。拿起雞蛋時,機器人如何知道手指已經用力過大?抽出一張薄卡片時,它如何判斷自己捏住的是卡片,還是只碰到了桌面?擰燈泡時,它如何感知螺紋已經卡住,繼續旋轉可能會損壞物體?攝影機可以看到手已接近目標,卻很難及時判斷接觸面正在發生什麼。

觸覺解決的不是「物體在哪裡」,而是「接觸以後發生了什麼」。壓力是否增加、物體是否開始滑動、材料是否變形、抓握是否穩定,這些資訊都發生在視覺畫面之下。Figure今年發布的Helix 02,將頭部攝影機、手掌攝影機、指尖觸覺與全身本體感知接入同一套控制系統。當頭部攝影機被機械手遮擋時,手掌中的攝影機繼續提供近距離畫面;指尖感測器則能感知低至3克的力,讓機器人從藥盒中取出單顆藥片、控制注射器推出精確劑量,並在雜亂物體中分離出尺寸很小的目標。

國內廠商也在快速補上這塊感知能力,像是帕西尼這樣的供應商,直接將觸覺感測器、靈巧手、人形機器人、數據採集與多模態模型組成一條產品鏈,希望將觸覺從一個零件問題,變成機器人訓練數據的一部分。但給機器人裝上感測器,並不代表它自然就會使用觸覺。許多被稱為「常識」的能力,並非來自我們看過多少圖片,而是來自身體在漫長的接觸中,學會了讓動作適應世界。李飛飛參與的T-Rex研究展示了這一步為何困難。團隊收集了100小時包含觸覺訊號的機器人操作數據,讓機器人完成翻書頁、轉移雞蛋、擦盤子、擠牙膏、分離疊放的杯子、摸索麻將、開鎖、抽取卡片與擰燈泡等任務。

最終,T-Rex在12項任務中的平均成功率达到65%,比最強對照模型高出30個百分點。研究中一個很有意思的結果是,直接將觸覺數據塞進現有的視覺—語言—動作模型,表現反而很差。原因不難理解:不同感官工作的速度並不相同。視覺與語言適合做較慢的全局判斷,機器人需要先看清桌面,理解人的指令,再決定該拿哪一個物體。但當一隻杯子開始從手指間滑落時,它不會等待模型重新看圖、分析與規劃。觸覺必須以更高頻率持續工作,在滑動發生的瞬間調整手指力度。T-Rex因此讓視覺與觸覺按照不同速度運行,視覺負責回答「我要做什麼」,觸覺則負責不斷修正「我現在做得對不對」。

這不是給機器人增加另一雙眼睛,而是給它增加一條來自現實的即時反饋。過去幾年的AI競爭,主要圍繞誰能造出一個更聰明的大腦。具身智能正將競爭推向一套更完整的系統,機器人需要攝影機與雷達確認世界在哪裡,需要模擬器提前練習行動的後果,也需要觸覺與力反饋處理真正接觸後出現的意外。李飛飛並非直接從視覺轉向觸覺,她的研究路線更像是在不斷擴大「看見」的含義,從識別一張圖片,到理解一個持續存在的空間,再到知道自己伸手碰觸後,世界會如何回應。十五年前,ImageNet教會AI說出眼前是什麼;下一代世界模型需要解決的問題是,當它真的伸出手後,世界會交還給它什麼。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前