李飛飛教機器人摸麻將擠牙膏,AI終於有“手感”了

2026年8月2日 16:51
李飛飛教機器人摸麻將擠牙膏,AI終於有“手感”了

重點摘要

李飛飛團隊發布機器人研究T-Rex,透過高頻觸覺反饋讓機器人完成翻書頁、擠牙膏、摸麻將等精細任務。研究發現,視覺負責規劃「要做什麼」,而觸覺則以更高頻率即時修正動作,避免物體滑落或損壞。這項技術突破讓AI從單純的圖片識別,邁向理解物理世界中物體互動與空間關係的關鍵一步。

站內 AI 整理稿

李飛飛教機器人摸麻將擠牙膏,AI終於有「手感」了

2009年,李飛飛團隊推出ImageNet,讓人工智慧透過海量圖片學會辨識世界。十五年後,她在一場演講中提出「空間智能」的概念,認為AI的下一步,不該只是認出圖片中有什麼,而是要理解物體在哪裡、彼此如何關聯,以及人在其中行動後,世界會發生什麼變化。今年,這條研究路線又往前推進了一步。六月份,李飛飛參與的一項名為T-Rex的機器人研究正式發表,團隊為機器人加入高頻觸覺反饋,讓它成功完成翻書頁、拿雞蛋、擠牙膏、抽取薄卡片與擰燈泡等精細任務。 一位以電腦視覺聞名的科學家,為何開始反覆談論觸覺、模擬器與機器人?這並不代表視覺已經過時。事實上,當前的具身智能廠商仍在為機器人安裝更多攝影機、更高精度的深度感測器與雷射雷達。真正的變化在於,業界逐漸意識到,「看」只是智慧進入物理世界的第一步,一張圖片也僅僅是世界留下的表面痕跡。 AI可能根本沒有在「看」。今年三月,李飛飛參與的一項研究設計了一個實驗:研究人員向多模態模型提出視覺問題,但故意沒有傳入圖片。理論上,模型應該回答「我沒有看到圖片,無法判斷」。然而,許多前沿模型仍然開始一本正經地描述圖像內容,給出完整的分析過程,甚至能在部分視覺問答測試中取得高分。例如,在一個胸部X光問答基準測試中,模型從未看過任何X光片,成績卻依然名列前茅。研究者將這種現象稱為「幻景推理」,模型並不一定依據視覺證據回答問題,而是利用問題中的文字線索與訓練數據中的常見搭配,猜測一張「通常會與這個問題同時出現的圖片」應該長什麼樣。 這就像大模型並不一定知道自己在說什麼,而是在推測「下一個最有可能出現的字」。題目問「圖中車輛正在等待什麼信號」,即使沒有圖片,人也能憑常識猜出答案無非是紅綠燈。模型吃過足夠多的圖片說明、診斷報告與問答數據後,也可能繞過真正的視覺觀察,直接從問題跳到答案。它說得非常像看見了,不代表它真的看見了。在聊天視窗中,只要答案聽起來合理,用戶未必關心模型是否真的看圖;但進入物理世界後,兩者的差異會立刻顯現。杯子究竟在桌子左邊還是右邊?距離手臂還有十公分還是二十公分?這些問題無法靠語言常識蒙混過關,尤其對機器人而言,差幾公分就會直接抓空。 這也是為什麼今天的機器人身上出現越來越複雜的感知系統。宇樹G1採用深度相機與3D雷射雷達,分別負責判斷物體遠近與建立空間距離地圖;智元靈犀X2除了RGB-D相機與雷射雷達,還使用前視雙目、後視相機與觸摸感測器,從不同方向補充環境資訊。這些配置看似是一場針對感測器的軍備競賽,實則是在彌補視覺的不同盲區。頭部攝影機適合觀察整個房間,但機械臂靠近物體時容易被自己的手擋住;雷射雷達能測量距離與建立地圖,卻無法辨識桌上的東西是杯子還是蘋果。對人類來說,轉頭、瞇眼或伸手試探幾乎不需思考,但機器人需要將來自不同攝影機、雷達與關節感測器的資訊拼湊在一起,才能確認自己面對的是同一個、持續存在的物理空間。 這兩年,「世界模型」成為AI行業最熱門的詞彙之一。影片生成模型可以根據一句提示詞,生成機器人走進客廳、拿起籃子、湊近玩具、再將玩具放進籃子的畫面,光影、運動與鏡頭都非常自然。觀眾容易產生一種錯覺:既然模型能生成這段過程,它大概已經理解環境與物體如何運作。然而,杯子有多重、櫃門鉸鏈能承受多大的力、機械手碰到杯壁時是否會打滑,這些都不是必須回答的問題,只要下一幀看起來合理,任務就算完成。但對機器人來說,這些細節恰恰決定了任務能否成功。 World Labs今年將目前被統稱為「世界模型」的技術拆分成三類:第一類是渲染器,負責生成給人看的像素;第二類是模擬器,負責表示幾何結構、物理屬性與動態變化;第三類是規劃器,根據目標決定機器人下一步該做什麼。這個分類說明了模型如果只會畫出一個世界,並不等於能在裡面幹活。一輛車可以在生成影片中順利穿梭城市,但鏡頭外的街道是否持續存在、建築是否有穩定的三維結構、車輪與地面之間是否存在真實的摩擦力,模型未必知道。對觀眾來說,像真的就夠了;對機器人來說,世界必須可以被計算、可以碰撞,也必須在它轉過身後繼續存在。 World Labs推出的Marble已能從文字、圖片或影片生成可探索的三維環境,除了供人觀看的畫面,還能輸出碰撞網格,讓物理引擎判斷物體能否穿過牆壁、落地後會停在哪裡。英偉達的Cosmos則將世界生成、影片預測與機器人訓練整合在同一套Physical AI體系中,希望用大量合成場景填補真實機器人數據不足的問題。這條路線聽起來宏大,但落到機器人公司的研發流程中,其實非常樸素:先讓機器人在虛擬世界裡反覆失敗。一臺雙足機器人學會走路,不可能只靠工程師每天將真機推倒幾千次。逐際動力的TRON 1支援NVIDIA Isaac、MuJoCo與Gazebo等模擬平台,開發者可以在虛擬環境中測試不同地面、坡度與碰撞情況;智元則發布了AgiBot Digital World,用模擬環境生成操作數據、訓練模型並評估機器人策略。 在現實中讓機器人摔倒一次,可能意味著零件磨損、維修成本與安全風險;在模擬器中,同一個動作可以由成千上萬個虛擬機器人同時嘗試。桌子的高度、地面的摩擦係數、物體擺放的位置都可以不斷變化,機器人不必真的打碎一萬隻杯子,才能學會如何端穩一隻杯子。不過,模擬器並非答案本身,虛擬世界中的地面永遠比真實地面乾淨,模型設定的摩擦力也無法覆蓋每一種材料。機器人在模擬器裡練得再熟,進入工廠、商場與家庭後,依然會遇到參數表中沒有的意外。這正是機器人行業長期面對的「仿真到現實差距」。World Labs在7月21日收購SceniX,關鍵也在於此,它不再只滿足於生成可觀看與探索的三維空間,而是開始將模擬出來的世界與真實機器人的行動反饋連接起來。 即使視覺與模擬已經足夠成熟,機器人真正碰到物體後,仍會遇到攝影機難以獨立解決的問題。拿起雞蛋時,機器人如何知道手指已經用力過大?抽出一張薄卡片時,它如何判斷自己捏住的是卡片,還是只碰到了桌面?擰燈泡時,它如何感知螺紋已經卡住,繼續旋轉可能會損壞物體?攝影機可以看到手已接近目標,卻很難及時判斷接觸面正在發生什麼。觸覺解決的不是「物體在哪裡」,而是「接觸以後發生了什麼」。壓力是否增加、物體是否開始滑動、材料是否變形、抓握是否穩定,這些資訊都發生在視覺畫面之下。 Figure今年發布的Helix 02,將頭部攝影機、手掌攝影機、指尖觸覺與全身本體感知接入同一套控制系統。當頭部攝影機被機械手遮擋時,手掌中的攝影機繼續提供近距離畫面;指尖感測器則能感知低至3克的力,讓機器人從藥盒中取出單顆藥片、控制注射器推出精確劑量,並在雜亂物體中分離出尺寸很小的目標。國內廠商也在快速補上這塊感知能力,像是帕西尼這樣的供應商,直接將觸覺感測器、靈巧手、人形機器人、數據採集與多模態模型組成一條產品鏈,希望將觸覺從一個零件問題,變成機器人訓練數據的一部分。 但給機器人裝上感測器,並不代表它自然就會使用觸覺。許多被稱為「常識」的能力,並非來自我們看過多少圖片,而是來自身體在漫長的接觸中,學會了讓動作適應世界。李飛飛參與的T-Rex研究展示了這一步為何困難。團隊收集了100小時包含觸覺訊號的機器人操作數據,讓機器人完成翻書頁、轉移雞蛋、擦盤子、擠牙膏、分離疊放的杯子、摸索麻將、開鎖、抽取卡片與擰燈泡等任務。最終,T-Rex在12項任務中的平均成功率达到65%,比最強對照模型高出30個百分點。 研究中一個很有意思的結果是,直接將觸覺數據塞進現有的視覺—語言—動作模型,表現反而很差。原因不難理解:不同感官工作的速度並不相同。視覺與語言適合做較慢的全局判斷,機器人需要先看清桌面,理解人的指令,再決定該拿哪一個物體。但當一隻杯子開始從手指間滑落時,它不會等待模型重新看圖、分析與規劃。觸覺必須以更高頻率持續工作,在滑動發生的瞬間調整手指力度。T-Rex因此讓視覺與觸覺按照不同速度運行,視覺負責回答「我要做什麼」,觸覺則負責不斷修正「我現在做得對不對」。這不是給機器人增加另一雙眼睛,而是給它增加一條來自現實的即時反饋。 過去幾年的AI競爭,主要圍繞誰能造出一個更聰明的大腦。具身智能正將競爭推向一套更完整的系統,機器人需要攝影機與雷達確認世界在哪裡,需要模擬器提前練習行動的後果,也需要觸覺與力反饋處理真正接觸後出現的意外。李飛飛並非直接從視覺轉向觸覺,她的研究路線更像是在不斷擴大「看見」的含義,從識別一張圖片,到理解一個持續存在的空間,再到知道自己伸手碰觸後,世界會如何回應。十五年前,ImageNet教會AI說出眼前是什麼;下一代世界模型需要解決的問題是,當它真的伸出手後,世界會交還給它什麼。

Related

相關文章

IT之家生成式AI

國家超算互聯網上線 DeepSeek-V4-Flash 正式版 API,一鍵接入即可快速調用

國家超算互聯網正式上線 DeepSeek-V4-Flash 正式版模型 API 調用服務及模型文件,企業與開發者可一鍵接入快速使用。該模型經大量後訓練,智慧體與指令遵循能力大幅增強,效能可媲美當前最強閉源模型。目前超算互聯網 AI 社區已彙集超過 1700 款開源大模型,並成為全國首個十萬卡級超智融合算力資源池。

剛剛
IT之家生成式AI

首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道

首頁 > 智能時代>人工智能 首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道 2026/8/2 15:31:40 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 2 日消息,據新華社今日報道,首屆全國青少年人工智能大賽決賽 8 月 1 日在上海開賽。來自全國 31 個省(自治區、直轄市)和新疆生產建設兵團以及香港、澳門特別行政區的 850 餘名選手,從 4.

剛剛

谷歌機器人整了波大活兒,要攻克「最後幾釐米」的行業難題?

Google DeepMind推出Gemini Robotics 2,主打「全身智能」的機器人通用模型,強調同時協調雙腿、軀幹、雙臂與手指,並搭配負責高層規劃的ER 2與可快速適應新本體的On-Device 2。官方展示機器人能自主彎腰撿水壺、從貨架取物及使用五指靈巧手執行擰燈泡、封自封袋等精細操作,但地面取物與多指靈巧任務成功率仍偏低。整體而言,谷歌試圖讓機器人模型跨越過去只控制上半身的限制,但距離穩定進入家庭與工廠仍有距離。

剛剛
IT之家生成式AI

中國 AI 大模型領跑全球榜單,央視詳解背後的優勢所在

OpenRouter 最新一週 AI 大模型調用量榜單中,前五名全由中國企業包辦,小米 MiMo-V2.5 以單週 10.5 萬億 Tokens 居冠,DeepSeek 與騰訊混元也上榜。中國開源模型在 Hugging Face 累計下載量全球第一,專家指出開源策略能降低應用門檻並換取長期生態影響力。榜單未納入企業私有化部署與美國封閉 API 流量,但國產開源模型已在市場化第三方渠道取得領先。

剛剛

貝索斯用 AI 尋找下一塊硅

亞馬遜創辦人貝索斯旗下投資機構參與英國AI材料公司CuspAI的4.5億美元B輪融資,該公司估值達26億美元,成立不到兩年。CuspAI主打以「逆向設計」用AI生成候選材料結構,並成立AI Materials Foundry,串聯輝達、Meta等超過45家夥伴,企圖打造跨產業的材料研發平台。目前該公司尚無重大商業化成果,但資本看好AI加速新材料發現的潛力。

剛剛
鈦媒體生成式AI

全球語音大模型,角逐方向盤後的麥克風

全球語音大模型競爭從文本對話框轉向汽車座艙、智慧眼鏡與無線耳機等硬體入口,SpaceXAI、OpenAI、Anthropic、亞馬遜、阿里雲與Google等業者七月接連發布新品,在首音延遲、語音識別精度與成本上展開毫秒級軍備競賽。各廠商技術路線分歧明顯,Grok Voice採原生端到端架構壓低延遲,OpenAI以token計費,Anthropic和亞馬遜走混合路線,阿里雲則在精度登頂但延遲偏高,而微軟與Meta也分別以平台整合及開源模型參與布局。

剛剛