對話緯鈦機器人CEO李瑞:具身智能僅靠視覺容易到天花板,觸覺是未來必選項
上觸覺已經不是一個「yes or no」的問題,而是「when」的問題。作者丨向 欣 編輯丨高景輝 :瑞典科學家做過一個經典的實驗:給受試者的手指尖注射麻醉劑,讓他去完成一個再簡單不過的動作:從火柴盒裡取出一根火柴,然後劃亮它。正常情況下,這個動作幾秒鐘就能完成。但在手指失去觸覺後,受試者的整個動作變得像提線木偶一樣笨拙,取火柴時反覆調整卻拿不穩,劃火柴時用力不均、方向歪斜,花了很長時間才勉強完成。「這就是現在整個具身智能的現狀。」緯鈦機器人 CEO 李瑞說。
所謂現狀是,當下的具身智能擁有越來越聰明的「大腦」和越來越靈活的「肢體」,但唯獨缺了觸覺反饋,就像手指打了麻醉劑的人,能看見、能動作,卻很難做好需要精細感知的操作。要改變這種狀況,關鍵在於讓機器人擁有「接觸智能」:讓機器人以接近人類的方式理解「接觸」的本質,不僅能感知物體的存在,更能根據接觸反饋實時調整動作、控制力度並穩定執行。在李瑞看來,具身智能僅靠視覺很容易到達天花板,下一步必須加上觸覺。在人能做的 90% 以上的任務中,都需要觸覺參與。上觸覺已經不是一個「yes or no」的問題,而是「when」的問題。這一點與黃仁勳的判斷一致。
黃仁勳今年開始多次強調,觸覺是機器人進入物理世界的最後一塊拼圖。而李瑞本人,正是這塊拼圖關鍵的參與者,也是視觸覺這個技術路線最早的締造者之一。2011 年,他在 MIT 讀博期間與導師共同開創了機器人視觸覺傳感器這一領域,2014 年做出了全球第一款分辨率超越人類手指的視觸覺傳感器。在這個領域深耕十幾年後,他於 2024 年創立緯鈦機器人,聚焦視觸覺傳感器和靈巧操作,也成為小米的合作方。不少從業者的共識是,觸覺傳感器正處在爆發前夜。李瑞判斷,上半年是觸覺傳感器在靈巧手領域規模化落地的起步期,下半年,隨著搭載觸覺的靈巧手批量出貨,數採設備鋪開,觸覺傳感器就會進入實質性爆發階段。
緯鈦的定位是「觸覺領域的英偉達」,不只是一顆傳感器,而是涵蓋傳感器、數採設備、VTLA 大模型和世界模型的物理AI基礎設施。「這個領域是我們開創的,也是我們在引領的。」「最後一塊拼圖」正在從論文裡的概念變成靈巧手上的零件。這塊拼圖怎麼拼、拼到了哪一步?在眾多觸覺傳感器的技術路線中,視觸覺的技術壁壘究竟有多深?帶著這些問題,我們和李瑞聊了聊。01僅靠視覺,就像手部打了麻醉劑▎AI 科技評論:產業界對觸覺的追捧是今年才開始的,而你在這個領域已經做了十幾年。當時為什麼會選擇研究觸覺?李瑞:我從 2005 年本科時就開始做機器人和計算機視覺,在做很多操作時就發現僅僅依靠視覺遠遠不夠。
我喜歡從第一性原理去思考,人在做很多操作時需要手眼協同。要真正實現「心靈手巧」,「心靈」代表聰明的大腦,「手巧」不只關乎自由度,更核心的是觸覺反饋。但在當時,市面上沒有一個好的觸覺傳感器,有的只能提供單點信息,跟人手差太遠了。所以 2011 年我在 MIT 讀博時,就開始做視觸覺傳感器,這個領域是我和當時的導師共同開創的。現在大家都在說 VLA、說世界模型,說的都只是視覺。但僅僅依靠視覺完全不夠,必須把觸覺信息結合上去。▎AI 科技評論:在觸覺傳感器受到關注之前,業界也有用「力反饋」和電流方案來控制抓取,這些方案不能替代觸覺傳感器嗎?
李瑞:之前大多數方案本質上是位置控制,夾爪盲目地到達一個預設位置,但到達之後操作有沒有做好,它其實不知道,沒有反饋。電流方案提供的也是非常粗糙的單向力信息,不是觸覺。力反饋通常指的是手腕、胳膊這些部位的力,而手指尖上是缺失的。▎AI 科技評論:那真正的觸覺傳感器能提供什麼信息?李瑞: 兩大類信息。第一類是物體的物理屬性,表面紋理、軟硬程度、形狀大小;第二類是接觸的狀態,法向力、切向力、滑動等。有了這些反饋,機器人才能知道有沒有把物體捏牢、捏準。▎AI 科技評論:之前特斯拉展示過靈巧手夾雞蛋,那種程度的操作是否已經用到了觸覺?李瑞:他用了一種觸覺傳感器,但比較簡單,沒有切向力。
沒有切向力意味著夾了雞蛋之後再去夾其他東西,力不太好自適應。切向力本質上就是摩擦力。拿一瓶水時,用多大的力能拿起來而不滑動?拿雞蛋時,多大的力不至於捏碎又拿穩?插拔 USB 時,人是靠摩擦力感知有沒有插進去的。沒有切向力,這些精巧操作都不好做。我們的視觸覺比特斯拉前一代版本有更豐富的信息。▎AI 科技評論:你 2011 年在 MIT 開創了視觸覺這個方向。從那時到現在,這個領域在學術界經歷了一個怎樣的發展過程?李瑞:第一個里程碑是 2014 年,我們把全球第一款超高分辨率視觸覺傳感器 GelSight 指尖傳感器推向市場,分辨率超過人類手指。到 2019 年前後,視觸覺引爆了整個學術圈。
原因是 2012 年深度學習起來後,大家主要聚焦在視覺上,但到 2019 年發現視覺到了一個瓶頸,很多人開始轉向視觸覺。那時候我們在行業裡已積累多年,迄今實驗室拿了非常多最佳論文獎,發表了 100 多篇論文。所以成立公司不是從零開始,前面有十幾年的基礎,可以快速進行產品化和迭代。▎AI 科技評論:學術界認可視觸覺後,它在產業端的滲透經歷了怎樣的變化?李瑞:從 2024 年到現在經歷了三個階段。2024 年 8 月之前,大部分靈巧手公司都沒有上觸覺。那年 8 月的世界機器人大會上,有兩家上了,強腦科技和因時機器人,當時先用的是電容方案。但經過一年,他們開始尋找其他方案。
某頭部靈巧手公司從去年下半年就跟我們合作,今年 4 月發佈的第三代靈巧手,用的就是我們的觸覺傳感器,已經批量使用。另外還有多家頭部靈巧手公司也在跟我們合作。▎AI 科技評論:他們當時為什麼從電容方案轉向視觸覺?核心差距在哪?李瑞:傳統觸覺傳感器分辨率不夠高,每平方釐米可能只有幾十個點,而我們可以達到幾萬個到幾十萬個點。壓阻、電容、霍爾這些陣列式傳感器,需要鋪很多點,每一個都要做得很小,但物理結構決定了密度上不去。分辨率高了以後,對很多操作來說能提供非常豐富的信息。
還有一點很關鍵,切向力對於靈巧操作非常重要,視觸覺可以提供非常靈敏的切向力,而傳統陣列式的傳感器通常只有法向力,難以提供切向力,比如摩擦力就是一種切向力,對於抓取和插拔類的任務非常關鍵,可以幫助快速閉環。我現在看到的是行業正在向視觸覺收斂,對很多頭部靈巧手公司來說,上不上觸覺已經不是「yes or no」的問題,而是「when」的問題。02攝像頭分辨率,就是觸覺分辨率▎AI 科技評論:視觸覺為什麼能突破傳統陣列式傳感器的密度限制?李瑞:視觸覺的技術是從人的手指得到靈感的,手指接觸物體時發生形變,通過神經末梢傳遞信號。
我們用彈性體模擬皮膚,發生形變後由後面的微型攝像頭捕捉形變,再通過算法算出觸覺信息,包括法向力和切向力。關鍵是,攝像頭有多高分辨率,觸覺傳感器就可以有多高分辨率。我們巧妙地把觸覺信息轉化為圖像信息,再反推觸覺信息,所以叫「基於視覺的觸覺傳感器」,簡稱視觸覺。▎AI 科技評論:也就是說,觸覺信息點的密度本質上取決於攝像頭分辨率,而不是傳感器陣列的數量?李瑞:對。比如說 640×480 就有 30 萬個像素點,每一個對應一個觸覺信息點。如果這塊傳感器面積是 3 平方釐米,每平方釐米就是10萬個信息點。▎AI 科技評論:除了力和形變信息,視觸覺傳感器還能採集哪些維度的數據?
李瑞:觸覺信息以圖像形式呈現,包括法向力、切向力滑動信息等,分辨率非常高。識別不同材質,也是因為分辨率高,彈性體能捕捉到非常豐富的表面信息。另外還有物體在手中的位姿信息。這些信息可以用來進行精準回放,適配不同的機器人。▎AI 科技評論:相比壓阻、電容、霍爾這些傳統路線,視觸覺的整體技術優勢體現在哪裡?李瑞:四個優勢。第一,超高分辨率,視觸覺的分辨率可以達到傳統觸覺傳感器的成千上萬倍。第二,多維力探測能力,法向力、切向力、滑動信息都能測。第三,可以進行柔性物體操作,比如衣服、線纜、食物。第四,不容易受環境干擾,壓阻、電容容易受溫溼度影響,霍爾效應容易受電磁場干擾,而視觸覺不太容易受這些影響。
▎AI 科技評論:同樣是視觸覺路線,業內也有多色光和單色光的分歧。這背後的技術差異是什麼?李瑞:學術界主流就是多色光,是因為多色光相對於單色光有很多優勢。比如多色光的法向力和切向力是分開算的,兩者分的特別清楚,法向力就是法向力,切向力就是切向力,準確度和分辨率都可以做到很高。而單色光犧牲掉了顏色,得到的只是一個合力,無法有效分析法向力和切向力,比如合力是 5,你沒辦法區分到底是什麼組合得到的,理論上有無限多種可能,比如是5和0,還是垂直方向的3和4,以及哪個方向是 3、哪個方向是 4,需要靠猜,所以準確性容易有問題。
另外,之前有人說的所謂的功耗、算力、耐久性等等這些跟多色光和單色光沒有任何關係,而是看每家的能力能做到什麼程度,不要被一些網上的惡意引導所誤導。▎AI 科技評論:這些技術優勢在產品化過程中是怎麼實現的?你們的第一款標品 GF225 相比學術版本有哪些提升?李瑞:GF225 相比學術界的 GelSight Mini 有全方位性能提升,耐久性從千次級別提升到 500 萬次以上,提升了數千倍。這使它可以在工業、商業等場景中實際使用。比如我們跟小米的合作,開始用的就是 GF225 標品。後來推出了用在兩指夾爪上的 GF220,更輕、更薄、更小,可以運用在更狹小的空間。
我們甚至還有更小的版本,後續會推出。另外是用在靈巧手上的 GF515,今年 3 月在 AWE 上發佈,是全球首個超小尺寸、超高分辨率、超高頻率的視觸覺傳感器。每平方釐米上萬個觸覺信息點,最高頻率 120 赫茲,可以做到急速響應、低延遲。03 如果我們踩了 10 個坑,別人可能要踩 100 個▎AI 科技評論:不少擁有學術背景的創業者,在產業落地時都會遭遇技術與量產脫節的難題,從學術界到產業界,你感受最深的變化是什麼?李瑞: 學術界追求創新性和性能極致,產業界關注耐久性、穩定性、一致性。比如學術界的 GelSight Mini 可能只做到 1000 次按壓,我們要做到 500 萬次以上。
學術界只關注單個傳感器,但我們要關注幾千個、幾萬個傳感器是否有足夠的一致性,以及量產能力。▎AI 科技評論:很多學術背景的創業者都在量產工程化上翻過車。你們是怎麼處理這個問題的?李瑞: 量產和產品化有很大 gap。我們從最早的原型到第一個產業化版本,中間經歷了十幾年,即使如此依然踩了很多坑。如果我們踩了 10 個坑,別人沒有這十幾年的積累,可能踩 100 個甚至 500 個。很多細節不會寫到論文裡,彈性體用什麼工藝、結構怎麼設計、算法哪個參數怎麼調,硬件、軟件、算法是一個整體。不是讀幾篇論文、手搓一個原型就可以的。
▎AI 科技評論:很多模型廠商反映觸覺傳感器的數據太豐富了,接入訓練體系時很容易混亂。這個問題你們是怎麼處理的?李瑞: 這恰恰是視觸覺的優勢。視觸覺背後是攝像頭,數據以圖像形式呈現,和視覺模態本質一樣,在架構設計時比其他類型更有優勢。而且豐富的信息在大模型時代優勢更大,模型能捕捉到更多信息,進行更精細的泛化操作。最近李飛飛的 T-Rex 論文就講了觸覺和視覺融合,比純視覺有大幅提升。▎AI 科技評論:視觸覺數據本質上是視頻、圖像數據,很難大幅度壓縮,有人用視觸覺傳感器採集了一小時數據,就採集了十幾 G 的數據,這意味著視觸覺技術對算力資源和存儲空間要求很高。這會成為視觸覺傳感器應用的瓶頸嗎?
李瑞: 不會。我們不需要全分辨率,240×240 就夠了,甚至 120×120 也行。每個手指 240×240,五個手指加起來比一個 640×480 的攝像頭還少。▎AI 科技評論:你們既做傳感器,也做數採設備,還有自己的模型。緯鈦未來的定位是什麼?李瑞: 我們做 VTLA 和世界模型,方向是全棧,模型、採集、硬件都做,而且一定要把觸覺結合進去。我們的定位是「物理AI基礎設施」、「觸覺版的英偉達」。這個領域是我們開創的,也是我們在引領的。搭載在五指靈巧手上的視觸覺傳感器,目前市面上能批量出貨的,只有我們一家。▎AI 科技評論:你們是什麼時候開始做數據採集設備的?李瑞: 2025 年開始的。
去年下半年 UMI(Universal Manipulation Interface,通用操控接口)比較火,但它只是純視覺的,沒有觸覺。客戶問能不能把觸覺結合上去,所以我們做了帶視觸覺版的 UMI。數據處理方面,清洗、標定都有做。採集的信息包括觸覺圖像、視覺信息、位姿信息等,可以精準回放,適配不同機器人。今年7月我們剛和光輪智能簽了戰略合作,把觸覺傳感器接進他們的人類數據開放平臺,以後採集到的就不只是動作軌跡,還有接觸位置、形變、滑移這些觸覺信息。另外今年1月我們跟國地中心聯合發佈了“白虎-VTouch”數據集,目前下載量已經超過百萬次,正在給具身智能補上缺的那塊觸覺數據拼圖。
▎AI 科技評論:靈巧手公司會對傳感器提出哪些要求?成本會不會是大規模覆蓋的障礙?李瑞: 不同靈巧手有不同尺寸和性能要求,定製適配一般要求至少百臺以上。今年很多靈巧手公司可能幾千隻手都會用上觸覺傳感器,一隻手 5 個的話量就更大了。成本不是最關鍵的,最關鍵的是能不能達到功能要求,達不到要求再便宜也沒用。成本是相對的,早期很多東西需要機加工,一旦開模批量生產,成本就可以降下來。▎AI 科技評論:緯鈦現在的商業化進展如何?觸覺傳感器市場什麼時候會迎來真正的爆發?李瑞: 非常好。今年就是視觸覺爆發的元年,訂單和客戶需求巨大增長,根據客戶反饋我們是市面上唯一一家五指版本搭載靈巧手可以批量出貨的。
上半年是爆發前夜,下半年就是要爆發的。今年很多靈巧手會搭載視觸覺形成實質性落地,數採設備、整機執行器都會有視觸覺和手眼協同,我們在視觸覺的多個方面排在第一位。報道。
Related
相關文章

尷尬的“世界模型”,四條路線紛爭未決
我無法在不獲取該篇文章完整正文的前提下,誠實地完成符合要求的新聞稿重寫。你所提供的「可用資料」僅包含頁面導航、網站欄目、其他文章標題及版權資訊,並未包含〈尷尬的“世界模型”,四條路線紛爭未決〉這篇報導的實際內容。 由於你明確要求不得新增來源沒有的細節(包括但不限於人物、公司、產品、數字、時間線與因果關係),也不得將內文壓縮成摘要,因此在缺少原始報導正文的情況下,我無法憑空生成一篇900至1600字且事實可信的新聞稿。

一覺醒來20個PR自己合進了主幹,SpaceXAI工程師:我基本不看代碼了
SpaceX的AI工程師透露,團隊導入自動化開發流程後,AI不僅能生成程式碼,還能自動提交並合併Pull Request,他醒來發現20個PR已自動進入主幹,幾乎不需手動檢視。這種做法大幅減少例行工作,但也引發程式碼品質與安全性的疑慮,顯示AI正從輔助工具轉為主動執行者,可能成為未來軟體開發的新常態。
沒有全科優秀,具身模型別想進入百萬小時
原力靈機登頂 RoboDojo:一個專門給機器人"卸妝"的考場。 最近的朋友圈,幾乎被機器人運動會和 WRC 2026 上的各種視頻刷屏了。看多了機器人百米衝刺、跳遠,再看各個展臺疊衣服、衝咖啡,很容易得出一個結論:機器人時代來了。然而,如果你不幸參與過這些演示背後動輒幾千次的調試與過擬合,你就會清楚這裡面的水有多深。行業內管這種情況叫"Demo 濾鏡"。濾鏡有多厚?說實話,即使你積累了一些行業知識,在現場盯著看,你也未必分得清:這個演示到底是提前編好的動作,還是模型在實時驅動。
滴滴自動駕駛新一代車型開啟載客測試服務
本文作者: 於 2026-08-31 16:43 導語:近期,滴滴自動駕駛新一代 Robotaxi R2 正式開啟無人載客測試服務,用戶在北京、廣州部分示範區域內可呼單體驗。近期,滴滴自動駕駛新一代 Robotaxi R2正式開啟無人載客測試服務,新車在自動駕駛性能和座艙體驗上全面升級,用戶在北京、廣州部分示範區域內可呼單體驗全新智能出行服務。
不到四百美元還能自己動手訓練!Hugging Face 推出微型開源雙足機器人Microduck
Hugging Face 推出微型開源雙足機器人Microduck發布於AI新閒資訊時間 :Aug 31, 2026閱讀 :1分鐘Hugging Face 旗下開源機器人公司 Pollen Robotics 近日正式開源了一臺迷你雙足機器人——Microduck(微鴨)。