被質疑「容易複製」的視觸覺,到底難在哪?

2026年9月30日 03:50
站內 AI 整理稿

對視觸覺的許多質疑,並不中肯。作者丨向 欣 編輯丨高景輝 在 3C 產線上,讓機器人把一根 USB 線插進毫米級的接口,難點藏在視覺看不到的地方。插沒插正、有沒有卡滯、該加力還是收手,答案都落在指尖與工件接觸的瞬間。精密裝配、柔性物體抓取、插拔等任務,是自動化產線上價值最高、也最難被機器人替代的一批工序。這類過去依賴老師傅手感的工序,正把觸覺推到具身智能的臺前。視覺解決「看到了什麼」,觸覺解決「碰得怎麼樣」。VLA 模型在真實任務裡反覆碰壁後,越來越多團隊意識到,僅依靠視覺感知推進到一定階段後,性能天花板就會出現,核心短板正是缺少觸覺信息。

有具身廠商創始人打了個比方:如果讓一個人度過三天無觸覺的生活,他會活得非常痛苦,抓個杯子都不知道該使多大勁。觸覺賽道里,視觸覺是熱度最高的分支之一,高端靈巧手幾乎把它當成標配。資本也聞風而動,視觸覺廠商今年都完成了大額融資:戴盟機器人兩個月內完成億元級 A 輪與螞蟻集團領投的數億元戰略融資;一目科技 7 月完成超 10 億元 E 輪融資,投後估值超百億元;千覺、緯鈦今年也拿到億元級融資。但熱度越高,爭議也越多。

有人認為,視觸覺不過是「攝像頭+硅膠」,容易複製;有人認為,光學結構決定了它做不薄,幀率也很難提升;還有觀點擔心,大量視覺數據會帶來算力、存儲、線束和功耗壓力,柔性表面也很難經受工業場景的長期使用。不過,不少爭議未必是中肯的行業預警,很多已經與實際情況脫節,甚至演化成對整條路線的誤解。成本、厚度、一致性、耐久性,以及觸覺數據如何真正進入模型訓練體系,確實是這條路線目前還沒有完全跨過的坎。但把視觸覺從原理、產品、數據到落地場景完整拆開,會發現,市場上流傳的很多判斷,已經跟今天的產品進展出現了偏差。

帶著「視觸覺究竟走到了哪一步」的疑問,我們與戴盟、一目、緯鈦、千覺、模量等視觸覺廠商聊了聊,把市面上的產品參數和各家的技術生態梳理了一遍,試圖拆開那些被簡化、被誤讀、被低估的環節。01視觸覺的底牌:把觸覺變成圖像視觸覺的工作原理並不複雜:傳感器表層是一層透明彈性體,內部裝著光源和微型相機。物體壓上來,凝膠發生形變,形變在內部變成明暗圖案,相機拍下圖像,算法再從中重建接觸幾何、力分佈與滑動。把觸覺變成圖像,是這條路線的核心換算邏輯。這條路線真正起源於 MIT。

2009 年,MIT CSAIL 的 Edward Adelson 團隊在 CVPR 上提出 GelSight,最初只用於觀測物體表面的微觀形貌,和機器人沒有關係;GelSight2014 年,團隊推出全球首款超高分辨率指尖 GelSight 傳感器,視觸覺第一次裝上機器人指尖,那篇論文的第一作者李瑞,後來回國創立了緯鈦機器人。

全球首款超高分辨率指尖GelSight傳感器2020 年,Meta(當時 Facebook)開源 DIGIT 觸覺傳感器全套硬件設計,大幅降低了視觸覺的科研門檻;2021 年 Meta 與 GelSight 達成合作,由後者負責 DIGIT 的量產商業化,視觸覺從這個階段開始進入全球實驗室並衍生出 OmniTact 等變體,光學路線逐漸成為觸覺研究的主流技術路線之一。源自視覺算法與圖像處理,也讓視觸覺常被質疑「沒有自己的算法」。

實際上,雖然光度立體法本身來自計算機視覺,但 GelSight 將其與彈性體反射塗層和多角度可控照明深度結合,形成了視觸覺標誌性的高分辨率幾何重建範式;此後針對凝膠非線性、剪切力解耦、標記點跟蹤的定製改進,也都圍繞觸覺的物理特性展開,並非拿視覺工具、算法簡單套用。視觸覺的另一個質疑,是表面沾上油汙會不會弄髒圖像。其實,傳感器的光學腔體封閉,相機向內拍攝,油汙進不了內部,也不會像汙染攝像頭鏡頭那樣糊掉畫面。汙染真正影響的是凝膠表面的力學與光學耦合特性,改變局部變形、間接拉低精度與壽命。這個問題與壓阻、電容等軟體觸覺方案面對的汙染問題類似,屬於表面材料工程,談不上視觸覺獨有的原理缺陷。

回到價值本身。傳統的觸覺傳感器,本質上是通過佈置一個個離散的感知單元來獲取壓力或形變。感知點越多,意味著需要塞進更多物理器件,因此在密度上存在天然限制。而視觸覺的觸覺信息點的密度由相機分辨率決定,這正是視觸覺最突出的長處。緯鈦機器人創始人李瑞介紹,640×480 的圖像就有 30 萬個像素點,每一個對應一個觸覺信息點,若傳感器面積是3平方釐米,每平方釐米就是上萬個點甚至更多。一目科技創始人李智強用人體做對比:人手指尖約 1.2 萬個觸覺點,一目可以做到 24 萬個,已經超過人手。對比之下,傳統壓阻式傳感器每平方釐米只有幾十個點,電容、霍爾方案在百個上下。

感知維度上,視觸覺同樣能拉開差距,李瑞概括了視觸覺傳感器的三個優勢:能同時測法向力、切向力與滑動,能操作衣服、線纜、食物這類柔性物體,不受溫溼度與電磁場干擾。「最類人」是他們共同給出的理由,視觸覺跟人的感知能力最接近。有廠商認為,這條路徑會是觸覺傳感器的終極方案。02走上牌桌的廠商視觸覺熱起來之後,玩家也越來越多。專業視觸覺廠商中,國外有GelSight,國內有戴盟機器人、一目科技、緯鈦機器人、千覺機器人、模量科技、疊動科技、知行具身;另有一批靈巧手廠商選擇自研,如 Sharpa、曦諾未來、拾玥科技。

它們的出身也各異:GelSight 與緯鈦源自 MIT ,戴盟孵化自香港科技大學機器人研究院,千覺的創始人是上海交大副教授馬道林,疊動核心團隊也來自港科大,一目從光譜芯片業務轉來,模量創始團隊來自香港城市大學、廈門大學等高校。幾家公司身上有幾個明顯的共性。其一,都朝系統級公司走,產品邊界超出傳感器本身,紛紛向上遊數據採集、底層算法平臺以及數據集、末端執行器延伸,試圖打造系統級的能力閉環。戴盟、一目、千覺、緯鈦都做了數採設備、數據集與模型,模量發佈了數採手套,連成立最晚的疊動也推出了集成算力的夾爪。都在往全棧做,其實有兩方面的原因。一方面,尚未成熟的地帶是廠商的潛在業務增長點。

千覺聯合創始人、CTO 趙浩南解釋, 傳感器、數據、模型幾個環節環環相扣,在特別好的硬件或模型出現之前,這些接口地帶就是大家的機會。另一方面也是行業所處的早期階段使然,一目科技創始人李智強判斷這是「先全棧、後往回收」的過渡階段,最終會走向分工;戴盟相關負責人也認為,全棧不是目的,出發點始終在觸覺上,適合合作的部分會找做得好的廠家,不過,觸覺數據處理鏈路與觸覺模型能力必須自己做。其二,產業資本密集入場。

戴盟的股東覆蓋匯川技術、中國移動、中國電信、螞蟻集團、聯想、招商局創投;一目背後有小米系順為資本、TCL 與博世旗下博原資本;緯鈦的天使輪由小米戰投領投,Pre-A 輪有韋爾股份旗下韋豪創芯;千覺的天使輪由智元機器人領投,理想汽車、吉德電器隨後加入。翻看股東名單,會發現家電與消費電子產業方出鏡率最高。小米系資本、TCL、松霖、吉德都位列其中,家電產品迭代快、型號多,產線需要機器人適應更多變化,而插接、裝配、抓取等任務又高度依賴接觸反饋;車企、半導體產業方看中產線精密裝配,螞蟻、聯想等大廠在押注數據與生態。

落到場景上,各家都在啃高價值工序:戴盟在 3C 產線承擔 USB 插拔、標籤張貼,緯鈦與小米及多家世界 500 強合作,千覺已服務 300 多家頭部客戶,夾爪類產品去年完成量產,訂單量級在千套至萬套之間。其三,不少產品補齊了防水防塵能力,幀率基本都能達到百Hz級別。戴盟傳感器做到 IP67 防護,通過 500 萬次按壓與 20 萬次摩擦測試;緯鈦夾爪款視觸覺傳感器具備 IP54 防護,還可以升級防護等級,工作溫度覆蓋零下 25 ℃到 80 ℃;一目 Sentra T0 系列達到 IP65 防護,工業壽命超五百萬次按壓,並宣稱無懼溫漂;千覺正在研發防水款傳感器。

千覺機器人聯合創始人、 CTO 趙浩南解釋,研發防水款傳感器,是為了適應機器人進入家庭後的真實需求,洗碗、洗水果、拿抹布等涉水任務,都要求傳感器能夠在水環境中正常工作。而防塵更多是基於工業場景的需求,總體而言,防水防塵,目的是延長凝膠壽命與標定長期有效。戴盟視觸覺傳感器行業裡「視觸覺幀率只有 30 到 60 fps」的說法也已過時。戴盟夾爪款 120 Hz、靈巧手款180Hz,千覺的採樣幀率最高可到 150 Hz,模量工業夾爪可到120Hz,疊動甚至可以把全系採樣頻率拉到400Hz以上。其四,產品形態多樣,並且已出現不少曲面產品。

做曲面的視觸覺傳感器一度被認為是難題,其實如今的視觸覺傳感器可以做到仿生曲面,有的已接近指腹形態。一目有方形、楔形與指尖三類形態,千覺的視觸覺傳感器精靈為仿生指尖,夸克 N1 與夸克 W1 為仿生曲面,光子為楔形平面。03格局未定,各有各的解法廠商一多,同質化的說法隨之而來,甚至有觀點認為在電商平臺買齊零件就能手搓出產品。但把各家的產品放在一起看,同質化判斷其實站不住腳。開源方案確實降低了入門門檻,但真正商用的產品對凝膠配方、光學校準、批量一致性、可更換設計與軟件棧上都有極高要求,這些環節決定產品能否離開實驗室、走進產線。取捨不同,廠商產品也不同。

評判一款視觸覺傳感器,可抓住幾個方向:空間分辨率與深度精度:決定能「看」到多細的紋理與形變,直接影響對物體表面特徵(如芯片引腳、頭髮絲分叉)的識別能力;力感知性能:包括法向力、切向力、力矩的測量範圍與精度,決定能否感知滑動、判斷抓取穩定性,其中切向力非常關鍵;幀率與延遲:影響動態操作中的響應速度,高頻操作(如裝配、插拔)需要百Hz級別的實時反饋;尺寸與集成性:決定能否嵌入靈巧手指尖、能否適配不同構型的末端執行器;耐久性與環境適應性:決定產品在產線上能扛多久,包括防水防塵等級、按壓壽命、抗穿刺與抗腐蝕能力。

把市面上各類視觸覺傳感器的產品參數都盤了一遍後,我們發現行業裡參數標註並不統一,橫向對比有難度,不過仍然可以根據各家強調的指標,簡單看出他們打法差異之處。戴盟把功夫下在耐用性和一致性上。產品具備 IP67 防護能力,能夠防水防濺、抗塵耐汙,具備強抗電磁干擾,特別標註了靈敏度、零漂、輸出時漂、非線性等指標,傳感器表面可以承受劃、刺、刮等操作。這背後很大程度上是材料工藝的結果。傳感器並非單一材料構成,而是由外層保護層、中間透明層以及貼合工藝等多層結構組成,每一層都需要針對實際使用場景進行調整。一目最突出的標籤是薄,靠自研超表面硅光感光芯片壓縮光路,把產品壓到 10 毫米以內,第二代做到 3 毫米。

一目科技視觸覺傳感器一目科技相關負責人介紹,一目團隊多名核心成員有華為背景,優勢在於具備強大的工程化能力,據公司披露今年已拿下多家行業頭部客戶訂單,應用於靈巧手的仿生指尖款觸覺傳感器已經開啟量產。千覺在參數上強調一致性和精度表現,全繫帶自標定算法,自動校準保障片與片之間的穩定,其整手觸覺方案中跨傳感器一致性超過 97 %;對產品的合力精度、變形場精度標註細緻。緯鈦的產品明顯能看出有面向場景的取捨,夾爪款採樣頻率相對低但工作溫度範圍寬,指尖款頻率高、面向 0 到 50 ℃環境;GF225 的法向力與切向力量程都到 30 N,在幾家公開標註中最高。

模量走視觸覺與壓阻多技術融合路線,以視觸覺做指尖高精度,以壓阻做手掌大面積覆蓋。知行具身換了感知範式,把相機換成了事件相機:只檢測亮度變化的區域,變化即輸出,繞開了傳統視觸覺傳感器「逐幀快照」的物理限制,輸出方式的改變也減少了大量重複圖像數據的輸出,帶寬小而無需外掛算力設備。疊動則把 MEMS 工藝引入視觸覺,全系採樣頻率拉到 400 Hz以上,在頻率上形成了差異化。技術生態上,各家雖然都在全棧化,但也有具體差異。戴盟是目前技術生態佈局最完整的廠商,從傳感器到數據採集設備、數據集、評測基準到 VTLA 模型、世界模型均有佈局。

模型方面,戴盟2024年在業內率先提出 VTLA(視覺-觸覺-語言-動作)架構,後續不少廠商跟進。戴盟近期又發佈了觸覺錨定世界模型 Daimon-TWM。數據方面,公開數據集的有四家,戴盟的 Daimon-Infinity 是全球最大規模含觸覺數據集,並開源其中 1 萬小時數據;千覺的 TacVerse 1k是首批 1000 小時真實交互數據;緯鈦的白虎-VTouch 超6萬分鍾,強調跨本體;一目在聯合斯坦福推進開源項目 TouchNet。

此外,一目還著力於降低模型廠商用觸覺數據的門檻:觸覺基座負責採集,Tactile Transformer Encoder 把不同硬件採到的原始信號編碼成與視覺、語言對齊的通用表徵,做基模的人不再需要理解底層細節。仿真方面的探索也有不同。戴盟把仿真能力用在評測上,與銀河通用聯合發佈評測基準RobOmni,更希望定義行業標準;一目自研觸覺仿真平臺,千覺發布全球首個觸覺仿真工具Xense_Sim,填補切向力模擬空白;緯鈦與光輪智能合作,把傳感器數據接入人類示教平臺,記錄軌跡之外的手感數據。廠商選擇各異,行業對「觸覺該長成什麼樣」還沒有標準答案。

04落地之前,還有幾道坎關於應用節奏,業內比較一致的判斷是裝上視觸覺傳感器的夾爪會先行。夾爪裝上機械臂就能用,控制難度比靈巧手低不少,補上觸覺就補齊了抓取閉環的關鍵拼圖。而靈巧手各家構型不同,對傳感器的形狀與曲率要求各異,這種高度定製化要求,也是部分靈巧手廠商選擇自研視觸覺傳感器的原因,因為內部迭代效率更快。不過,各廠商口徑都稱自己的靈巧手款傳感器正在進入量產階段。一隻五指靈巧手需要的傳感器數量遠多於兩隻夾爪,需求起來後出貨量會可觀得多,但視觸覺要過的關也不少。第一道坎是成本和厚度。

國外代表產品 DIGIT 售價約 355美元;有靈巧手廠商透露,國產夾爪型視觸覺傳感器單價一千多元,指尖型三四千元,一隻整手僅視觸覺傳感器成本就可能上萬。廠商對此的態度比較一致:先解決性能,再談成本,產品成熟了,規模化過程中自然會降本。這個價格區間也正在被拉平。戴盟透露,其視觸覺傳感器不管夾爪款還是指尖款,單價都在一千多元。另一方面,視觸覺的成本也要換個算法,要拉長到整個生命週期來看。戴盟相關負責人介紹,視觸覺是唯一表面材料可替換的技術方案,其他方案花 500 元買傳感器,三個月壞了,再花 500 元換新的,視觸覺雖然一開始貴,但表面壞了,後續只需要幾十元換一片硅膠就能接著用。

這個賬,很多人一開始沒算過。一目科技還透露,自家視觸覺傳感器已進入可規模化量產的成本區間;能降本主要得益於自研解算芯片與供應鏈能力。厚度則是視觸覺從實驗室進入靈巧手時繞不開的問題,但它的進展經常被低估。最初的 GelSight 接近一個30釐米見方的盒子,2014 年的指尖版仍有 60 毫米厚,DIGIT 做到 18 毫米。Digit今天,戴盟產品已經做到 5 到 8 毫米;疊動產品做到 7 到 9.8 毫米;一目則將產品從第一代的 10 毫米以內迭代到第二代的 3 毫米;知行具身的產品最薄僅 3–4 毫米。視觸覺因為有攝像頭,所以永遠做不薄的說法並不成立。

厚度問題上,各家解法不同:戴盟可以靠材料與結構優化,一目用自研芯片壓縮光路。至於靈巧手指尖究竟需要多薄,行業還沒有共識,多數產品仍在迭代階段。第二道坎是一致性與耐用性,這其實比成本和厚度更重要。視觸覺數據要進入模型訓練,前提是同一批傳感器對相同輸入給出相近讀數;一致性差的傳感器,採出的數據進模型反而成為噪音。戴盟從材料、結構和防護入手提升耐用性,千覺用自標定算法解決一致性。一目科技具身產品 PDT 經理周愛第把這個問題歸結為系統工程能力:只做好傳感器某一個零件做好還不夠,材料、光學、算法、製造和標定全部需要協同。

「網上買零件就能手搓一個視觸覺」的說法,只能說明原理驗證的門檻並不高,卻不能說明產業化門檻低。第三道坎是算力與功耗。如果一隻靈巧手上部署多個傳感器,持續輸出高分辨率數據,算力、存儲和通信壓力確實會增加。但工程上並不意味著所有原始圖像都必須完整保留下來。一目工程師介紹,面對較大的數據量,實際使用時通常會先進行下采樣,或者用輕量級網絡(如ResNet)提取特徵,再交給下游模型。另一種方式是在感知端就減少數據量,從源頭解決。李瑞給出的解法是適當降低分辨率,認為 240×240 就夠了,甚至 120×120 也行。每個手指 240×240,五個手指加起來比一個 640×480 的攝像頭還少。

知行具身則改變了成像架構,通過基於定製的微型事件相機模組由內而外重構了整套傳感系統,使傳感器在高速感知下仍能保持較低的數據率,無需外掛算力盒。而且,視觸覺把幾何與力統一在同一個傳感器裡,比起「力傳感器再加一路視覺」的系統,整體鏈路反而更省力。真正需要比較的,是增加的計算成本,能不能換來足夠高的任務收益,並不是視觸覺的數據量大不大。第四道坎,是觸覺數據如何融入模型。這或許才是行業下一階段最大的變量。現在很多 VLA 模型仍然是先把視覺和語言體系做起來,再嘗試把觸覺補進去。千覺機器人把這種做法比作補作業,傳感器格式不統一,數據融合度不夠,多設備延遲不同,延遲越高,長序列任務越容易斷裂。

戴盟 2024 年提出 VTLA,把觸覺放到與視覺平級的位置,千覺也是類似思路,是讓觸覺作為原生模態,傳感器、數據規則、數採設備與模型訓練保持同一套體系。不過,戴盟相關負責人認為,數採硬件本身難度不大,真正的壁壘在數據鏈路:時間戳對齊、多模態打通、後處理管線,決定數據能不能用、好不好用。這也是觸覺數據競爭正在發生變化的原因。上半年各家還在卷數據集時長,下半年開始有人轉向卷質量,廠商開始越來越多地討論數據質量、一致性、同步精度以及數據能否真正訓練模型。正如趙浩南所說,時長再長,質量不夠,只會越採越汙染。模量科技聯合創始人周建林也提到,觸覺感知行業的競爭,最終是數據的競爭。

而這件事最終會落到一個現在還沒有答案的問題:訓練一個真正能完成靈巧操作的模型,到底需要什麼規模的觸覺數據?需要包含哪些維度的觸覺數據?目前沒人能交出一份準確的答卷,視觸覺廠商和具身本體、模型公司都在探索,這是一個需要合力才能解決的難題。對爆發時點,樂觀者認為今年下半年就會掀起觸覺風潮,保守的預判是靈巧手明年或後年先放量,觸覺傳感器隨後跟上。共識在於,視觸覺的節奏綁在靈巧手的成熟度上。對廠商而言,眼下要做的事排序清晰:把一致性與耐用性做到位,把數據管線打通,再逐步壓低厚度與成本。每一步都不輕鬆,但和一兩年前相比,方向已經清楚許多。視觸覺需要的,其實只是時間,以及更多耐心。

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位模型更新

DeepSeek官方開源昇騰基礎組件,與昇騰共建高效易用的AI芯片軟件生態

DeepSeek於9月30日正式開源面向華為昇騰算力平臺的基礎設施組件,涵蓋TileLang編譯工具、高效能運算庫及分散式通信庫等,並提供DeepGEMM、FlashMLA、DeepEP等元件。此次開源被視為中國AI軟體生態的重要里程碑,透過與昇騰的深度合作,支援超低延遲推論與大規模訓練,實測通信效能接近硬體上限。華為也將聯合創新成果在CANN社群開源,期望打造開放、高效、易用的AI軟體生態。

剛剛
IT之家模型更新

DeepSeek 開源面向華為昇騰算力平臺的基礎設施組件

作者:清源 責編:清源 評論: 感謝網友 軟媒用戶1392612、pzvincent、DengGordon、雲逸天清、我的夢想、章魚小丸子、Agent、尾巴不長、九指神丐、看資訊的小碳、ZEROA_ONE、xxy171070、superstarcar、有鯽雪狐、暖洋洋 的線索投遞!

剛剛
鈦媒體模型更新

推演大廠AI辦公之戰

AGI-Signal2026.09.30 10:21 · 來自北京全文5600字00:00 / 16:10爭的就是上下文。當AI開始替人操作軟件、完成任務,辦公則是其中離企業付費最近的場景。這一輪圍繞AI辦公的角力裡,各家真正壓上的籌碼,是過去十年沉澱的企業數據。

剛剛
雷峰網模型更新

源升智能楊思成:具身模型能力突破之前,靈巧手要先卷性能|物理AI 50人

靈巧操作的最高境界,是「無劍勝有劍」。作者:向欣 高景輝編輯:高景輝:金庸筆下的獨孤求敗,對劍術的理解有幾重境界:二十歲前看重利劍凌厲剛猛,四十歲前領悟重劍「大巧不工」;四十歲後漸漸達到「不滯於物,草木竹石皆可為劍」的境界,內功強到極致,兵刃都是身外之物。

3 小時前
雷峰網模型更新

豆包支持出行服務:一句話訂機票、火車票,打車導航全覆蓋

本文作者: Nemo 2026-09-30 11:11 導語:此外,豆包還上線了“出行用豆包”專屬入口,精選地圖導航、交通出行、酒店住宿、吃喝玩樂四大場景的高頻推薦,為用戶提供更多出行、旅行建議。國慶黃金週前夕,豆包宣佈支持多種出行服務,用戶現已可通過豆包一站式完成機票預訂、火車票購買、打車及路線導航等多種出行需求,覆蓋從長途交通到市內出行的全場景。

3 小時前