千萬小時缺口下的突圍:誰在為中國具身智能“喂”數據?

Leo張ToB雜談2026.09.28 13:50 · 來自北京全文3449字00:00 / 10:34在姚卯青看來,AI要進入下一階段,必須進入物理世界閉環決策,各家公司的數據預算越掛越高,越多越好、越豐富越多樣化越好。如今,人們多了一種賺外快的方式,每天下班回家做飯、做家務的時候,戴上一臺輕巧的頭環設備,按下按鈕,把自己幹活的過程錄下來,上傳到一個手機應用裡。疊衣服、整理文件櫃、陪孩子搭積木......這些人們生活中平時的日常動作,如今每個月能給普通人帶來三千多元的額外收入。而參與其中的人可能並不知道,他們正在參與一場也許能改變未來的競賽。
大語言模型靠互聯網上海量的文本學會了說話和寫作,而機器人要學會擰瓶蓋、疊衣服、修水管,需要的是一個記錄動作的數據庫,而這個數據庫需要行業從頭構建。具身智能的iPhone時刻差了一本教材過去兩年,具身智能以前所未有的速度從實驗室走向現實,機器人已經能翻跟頭、跳舞、格鬥,但真正要走進工廠、商店和千家萬戶去幹活,還差一塊關鍵拼圖:海量、真實的人類動作數據。覓蜂科技董事長兼CEO姚卯青的回答很直接:答案在數據。大語言模型之所以爆發得如此之快,是因為它學完了人類過去四十年沉澱在互聯網上的知識印記;而機器人要學的動作和技能,互聯網上根本沒有一個現成的載體替它們記錄。
換句話說,機器人缺的不是聰明的大腦,而是教材。這個缺口有多大?中國信通院人工智能研究所聯合人形機器人(上海)有限公司、具身智能測試實驗室發佈的《具身智能訓練場研究報告(2026年)》給過一組測算:具身基礎模型要迎來自己的"ChatGPT時刻",至少需要千萬小時級的真實數據;如果這些數據全部靠真機採集,按每臺機器人每天有效工作2小時、每年工作300天計算,需要超過兩萬臺機器人連續工作整整一年。而現實是,當前全球可用的高質量真實數據,只有數十萬到百萬小時級,供需之間隔著一整個量級。數據的槓桿效應,已經在海外被驗證過。今年9月,美國人形機器人公司Figure發佈Helix 2.
5模型,租下舊金山灣區30套陌生住宅,讓機器人不採新數據、不做現場訓練,直接盲測整理客廳、疊毛巾、鋪床三項家務:用人類行為數據集Index做過預訓練的模型,完整任務成功率達到56%;而對照組從隨機權重起步,成功率只有9%。這個差距也直接行業開始看到人類行為數據預訓練的真正價值——它讓機器人第一次能在陌生環境裡“直接上崗”。與此同時,姚卯青與我們分享了他觀察到的一個變化:行業對數據的需求曲線正在陡峭地向上走。去年上半年,市面上很少有人提幾十萬小時規模,大家還停在一萬小時的量級;到去年底有人做到20萬小時;今年很快就有公司宣佈用到100萬小時,而他接觸到的客戶,提出的已是千萬小時級的預算。
“不是簡單地堆量,”他強調,“而是越來越往細分賽道、專業技能上去獲取。”疊衣服的數據已經氾濫,修水管、修車、理髮、美甲,這些“長尾技能”正等待被一個個點亮、解鎖。在此背景下,具身智能的數據故事才剛剛翻到第一章,在數量的缺口之外,質量和場景多樣性的缺口同樣懸而未決。誰能持續把真實世界的經驗轉化為可訓練的數據,誰就握住了下一個十年的入場券。混亂的數採江湖等一個答案具身智能數據採集看上去簡單,但實際採集的時候卻困難重重,且目前行業仍處於發展的初期階段,行業仍有些混亂。行業此前最通行的做法是真機遙操作:人通過手柄或VR設備操縱機器人,把任務操作示範給模型。
這類數據與本體高度對齊,訓練價值高,但短板同樣明顯——採集速度被機器人數量、操作人員和場地死死捆住,硬件、人力與運營成本隨數據規模同步上漲。信通院報告顯示,截至2026年6月底全國已建成啟用超70傢俱身智能訓練場,另有46家在建或規劃中,但訓練場屬於典型的重資產投入,僅部署100臺人形機器人,本體採購成本就可達數千萬元;場景集中在少數易採集任務上,數據泛化價值有限,可持續盈利模式仍在摸索。更深的痛點在場景本身。覓蜂科技副總裁殷哲將數據採集比作挖礦:設備是工具,運營是工廠,場景資源才是要挖的礦。“在整個物理AI數據鏈條裡,場景是唯一無法被技術或資本快速複製的源頭。”殷哲強調。
當前國內真實物理交互場景的合規數據大約只有100萬小時,而機器人商業化落地需要千萬甚至數億小時,缺口超過99%。更麻煩的是,場景進入有壁壘,比如,設備進食品廠安全嗎?老闆讓不讓眾包員帶設備進工廠?姚卯青打了個更形象的比方:場景像頁岩油,有價值,但如果開採成本比採出來的油還貴,就等於沒有。除此之外,當前具身智能數據採集行業也尚處於混沌階段,行業魚龍混雜。從今年上半年起,大量初創團隊湧入這個賽道,普遍以技術背景創業為主,早期快速做出以相機為主的原型設備。對此,姚卯青判斷,這個行業真正要進入規模化乃至盈利狀態,看重的是運營能力。
而運營能力主要體現在,企業能不能“以銷定產”、精確匹配需求,以及能不能在設備製造、人員僱傭、結算、雲端基礎設施建設上砸下重資產。基於此,姚卯青判斷行業整合是必然,未來會分化出設備方、運營方、後處理方,不會人人都幹整條鏈條。亂象之下,還有一些更根本的分歧。一種主流做法是要求採集者放慢動作、保持手部持續可見,遷就現有算法的解析能力。但爭議隨之而來:當人開始遷就算法,真實世界裡本就存在的快速運動、遮擋和糾錯被人為收窄,模型最終看到的行為分佈也隨之失真。海外有公司批量買回數據,花大量人力清洗,最後能喂進模型的有效數據率只有10%左右。
此外,眾包採集要進入真實家庭和商業場所,人臉、住址等隱私信息如何授權、如何脫敏,都是目前行業在數據採集過程中必須要面對的難題。把數據做成一份貨架上的生意麵對當前行業的痛點,覓蜂科技給出的答案是,把採數據的鏟子交到每個普通人手裡。在姚卯青看來,教會機器人的數據其實從來不缺:酒店阿姨整理床品、餐飲服務員備餐打包、物流分揀員搬運轉運、工廠師傅裝配上下料,每天每分每秒都在發生。缺的只是去開採這座寶藏的鏟子,“這也是我們推出覓蜂派APP的主要原因:就是讓任何人實名註冊、申領一臺MEgo設備,在正常生活和工作之餘順手完成採集不需要培訓,沒有面試,從領任務到拿錢四步走完。
”姚卯青言簡意賅的介紹了覓蜂科技推出覓蜂派APP核心因素。將覓蜂派APP拆解來看,其背後是覓蜂自研的MEgo View頭戴設備以多相機覆蓋超過300°視角,腕部相機捕捉手部細節;MEgo Gripper作為無線UMI類設備,空間軌跡重建精度達到毫米級,三維觸覺可記錄“手在哪裡、用了多大力”,全通道硬件級同步做到亞毫秒級。數據回傳後,MEgo Engine雲端引擎完成切片、標註、空間信息提取,再通過ManiEval體系從數據、任務、傳感器、語義、動作五個維度逐一質檢。
值得注意的事,在數據質量層面,姚卯青明確表示不會做非黑即白的分化:“數據質量可以分很多層,根據不同下游模型類型或者不同模型的訓練階段,可以利用不同質量等級的數據。我們會給它貼上質量標籤,把它們儘可能保留下來。”姚卯青指出,據他介紹,過了結算環節後,超過95%的數據最終能被用起來,70%-80%可保留至精細化處理階段。據姚卯青介紹,目前覓蜂科技已經將2萬套MEgo設備陸續“派”到了家庭、辦公、零售、生產、餐飲等真實場景,累計採集有效數據達百萬小時,百萬小時級無本體數據已開始服務騰訊Robotics X實驗室、螞蟻靈波等頭部客戶。而在產業層面的佈局則圍繞“場景”二字展開。
據悉,覓蜂科技發佈了覆蓋22大類場景、5000餘個任務、50000多個真實環境的任務貨架,併發起場景數據聯盟,東呈酒店、中旅集團、華驛酒店、陳香貴、普親養老院、上海德濟醫院、正榮集團、龍旗科技、張江集團等50餘家企業和機構成為首批成員。“客戶需求已從粗放的工廠數據,精細到某條產線上擰螺絲的L3級,場景不提前儲備,需求來了就接不住。”這是殷哲對為什麼要牽頭場景數據聯盟的解釋。至於數據需求的終點在哪裡,在姚卯青看來,AI要進入下一階段,必須進入物理世界閉環決策,各家公司的數據預算越掛越高,越多越好、越豐富越多樣化越好。真實世界浩瀚無垠,而人類每一次平凡的動手,都可能成為智能進化的一次投餵。
(文|Leo張ToB雜談,作者|張申宇,編輯丨楊林)
Related
相關文章

MiniMax 全新文本模型 M3.1-Flash-Preview 正式公測
9月28日,國內頭部 AI 廠商 MiniMax 官方宣佈,旗下全新文本模型 M3.1-Flash-Preview 正式上線並開啟全面公測。在核心技術與功能特性方面,該模型具備兩大亮點:一是全面支持原生多模態能力,二是擁有百萬級別的超長上下文窗口。

米哈遊創始人劉偉:希望在 2-3 年內進入國產大模型第一梯隊
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 Domado 的線索投遞!9 月 28 日消息,據澎湃新聞報道,近期米哈遊創始人、總裁劉偉(大偉哥)在 2027 校園招聘宣講會上海交通大學專場上發表演講,希望米哈遊在 2-3 年內進入國產大模型第一梯隊。

英偉達發佈1億參數免費模型Nemotron3,支持8人實時語音分割識別
該模型專注於語音分割聚類(Diarization)任務,開放了權重數據,能夠精準識別對話中任意時刻的說話者,支持最多8人同時發聲的實時及錄音音頻處理。在技術突破與性能表現上,Nemotron3Diarization在嚴苛的VoiceArena語音分割基準測試(v1版本)中以14.

OpenAI 重排 Pro 檔位:5x和20x用量承諾下線
原先每月 100 美元和 200 美元的兩檔 Pro 會員,名字分別變成了"Pro Standard"和"Pro More",而最讓用戶介意的是,頁面上原本清清楚楚標著的"用量是 Plus 的 5 倍""用量是 Plus 的 20 倍"兩行字已經消失,取而代之的是一句籠統的"比 Plus 用量更多"。

谷歌在印度測試 Gemini 內直購 Flipkart 商品,全面進軍端內交易生態
據最新消息顯示,谷歌目前正在印度市場展開一項全新測試,允許用戶直接通過Gemini和 AI Mode 在 AI 界面內完成對Flipkart商品的直接購買。在具體的測試範圍與功能落地方面,本次測試目前僅面向部分用戶開放,且商品品類主要限定在部分智能手機、電子產品以及手機配件等少數領域。

谷歌把 Colab 算力塞進 AI 會員:Ultra 用戶免掛標籤頁也能跑長訓練
最新動作是,符合條件的訂閱成員將額外拿到 Colab 計算單元,並解鎖性能更強的 GPU、TPU 等雲端算力。換句話說,寫代碼、跑模型的人不用再為算力單獨操心。公開資料顯示,Colab 本身是一項免安裝的託管式 Jupyter Notebook 服務,打開就能寫 Python、直接調用雲端 GPU 和 TPU。