華為的數據供應商,拿下90%的具身大腦企業|對話景聯文CEO

機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月267日報道,近日,杭州AI數據運營商景聯文科技發佈了一批用宇樹機器人採集的真機數據集,包含近15000小時的真機數據,用於模型訓練。對於當前的具身智能行業而言,15000小時真機數據已經是一筆不小的數據量。但對整個行業來說,遠遠不夠。相比大模型時代已經積累了億級的互聯網數據,具身智能沒有現成的大規模數據可用於訓練。對於長期處在數據產業的企業而言,這種差異感更明顯。景聯文科技在數據行業做了8年,也經歷了數據需求從大模型時代向具身智能時代不斷變化的過程。
景聯文科技CEO劉雲濤告訴機器人前瞻,具身智能與大模型時代最大的區別,在於數據來源的不同。大模型時代有互聯網數據,市面上已經積累了大量文字、圖片、視頻。但具身智能不同,它沒有現成的大規模數據用可供訓練。▲景聯文科技CEO劉雲濤(圖源:景聯文科技) 在他看來,這也是為什麼具身智能數據不會像大模型數據一樣快速被填補。語言模型的數據每天都在自然而然產生,劉雲濤說:“我們現在對話的視頻拿去標註一下,就能用來訓練。” 但機器人不一樣,它需要在真實場景中,完成真實任務來採集數據。“具身智能不是萬眾全民都替你幹,更何況現在具身智能設備本身也有很多技術挑戰。”劉雲濤說。
除了數據數量,他認為,現在最重要的是採的數據質量要高,種類要足夠豐富。他們將高質量數據總結為“四真兩度”,即真人、真場景、真任務、真機,以及根據不同任務需求定義數據維度和精度。但同時滿足這些要求,並不容易。一方面,真實場景和真實任務難以規模化複製,機器人需要在不同環境中完成不同任務,才能獲得有效訓練數據;另一方面,真機數據採集成本較高,涉及機器人本體、多模態傳感器以及後續的數據處理流程。這也意味著,具身智能的數據缺口並不是簡單增加採集數量就能解決的問題,而是需要建立一套覆蓋數據採集、治理、標註和應用的完整體系。數據質量和數量最終都會反饋到模型能力上。
只有不斷積累真實、多樣、高質量的數據,模型才能從真實世界的交互中學習更多任務和動作。正是看到了這一數據缺口,景聯文進一步佈局具身智能數據方向。但景聯文並不是一開始就做數據,劉雲濤也不是一開始就加入了景聯文。景聯文成立於2012年,早期主要從事指紋算法業務。正是因為看到傳統算法向AI算法轉型的趨勢,他選擇了景聯文。加入後,他發現,算法本身不容易被用戶感知。同時,如果數據源掌握在別人手中,公司很難形成長期壁壘。“我當時感知到,指紋算法總有沒落的一天”。2019年,劉雲濤帶動公司轉型做數據。從最初賣指紋膜的數據,到後來佈局大模型數據、具身智能數據。“數據就像石油,源源不斷被需要。”他說。
景聯文不只是提供數據採集服務,而是連接數據生產、處理、流通和應用的數據運營商。機器人前瞻與劉雲濤進行了近一個半小時的深入交流。我們聊了聊景聯文為什麼把數據作為新的方向;如何讓大多數大腦廠商都選擇景聯文的;以及具身數據的缺口該如何去解決。以下為本次對話實錄,機器人前瞻在不改變願意的基礎上進行了整理。一、從指紋算法到數據服務,劉雲濤的兩次選擇 機器人前瞻:當時是什麼樣的契機,讓您決定加入景聯文科技的?劉雲濤:景聯文當時是一家做指紋算法的公司,並且拿了LivDet(國際活體指紋檢測大賽)的一等獎,華為、vivo、oppo都是合作伙伴。
起初,我對AI完全沒有感覺,但敏銳地感受到傳統算法正向人工智能遷移,這是一個不可逆的結構性機會,所以我選擇加入。機器人前瞻:景聯文最初做指紋防偽算法,到後來轉型做數據服務,這個轉型是在什麼時間節點、基於什麼判斷決定的?劉雲濤:我加入景聯文後負責指紋防偽算法,但是這項技術會額外消耗手機存儲和算力,並且用戶也缺乏感知,很難成為手機廠商的核心賣點。轉折點出現在2019年,安卓系統要求所有的指紋、人臉識別都得搭載防偽算法,景聯文迎來了短暫的紅利期。防偽的本質是攻防博弈,防守手段最好,恰恰證明我們的攻擊手段最好。所以當時全球的傳感器廠商、手機廠商、測試機構,基本上都用景聯文的數據進行測試和訓練。
機器人前瞻:轉型是一個非常重大的決定,您剛加入景聯文就帶動轉型,內部核心團隊對這個方向的分歧大嗎?劉雲濤:我剛加入時,公司內部就已經形成共識——算法業務瓶頸非常明顯。1、景聯文指紋方案算法很好,但還需要打通客戶方,讓客戶方真正願意買算法; 2、另一個是指紋傳感器。比如客戶已經決定要買景聯文的產品,但我們需要指紋傳感器企業把指紋的原始圖像開放給我們去做訓練,如果這家企業不開放,我們就一點辦法都沒有。所以,大家逐漸意識到,算法是“點狀”突破,而數據是“面狀”基建,團隊的轉型分歧比想象中要小。機器人前瞻:為什麼當時會選中數據服務這條賽道?
劉雲濤:覆盤AI的發展歷程,無論是早期的自動駕駛,還是當下的大模型與具身智能,每一輪爆火的背後,數據始終被需要。更重要的是數據像汽油一樣,是消耗品。景聯文做的,就是把石油煉成汽油。所以AI時代的數據生意,本質上是“能源生意”,一旦做成,護城河會非常深。機器人前瞻:目前公司整體團隊規模如何?劉雲濤:目前整個團隊的規模大概是300人左右,全國服務的供應商大概有14萬人。並且我們還聯動了當地21所院校,最快7天之內能組建千人的標準化採集團隊,這是我們柔性交付能力的重要保障。
二、讓數據從“原油”變“燃料”,推出SolarSense數據工程平臺 機器人前瞻:業內在數據和基礎建設這塊,您觀察到有哪些突出的痛點?比如採集場景標準化不夠、數據質量把控難,採集成本高等。劉雲濤:其實整個數據行業到現在為止就三個痛點。第一個是數據源獲取難,現在要麼沒有數據場景,要麼有了場景也缺乏標準化的採集手段。第二個是標註難。在標註需求分散的情況下,需要專家級的標註需求難以滿足。比如外賣配送、檯球賽事、數學推導等等,每個領域都有不同的專業知識。第三個是工具難。數據類型多樣化,不同數據類型需要不同的工具支撐,比如平臺沒有遙感、多模態等特定處理功能,數據就打不開,用不了。
機器人前瞻:這些行業痛點,景聯文是如何針對性去解決?劉雲濤:面對這三個行業痛點,景聯文的策略是以賦能替代包辦,讓更多合作伙伴加入生態。1、技術賦能。通過AI智能化標註,AI智能化質檢,以及把我們的標註平臺開發給供應商使用,幫助供應商實現盈利。2、項目賦能。很多供應商拿到需求書後拆解不明白,團隊管理經驗不足。我們派駐項目經理幫助他們做項目賦能,直到他們有能力承接。可以說,景聯文應該是國內真正帶動供應商數量最多的數據公司。機器人前瞻:目前景聯文已推出的核心產品是什麼?劉雲濤:今年9月,我們會推出Solar Sense,這是中國第一款數據工程平臺。
這個平臺打通了從數據匯聚、清洗、標註再到模型訓練的全流程。它的核心優勢體現在三個方面: 1、工具覆蓋全面。SolarSense覆蓋了從圖片、文本、音頻、視頻到點雲、時間序列等多類型數據處理需求,能夠支持分類、檢測、分割、識別等機器學習任務,一站式支撐多領域模型研發。2、管理體系完善。通過數據版本管理、流程配置和數據治理能力,SolarSense能夠對數據生成過程進行記錄和追蹤,提升數據交付過程的規範性和可控性。3、平臺級智能體。平臺採用AI原生設計,內置智能體Solarclaw,幫助用戶進行數據分析、信息彙總、風險識別等工作,為項目執行和管理提供智能化輔助。
機器人前瞻:具身智能對數據的要求和AI相比,最大的不同在哪?劉雲濤:大模型時代有互聯網這座“礦山”, 文字、圖片、視頻早已大量存在。但具身智能是從0到1創造數據,沒有現成的礦可以挖。所以我們內部總結“四真兩度”標準——真人、真場景、真任務與真機,以及根據場景定義的數據維度和精度。為什麼強調“真機”?因為現在真機的成本極高,租賃和損耗都是實打實的投入。大模型是在存量數據上做文章,具身智能則是在物理世界裡從零開荒,而且每個場景的採集標準都不一樣。大模型是在已有數據上做文章,具身智能是從0-1去創造數據,而且每一類場景的採集標準都不一樣。
機器人前瞻:數採基地的建設及後期運營的成本很高,公司為什麼會選擇自建數採廠?劉雲濤:我們數採廠跟市面上“機房式”數採完全不同。大多數數採廠採購大量真機擺在那裡,這些成本是巨高的。我們的數採廠堅持真人、真場景、真任務。地方政府也給予很大支持,貴州、重慶、蕪湖等地方政府把真正的場景給我們開放出來。我們會招募真正有工作經驗的人,如保潔、操作工,佩戴輕量化設備進入真實環境中作業。數據不會憑空產生,總要有人走進物理世界的毛細血管裡去挖掘。▲第一人稱視角(Ego-centric)的輕量化採集 機器人前瞻:數採基地選在蕪湖、重慶、貴陽,是出於什麼樣的考量選擇這三個地區?劉雲濤:選址背後是產業邏輯。
蕪湖的整個製造業比較發達,這裡世界五百強公司就有兩家,周邊配套業的公司也非常多。另外,政府對場景開放也非常支持。具身智能要大量的數據採集,就需要有大量的存儲,也要有大量的基礎設施支撐。同時,貴州一直把數據作為第一產業,包括我們今天Iphone用的雲上貴州都是貴州大數據集團。當地對數據的認知是超出其他地方的。重慶對我們的力度支持也比較大,它幅員地貌多,生活環境多樣,所以我們就在這個地方建了。三、拿下90%大腦廠商,在途訂單數億元 機器人前瞻:您曾說“上下樓就是上下游”,宇樹在你們樓下。這種物理上的便利對景聯文帶來怎樣的實際影響?
劉雲濤:因為這個數據和研發是分不開的,有一家數據公司就在樓上,溝通方面會更加便捷、迅速。上一秒還在樓上開會,下一秒就能到樓下出個差。機器人前瞻:目前公司在具身智能領域的合作客戶主要是哪些?劉雲濤:國內主流的本體公司、大腦公司,我們基本上都合作了。機器人前瞻:對於具身智能的客戶,如本體、模型等公司,在數據上遇到的痛點,公司是怎麼幫他們解決的?劉雲濤:客戶最大的痛點就是場景。很多高價值的場景都在政府和大型企業手裡,所以我們選擇了貴州、蕪湖,政府協調場景給我們去做採集。另外,我們合作企業有大量場景方,他們可以給我們提供真實場景去做數據採集。
第二個痛點是合格數據的穩定交付,這包含三個維度:場景、標註和速度。在場景上,合作方、政府都給我們提供了大量場景採數據。在標註上,我們跟模型廠商合作,我們買他們的模型,用他們的模型來給我們做自動化的標註。在速度上,景聯文多年積累的供應商畫像能力,能夠做到精準匹配、快速響應,確保數據交付的速度和質量。機器人前瞻:具身智能領域正處於增長的爆發期,公司在這個方向上的業務發展怎麼樣?相比較去年發展情況,今年這半年在具身領域上的業務增長如何?劉雲濤:在具身智能這塊,我們主要選擇大腦公司和場景公司。其中本體公司和大腦公司實際發生簽單的至少有80%。
整體來看,國內90%的大腦廠商與景聯文有合作,在途的具身智能訂單規模已達數億元,今年的增速遠超去年。此外,不只是AI公司,包括螞蟻、騰訊、華為等大型傳統科技企業,在數據服務上也首選景聯文。機器人前瞻:可以用一句話或者是一個詞來形容一下景聯文嗎?劉雲濤:靈活。在具身數據領域,專業性是基礎,但靈活性是生命線。比如我們的項目經理提出一個需求,要求是6個小時之內研發人員必須要響應到位。因為在高速迭代的行業裡,響應速度決定了數據的時效價值——你不可能比模型公司更懂算法,但你可以比他們更懂如何高效地把物理世界翻譯成數據。
四、數據缺口不會快速填平,但千億公司終將出現 機器人前瞻:與語言模型數據比,具身智能數據缺口大。截至今年年初,數據總量僅約50萬小時,無法滿足模型訓練迭代,您作為數據領域的專家,您覺得這個問題能快速得到解決麼?劉雲濤:短期內很難。語言模型的訓練數據是人類日常交互自然產生的副產品。比如微信聊天、每天的飛書釘釘,每天打多少的語音通話,是自發的,只是授權和使用的問題。但具身智能的數據無法依靠全民自發產生,它必須由專業團隊攜帶設備進入真實的物理世界主動採集。更何況,現在的採集設備在連接、精度、重量、續航、存儲等方面仍面臨大量工程挑戰。這條路沒有捷徑,只能一公里一公里地採集,一個小時一個小時地積累。
具身智能的本體一定會越來越靈活,大腦一定會跑通,但是需要時間。機器人前瞻:哪一條技術路線是有可能解決這個問題的?劉雲濤:坦白說,每一條路線都面臨巨大挑戰。自動駕駛花了近十年才在單一場景積累足夠數據,具身智能面對的是家庭、工廠、商場等成百上千倍的場景複雜度。我認為具身智能不是一個行業,而是一個載體——載體+場景,才構成完整的數據命題。當下最重要的是先把“四真兩度”的高質量數據採出來,種類足夠豐富、精度足夠高。至於觸覺、力覺等多模態數據的成熟,還需要傳感器硬件的協同突破,這都需要時間。
機器人前瞻:面對數據缺口,不少本體、模型企業已經在著手自己採數據了,您覺得本體廠商自研數據和第三方數據服務商的差異在哪?第三方數據服務商會不會被取代?劉雲濤:術業有專攻,數據需求量足夠大,且呈現碎片化、多場景特徵,專業分工是產業成熟的必由之路。我們的核心價值在於成本結構和複用效率。例如,我們租下一個場景進行集中採集,可以將基礎設施和部署成本分攤給多家客戶,邊際成本遠低於每家客戶單次租用、單次採集的模式。在AI行業全面追求降本增效的背景下,專業第三方數據服務商不是“可選項”,而是“更優解”。機器人前瞻:您認為真正能夠長期存活下來的數據服務企業,應該具備哪些核心能力?
劉雲濤:我認為是技術驅動的靈活性。靈活性體現在技術上——比如在智能標註環節,我們能快速搭建作業流的智能體,真正做到高效,幫助客戶降本。景聯文正在加大研發投入,做成一個標註領域的垂域模型。機器人前瞻:您說過未來3到5年,中國一定會出現千億級的數據公司。那您希望景聯文未來會佔據一個怎樣的位置?尤其在具身智能領域,發展目標是什麼?劉雲濤:我覺得中國一定會出現一個千億的市值公司,甚至我覺得比千億的公司更大。但觀察現在的行業,現在很多數據公司承載兩三個億就上不去了。因為場景太分散——今天採100個家庭,明天要採放電站,後天要採石油化工,單靠一家公司的自有資源根本無法覆蓋。
景聯文給自己的定位是做數據的“運營商”,而非單純的“採集隊”。我們要建立的是數據生產、流通、應用的標準和生態,不僅自己成長,更要帶動上下游供應商一起壯大。在具身智能領域,我們的目標是成為那個定義數據標準的鏈接者——我們不視任何同行為競爭對手,而是希望與各方共建這個生態。
Related
相關文章

OpenAI 將向印度 ChatGPT 免費及 Go 套餐用戶投放廣告
作者:清源 責編:清源 評論: 8 月 27 日消息,OpenAI 宣佈,即日起將在印度向 ChatGPT Free 和 Go 套餐用戶投放廣告。本月早些時候,OpenAI 修改了服務條款,明確說明用戶在使用 ChatGPT 時可能看到廣告。

谷歌推出全球首個雙盲 AI 評估技術,基於加密環境保障基準測試公正性
作者:小泵 責編:小泵 評論: 8 月 27 日消息,谷歌宣佈推出全球首個針對前沿專有 AI 模型的雙盲評估,將外部評估限制在加密“黑箱”環境中,避免模型提前獲取測試信息來優化性能。就像學生考前不能提前看到試題才能真實反映水平一樣,當前 AI 模型評估也面臨同樣問題:如果模型提前接觸測試題目(注:也就是所謂的“基準汙染”),評估結果的可信度就會大打折扣。

上線一月,Seedance 2.5能否抗住“平替”圍攻?
1小時前HappyHorse與Wan3.0賽馬,誰是阿里版Seedance?昨天衝擊250億,拓竹復刻大疆第一步:隔壁開店圈地2026-08-21閱讀更多內容,狠戳這裡查看AI測評豆包MiniMax即夢AI選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇Figure用一款APP建立全球「數據採集經濟體」,中國具身企業誰會搶先跟進?

ChatGPT報警後:誰有權審判你的對話框?
ChatGPT等生成式AI若在對話中偵測到潛在威脅,是否應主動通報執法單位,引發各界討論。支持者認為AI應承擔社會責任即時阻止憾事,反對者則擔憂語言模型易誤判玩笑與反諷,恐侵犯隱私和言論自由。目前缺乏明確法律框架界定AI舉報義務與責任歸屬,未來或需建立分級制度,由人類專業人員最終判斷。

HBM正在被重新定義
半導體產業縱橫2026.08.27 18:25 · 來自北京全文3679字00:00 / 11:37新一代HBM4將成為技術轉折點。文 | 半導體產業縱橫隨著AI大模型訓練與推理需求持續爆發,算力芯片的性能瓶頸已從計算單元轉向存儲帶寬,HBM高帶寬內存成為制約高端AI硬件迭代的核心關鍵。在HotChips 2026國際高端芯片技術大會上,全球兩大存儲龍頭三星、SK海力士集中披露了HBM4下一代技術演進路線,打破了行業沿用多年的HBM迭代邏輯。

Day-0 支持:摩爾線程官宣完成智譜 GLM-5.3-Flash 極速適配
作者:歸瀧 責編:歸瀧 評論: 感謝網友 Autumn_Dream 的線索投遞!8 月 27 日消息,智譜近日上線並開源 GLM-5.3-Flash (320B-A18B)。摩爾線程官方今日宣佈,基於 AI 訓推一體智算卡 MTT S5000 及 MUSA 軟件棧,Day-0 支持,實現了對該模型的極速適配與高效運行。