算力需求兩年漲10倍,機器人為了走進真實物理世界,正在瘋狂「吃算力」

2026年8月14日 15:33
算力需求兩年漲10倍,機器人為了走進真實物理世界,正在瘋狂「吃算力」
站內 AI 整理稿

少花一半成本,部署效率提升80%!機器人研發可以不用重複造輪子了。田晏林 發自 凹非寺 | 公眾號 QbitAI 上週五,逐際動力線下黑客松實訓大賽「創學營2026」的收官現場,選手們正在雲上跑最後一輪仿真評測。他們打開瀏覽器,登錄一臺遠在雲端的工作站,旋轉著Isaac Sim裡的機械臂場景,調整參數,生成數據。這一幕要放在3年前很難實現。籌辦類似的比賽,光是找場地、配機器就要耗費1個月的時間。機器人訓練可不是打開電腦,寫寫代碼這麼簡單。背後需要Isaac Sim、NVIDIA Omniverse等仿真環境,需要GPU算力支撐,還涉及不同版本軟件、驅動和開發工具的統一配置。

一場創學營辦下來,每多一名選手,對主辦方的環境部署、設備採購和資源管理都會提出更多要求。更麻煩的是,活動結束後,這些高性能設備又可能長期閒置。買得越多,浪費越大。逐際動力選擇了一種不同的方式。藉助阿里雲旗下的AI創研算力平臺無影靈構的雲上工作站,選手們可以快速接入統一研發環境,算力資源按照實際需求彈性調整,不需要提前採購大量固定設備。這場演練明面上是在探索「機器人怎麼變聰明」,背後的隱藏副本則是「如何讓研發機器人的公司,變得更高效」。為什麼訓練一個機器人,這麼費機器?大模型讓機器人開始具備理解和推理能力。

但從會聊天到會幹活,還需要經歷一整套複雜流程:遙操作數據採集、算法調試、仿真訓練、真機部署。與數字AI不同,機器人面對的是一個高度複雜、不斷變化的真實世界。它需要理解空間,需要感知物體,需要預測動作,還需要在真實環境裡不斷試錯。每一個環節都離不開計算資源支撐。圖片由AI生成 這也是為什麼,具身智能的競爭從來不只是模型參數競爭,更是一場圍繞算力、數據和工程效率展開的長期競賽。逐際動力聯合創始人兼CTO諶驊告訴,過去兩年,粗略估算,公司研發團隊對算力的需求增長了5到10倍。(吞卡獸.jpg) 而且是有多少卡就能吃掉多少卡。算力需求暴漲,只是問題的一面。

更大的變化在於,機器人研發正在從單點實驗走向複雜工程協作。過去,一名算法工程師擁有一臺高性能工作站,配置好環境,就能完成部分研發工作。但今天,一個完整的具身智能團隊,需要同時處理仿真訓練、數據處理、模型迭代、多人協作和真機驗證。研發資源不再只是「一臺機器」,而是一整套持續運行的基礎設施。阿里雲智能集團副總裁、終端智能計算事業部總裁張獻濤認為,雲計算的發展已經經歷了兩次基礎設施遷移。第一朵雲支撐了互聯網,第二朵雲支撐了移動互聯網。而現在,機器人時代需要第三朵雲。這一次,雲需要解決的不只是計算資源的問題,而是讓算力、開發環境和3D交互能力一起進入機器人研發流程。

話說回來,為什麼機器人研發會逼出第三朵雲?一個機械臂抓取物體,看似只是伸手、移動、拿起幾個動作,但背後需要理解物體位置、形態、重量、摩擦力以及周圍環境變化。一個人形機器人行走,也不是簡單輸出幾個動作指令,而需要持續調整重心、處理身體平衡、關節控制和空間反饋。尤其在人形機器人研發中,3D仿真環境需要同時處理複雜場景、機器人運動和物理交互,對圖形算力提出了更高要求。這讓機器人研發天然成為高算力行業。但過去,支撐這種研發的基礎設施沒有跟上產業速度。此前,業內通常採用採購工作站-安裝軟件-配置GPU環境-逐臺維護這套模式。

工程師想要搭建一套可用的開發環境,得登錄集群,靠命令行一步步安裝軟件、配置依賴、下載庫文件、編譯程序、啟動各項服務,整套流程經常耗費四五個小時。這簡直是一種「折磨」。麻煩不說,關鍵是在團隊規模較小時,尚且勉強可行,一旦團隊擴大、任務增加,這種方式越來越難適應快速變化的研發節奏和快速擴張的團隊規模。諶驊也表示,實際工作中,團隊在仿真環境的配置,訓練資源的調度上總會遇到各種各樣的小問題。比如CUDA、ROS2、Isaac Sim等工具鏈組合複雜,依賴庫、驅動之間極易出現版本衝突; 軟件、仿真器迭代更新速度快,團隊多臺本地工作站硬件型號不一,很難做到全設備環境完全統一。

甚至新人入職,或者臨時讓外包人員進場,還得從零開始下載、編譯、調試全套開發環境。「單人配置耗時長達大半天,這些都是機器人研發中的隱藏成本。」 此外,外包和跨地域協作帶來賬號、數據權限、審計和離場的回收壓力,也是具身智能公司不得不考慮的現實問題。擁有一個可以雲端靈活調用、彈性擴容、開箱即用和安全環境的工作站,迫在眉睫。把工作站搬上雲之後 在與多傢俱身智能公司溝通後,張獻濤發現,當行業走到工程化階段,環境、算力、數據、仿真這些事,眼下每家公司都在自己搭一遍。「這背後不是誰願意重複造輪子,而是這一層還沒有變成標準件。」 在他看來,共性越強的部分,越應該被儘早沉澱成標準件。

無影靈構要承載的就是這些共同需求:把具身智能的研發現場搬到雲上,環境按需複用,算力隨任務調度。「本體、模型、數據和真實場景,始終應該長在機器人公司自己手裡。我們要做的是把基礎設施帶來的研發摩擦降到最低。」張獻濤說。今年3月,逐際動力與阿里雲無影深聊了下。儘管逐際動力很早就和阿里雲建立長期合作,但此前雙方僅依託PAI平臺、通用GPU算力,完成大規模模型訓練的底層算力合作。而這一次,他們討論的問題聚焦在具身智能研發全鏈路的前端工程痛點: 仿真難可信、訓練難穩定、真機難規模化、數據難形成高質量閉環。這四個問題背後,又共同受到環境碎片化、算力錯配、成本和安全治理等因素影響。

過去,機器人團隊往往需要自己搭建一整套研發環境。買GPU工作站、安裝CUDA和ROS2、配置Isaac Sim、管理不同版本依賴,再把數據在本地和雲端之間反覆搬運。對於成熟團隊,這是一筆持續投入;對於快速成長的機器人公司,這更像是一種重複建設。無影靈構給出的思路,是把過去擺在工位上的高性能工作站搬到雲端。一些重型計算單元(GPU、仿真環境、數據盤)全部上雲,工程師只用輕量設備通過網絡串流畫面操作雲端工作站。對工程師來說,最直觀的變化首先發生在環境交付。機器人研發環境最大的痛點之一,就是複雜。CUDA版本、驅動版本、仿真軟件版本之間存在大量依賴關係。一臺機器能運行,不代表十臺機器都能穩定運行。

尤其對於創學營這類需要快速接入大量開發者的場景,如果每個人都從零開始配置環境,時間成本非常高。無影靈構提前把研發機器人要用的所有軟件、驅動打包做成固定模板鏡像。想新增開發機器,一鍵複製模板就行;新人登錄賬號,點開就能用一模一樣的環境,不用自己折騰安裝。諶驊表示,過去團隊本地配置Isaac仿真環境時,經常會遇到各種報錯,而在無影靈構AI工作站裡,可直接選現成鏡像啟動。「半小時就能開工,很少出故障,穩定很多。」 這不只是節省安裝時間,還讓機器人研發環境具備了軟件行業熟悉的標準化能力。算力彈性,是另一個關鍵變化。機器人研發天然需要大量試錯。

算法調優、仿真訓練、模型評測,不同階段對於算力的需求並不相同。傳統模式下,企業只能按照峰值需求採購硬件。結果就是:忙的時候,GPU永遠不夠;閒的時候,高價值設備長期閒置。更麻煩的是,顯卡更新換代很快,一次性花幾千萬自建算力,過兩年硬件升級,錢等於打了水漂。雲端工作站改變的是算力獲取方式。據無影靈構產品經理王姣陽介紹,企業可以根據不同任務靈活選擇GPU規格。日常研發保持穩定資源,高峰期遇到訓練營、大規模測試等任務時,可以快速擴容,項目結束後再釋放。「算力跟著需求靈活調整。」諶驊說。從買設備,到調用算力,機器人研發正在進入一種新的資源組織方式。但對於具身智能而言,僅僅解決算力供給還不夠。

決定雲端工作站能否落地的,還得看雲上的機器人研發體驗,能不能接近本地。雲端工作站,先要過「像不像本地」這一關 判斷一個雲端工作站好不好用,還得看工程師能否感覺到GPU在哪裡。就拿機器人仿真訓練來說,工程師需要實時操作3D場景,拖動機器人模型,調整環境參數,觀察運動結果。任何一個環節出現延遲,都會直接影響調試效率。這也是無影靈構區別於普通雲主機的地方。它解決的不是單純的計算能力,而是雲端3D工作站體驗。無影靈構通過無影自研的ASP流化協議,對圖形渲染、視頻編碼、網絡傳輸、終端解碼和輸入回傳進行整體優化,讓雲端GPU完成渲染後,將畫面實時傳輸到本地終端。

在現有Isaac Sim對比測試中,這種差異更加明顯。在簡單操作場景下,拖動座標軸時,無影ASP與NVIDIA WebRTC streaming均可以達到30fps。但當操作複雜度提升到模型文件拖動旋轉時,WebRTC幀率下降至約22fps,而無影仍保持約29fps,高出7fps,幀率提升約32%,達到滿幀水平的97%左右。穩定幀率,對於機器人研發意味著什麼?工程師旋轉機械臂模型、調整仿真場景時,不會因為雲端傳輸產生明顯遲滯。除了畫面流暢度,帶寬效率也是雲端工作站能否規模使用的關鍵。在相同模型旋轉操作中,無影ASP平均帶寬約1.9Mbps,相比WebRTC等方案降低約50%。

按每天使用8小時估算,單臺終端日均流量消耗約7GB。更低的帶寬佔用,能夠支持更多研發人員遠程接入。再看弱網環境下,無影靈構的表現也是相當穩。在丟包率達到10%、帶寬限制在5Mbps的兩組獨立測試中,無影仍能維持約27fps,相比其他方案幀率提升約29%。發生斷網後,系統也支持自動恢復和重新連接。這些技術層面的量化指標,表明雲端工作站正在從「遠程GPU」變成「機器人研發基礎設施」。

圖片由AI生成 別看把工作站搬上雲,貌似只換了臺機器的位置,無影靈構AI工作站實際要同時解決四件事: 環境交付——把CUDA、ROS2、Isaac Sim這套極易衝突的工具鏈預製成行業鏡像,一鍵複製; 圖形算力——3D仿真場景要在雲端渲染、串流到本地,還要保證工程師拖動視角時的實時手感; 彈性調度——高峰期分鐘級擴出上百臺,項目結束即釋放; 安全治理——數據不落地、權限可管、外包人員離場即回收。這四件事裡,前兩件是技術門檻,後兩件是工程門檻。一件都不能缺。圖片由AI生成 目前,無影靈構與逐際動力的合作主要集中在模型訓練、仿真評測和雲上研發環境。

但隨著機器人研發進入數據驅動和持續迭代階段,無影靈構的價值也將從提供雲上工作站,進一步延伸到承載完整的具身智能研發工作空間。未來,靈構將逐步連接遙操作數據採集、數據處理、標註質檢、模型訓練和仿真評測,讓任務能夠從工作空間發起,讓結果重新回到項目,並通過統一的權限、版本和運行記錄,使研發過程更加可復現、可比較、可審計。據悉,多傢俱身智能頭部企業已基於無影靈構AI工作站構建雲上數據採集工廠和仿真評測,加速機器人的研發週期。算力像水電一樣,還需要最後一里路 從逐際動力與無影靈構的合作可以看出,整個具身智能行業研發方式正在發生劇烈變化。

越來越多機器人團隊正在從「買設備、配環境、管服務器」,轉向「按需調用算力、複用研發環境、雲上協同開發」。原因很簡單,機器人研發天然需要大量試錯。但真實機器人測試成本高、週期長。這也是為何逐際動力會將與無影靈構合作的第一站,放在仿真評測上。但仿真只是起點。當機器人進入長期研發階段,僅有算力還不夠。機器人團隊還需要解決環境配置、模型訓練、數據處理、真機部署等一系列問題。換句話說,行業需要的不只是一臺更大的服務器,而是一套完整的研發基礎設施。這也是為什麼,機器人企業正在嘗試把自身積累的工程經驗進一步標準化。今年4月,逐際動力正式開源「FluxVLA Engine」。

這是一個標準化具身智能大模型工程底座。目標是讓擁有真實場景數據的合作伙伴、用戶,也能夠自主完成數據處理、模型搭建、仿真評測和真機部署,大幅降低了VLA全研發週期的工程門檻。某種程度上,它與無影靈構探索的方向形成了呼應。據王姣陽介紹,無影靈構也在推動具身智能研發中各類零散的基礎能力實現標準化。包括高性能3D工作站、統一開發環境、行業鏡像、算力調度以及企業級安全管理,讓機器人團隊不必重複搭建底層研發設施,而可以將更多資源投入到模型、算法和場景驗證中。兩者關注的,其實都是降低具身智能研發門檻,只是切入角度不同。FluxVLA Engine承載的是逐際動力在機器人研發過程中的核心經驗。

從數據處理到模型訓練,從仿真評測到真機適配,這些環節直接連接機器人能力迭代和最終產品表現,因此需要機器人企業持續沉澱。諶驊也說,FluxVLA Engine和無影靈構代表了具身智能基礎設施中不同方向的平臺能力,雙方完全可以在研發環境、工具鏈和基礎設施層面展開更深的結合。因為無影靈構並不參與機器人本體設計,也不替代企業定義模型路線,只是提供穩定的雲上工作空間,讓不同技術路線的機器人團隊都可以更高效地開展研發。直白點說,機器人公司負責回答「機器人應該如何工作」;無影靈構負責解決「研發這件事如何更高效完成」。有沒有覺得這條路徑,和雲計算的發展非常相似?

雲計算沒有替互聯網公司創造產品,也沒有決定應用應該如何創新。但它把服務器、存儲、網絡這些過去需要企業自己建設的基礎能力,變成了可以按需調用的公共資源。最終,互聯網公司的競爭焦點也從「誰有更多服務器」,轉向「誰能做出更好的產品」。而現在,具身智能行業也在經歷類似變化。當算力、環境和研發工具逐漸基礎設施化,機器人公司的競爭重點,也將從「誰搭建了更多底層設施」,轉向「誰能讓機器人更快學會新技能,並真正進入真實場景」。One more thing 技術本質上沒有壁壘,壁壘是迭代速度,技術領先只是時間紅利。這是諶驊給出的判斷。在具身智能這個技術路線尚未收斂、各家都在快速試錯的階段,時間紅利就是一切。

實際上,無影靈構在具身智能之前,已經在AIGC的3D內容生成、工業設計的實時渲染、影視廣告的後期製作這些高算力3D場景裡跑了好幾年。那些行業同樣被高端工作站的採購週期折磨,同樣面臨項目來了缺算力、項目走了機器閒置的窘境,同樣需要在雲端完成低延遲的3D交互。只不過,具身智能對這套基礎設施的要求更苛刻: 仿真場景的3D交互要更實時,ROS2和Isaac Sim的鏡像要更完整,數據安全策略要更嚴格,算力彈性要更靈敏。從這個角度看,具身智能更像是高算力3D雲工作站的一個極限考場。基礎設施從來不搶主角的戲,它只是把已經鋪好的路,往更多需要的地方多修一程。具身智能恰好是這一程裡,目前最著急趕路的那批人。

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛