比亞迪AI團隊首次曝光,哈工大機器人基因亮眼,大模型首發即SOTA

2026年7月29日 16:50
比亞迪AI團隊首次曝光,哈工大機器人基因亮眼,大模型首發即SOTA

重點摘要

比亞迪AI團隊首次曝光,一篇自動駕駛學術論文讓外界看到截然不同的技術實力。比亞迪汽車新技術研究院(原規劃院)近日發表HyWorldVLA模型,在自動駕駛公開基準NAVSIM v1上取得SOTA成績,PDMS達到90.59。這也是比亞迪首次公開多模態基礎模型的研究成果,而且論文完全由內部團隊獨立完成,沒有外部學研單位合作署名,凸顯其自研能力。 過去外界對比亞迪智能化的印象多集中在「天神之眼」、供應鏈整合與規模化量產,對其代碼級自研的AI技術了解有限,甚至傳出智能發表會簡報由供應商代勞的說法。

站內 AI 整理稿

比亞迪AI團隊首次曝光,一篇自動駕駛學術論文讓外界看到截然不同的技術實力。比亞迪汽車新技術研究院(原規劃院)近日發表HyWorldVLA模型,在自動駕駛公開基準NAVSIM v1上取得SOTA成績,PDMS達到90.59。這也是比亞迪首次公開多模態基礎模型的研究成果,而且論文完全由內部團隊獨立完成,沒有外部學研單位合作署名,凸顯其自研能力。過去外界對比亞迪智能化的印象多集中在「天神之眼」、供應鏈整合與規模化量產,對其代碼級自研的AI技術了解有限,甚至傳出智能發表會簡報由供應商代勞的說法。

如今這篇論文的出現,讓外界看到比亞迪已經成立一支長期投入物理AI基礎模型的研發團隊,背後更具備哈工大機器人領域的深厚基因。HyWorldVLA瞄準自動駕駛最前沿的Vision-Language-Action(VLA)結合世界模型(World Model)路線。世界模型的核心是讓AI擁有「內部模擬器」,不僅感知當前環境,還能夠預測未來數秒道路變化與其他交通參與者的行為。目前學界與業界面臨兩難:像素級世界模型(Pixel-level)能保留真實細節,但計算成本高且易受視覺雜訊干擾;隱空間世界模型(Latent)效率高,卻可能丟失真實世界的關鍵資訊。

HyWorldVLA提出混合世界模型(Hybrid World Modeling),同時取得兩者優勢,再引入VLA架構,讓系統能夠結合視覺、語言與動作,形成從感知、理解、預測到執行的端到端流程。這套模型在NAVSIM v1上接受檢驗。該平台採用貼近實際駕駛品質的PDMS指標,同時考核碰撞風險、可行駛區域、安全距離、任務達成率與舒適性。HyWorldVLA取得90.59分,達到公開結果領先水準。不過需要客觀看待的是,Benchmark領先不等於量產自動駕駛已經到位,更重要的意義在於比亞迪證明自己具備多模態物理AI基礎模型的研究能力。HyWorldVLA的訓練流程分為三步。

第一步訓練視訊壓縮器,將連續幀壓縮成緊湊的隱特徵,並引入文字描述作為語義指引,提升重構畫質。第二步進行預訓練,將圖像、動作、語言與隱特徵統一轉為離散Token,用自迴歸方式預測下一個Token;關鍵設計是同時預測未來畫面的Token與未來隱特徵,讓畫面包抄監督隱空間保持足夠資訊。第三步聯合微調,模型不再預測畫面,只輸出隱特徵,再由動作生成模組融合歷史資訊產出最終軌跡。論文驗證了兩種動作模組,皆獲得提升,證明增益不依賴特定設計。消融實驗進一步揭露SOTA的關鍵。去掉像素級畫面預測只保留隱空間,PDMS從90.59降至87.50,是所有消融中跌幅最大;反之只保留像素級模型,分數為89.91。

兩條路線缺一不可,混合架構才是核心優勢。隱特徵監督權重的調整也顯示出最佳平衡點:完全不約束時為90.17,適中權重(0.1)達到90.59,權重過大反而降至89.75。此外,模型在655個雨霧場景的測試中展現出色穩定性,純像素方法僅約60分,HyWorldVLA達到86.87,證實壓縮空間推理能有效抵抗惡劣天候造成的雜訊。這套方案的成功在於分階段分工:預訓練時用像素重建將隱空間「餵飽」,微調時切換到純隱空間推理,自動獲得對雨霧光照的免疫力,兩個階段互不干擾。從論文作者群與團隊背景可以發現,比亞迪AI團隊帶有濃厚的學術研究色彩。

HyWorldVLA的通訊作者Liulong Ma,個人資料低調,但學術足跡涵蓋自動駕駛規劃、機器人導航、多模態感知與世界模型等方向,出身哈工大機器人技術與系統國家重點實驗室及機電系。另一位主要研究者Hongbiao Zhu,以EMoE-Planner第一作者身分於2025年發表論文,同樣具有哈工大與卡內基美隆大學(CMU)背景。這些線索顯示,比亞迪新技術研究院的AI團隊並非從傳統汽車電子或ADAS工程延伸,而是直接吸收頂尖機器人與電腦視覺人才,形成「機器人AI派」的團隊結構。比亞迪的自研AI布局並非臨時起意。

從2025年EMoE-Planner到2026年HyWorldVLA,以及多篇登上ICLR、CVPR、NeurIPS等頂級會議的合作論文,證明內部已有一個穩定運轉的基礎AI研究小組,而非階段性專案。值得關注的是,這與比亞迪正推進的自研機器人計畫形成技術呼應。HyWorldVLA所代表的VLA與世界模型路線,本質上就是機器人「感知—推理—行動」閉環的自動駕駛版本,兩者共用同一套技術棧與人才基因。比亞迪的組織邏輯在某種程度上接近Tesla AI,將機器人與自動駕駛一體化,從物理AI的第一性原理出發搭建團隊。

HyWorldVLA的發表,讓外界首次看到比亞迪正在展現過去並不顯性的能力——物理AI基礎模型研發。自動駕駛競爭正從功能堆疊進入物理AI能力競爭的階段,比亞迪顯然已經意識到這點。雖然HyWorldVLA是否代表比亞迪已進入第一梯隊還有待更多驗證,但可以確定的是,在所有傳統車廠中,比亞迪率先拋開單純的就事論事做智慧輔助駕駛,而是按照AI系統能力建設團隊,並將研究觸角延伸至機器人與基礎大模型。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

14 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前