比亞迪AI團隊首次曝光,哈工大機器人基因亮眼,大模型首發即SOTA

2026年7月29日 16:50
比亞迪AI團隊首次曝光,哈工大機器人基因亮眼,大模型首發即SOTA

重點摘要

比亞迪AI團隊首次曝光,一篇自動駕駛學術論文讓外界看到截然不同的技術實力。比亞迪汽車新技術研究院(原規劃院)近日發表HyWorldVLA模型,在自動駕駛公開基準NAVSIM v1上取得SOTA成績,PDMS達到90.59。這也是比亞迪首次公開多模態基礎模型的研究成果,而且論文完全由內部團隊獨立完成,沒有外部學研單位合作署名,凸顯其自研能力。 過去外界對比亞迪智能化的印象多集中在「天神之眼」、供應鏈整合與規模化量產,對其代碼級自研的AI技術了解有限,甚至傳出智能發表會簡報由供應商代勞的說法。

站內 AI 整理稿

比亞迪AI團隊首次曝光,一篇自動駕駛學術論文讓外界看到截然不同的技術實力。比亞迪汽車新技術研究院(原規劃院)近日發表HyWorldVLA模型,在自動駕駛公開基準NAVSIM v1上取得SOTA成績,PDMS達到90.59。這也是比亞迪首次公開多模態基礎模型的研究成果,而且論文完全由內部團隊獨立完成,沒有外部學研單位合作署名,凸顯其自研能力。 過去外界對比亞迪智能化的印象多集中在「天神之眼」、供應鏈整合與規模化量產,對其代碼級自研的AI技術了解有限,甚至傳出智能發表會簡報由供應商代勞的說法。如今這篇論文的出現,讓外界看到比亞迪已經成立一支長期投入物理AI基礎模型的研發團隊,背後更具備哈工大機器人領域的深厚基因。 HyWorldVLA瞄準自動駕駛最前沿的Vision-Language-Action(VLA)結合世界模型(World Model)路線。世界模型的核心是讓AI擁有「內部模擬器」,不僅感知當前環境,還能夠預測未來數秒道路變化與其他交通參與者的行為。目前學界與業界面臨兩難:像素級世界模型(Pixel-level)能保留真實細節,但計算成本高且易受視覺雜訊干擾;隱空間世界模型(Latent)效率高,卻可能丟失真實世界的關鍵資訊。HyWorldVLA提出混合世界模型(Hybrid World Modeling),同時取得兩者優勢,再引入VLA架構,讓系統能夠結合視覺、語言與動作,形成從感知、理解、預測到執行的端到端流程。 這套模型在NAVSIM v1上接受檢驗。該平台採用貼近實際駕駛品質的PDMS指標,同時考核碰撞風險、可行駛區域、安全距離、任務達成率與舒適性。HyWorldVLA取得90.59分,達到公開結果領先水準。不過需要客觀看待的是,Benchmark領先不等於量產自動駕駛已經到位,更重要的意義在於比亞迪證明自己具備多模態物理AI基礎模型的研究能力。 HyWorldVLA的訓練流程分為三步。第一步訓練視訊壓縮器,將連續幀壓縮成緊湊的隱特徵,並引入文字描述作為語義指引,提升重構畫質。第二步進行預訓練,將圖像、動作、語言與隱特徵統一轉為離散Token,用自迴歸方式預測下一個Token;關鍵設計是同時預測未來畫面的Token與未來隱特徵,讓畫面包抄監督隱空間保持足夠資訊。第三步聯合微調,模型不再預測畫面,只輸出隱特徵,再由動作生成模組融合歷史資訊產出最終軌跡。論文驗證了兩種動作模組,皆獲得提升,證明增益不依賴特定設計。 消融實驗進一步揭露SOTA的關鍵。去掉像素級畫面預測只保留隱空間,PDMS從90.59降至87.50,是所有消融中跌幅最大;反之只保留像素級模型,分數為89.91。兩條路線缺一不可,混合架構才是核心優勢。隱特徵監督權重的調整也顯示出最佳平衡點:完全不約束時為90.17,適中權重(0.1)達到90.59,權重過大反而降至89.75。此外,模型在655個雨霧場景的測試中展現出色穩定性,純像素方法僅約60分,HyWorldVLA達到86.87,證實壓縮空間推理能有效抵抗惡劣天候造成的雜訊。 這套方案的成功在於分階段分工:預訓練時用像素重建將隱空間「餵飽」,微調時切換到純隱空間推理,自動獲得對雨霧光照的免疫力,兩個階段互不干擾。 從論文作者群與團隊背景可以發現,比亞迪AI團隊帶有濃厚的學術研究色彩。HyWorldVLA的通訊作者Liulong Ma,個人資料低調,但學術足跡涵蓋自動駕駛規劃、機器人導航、多模態感知與世界模型等方向,出身哈工大機器人技術與系統國家重點實驗室及機電系。另一位主要研究者Hongbiao Zhu,以EMoE-Planner第一作者身分於2025年發表論文,同樣具有哈工大與卡內基美隆大學(CMU)背景。這些線索顯示,比亞迪新技術研究院的AI團隊並非從傳統汽車電子或ADAS工程延伸,而是直接吸收頂尖機器人與電腦視覺人才,形成「機器人AI派」的團隊結構。 比亞迪的自研AI布局並非臨時起意。從2025年EMoE-Planner到2026年HyWorldVLA,以及多篇登上ICLR、CVPR、NeurIPS等頂級會議的合作論文,證明內部已有一個穩定運轉的基礎AI研究小組,而非階段性專案。值得關注的是,這與比亞迪正推進的自研機器人計畫形成技術呼應。HyWorldVLA所代表的VLA與世界模型路線,本質上就是機器人「感知—推理—行動」閉環的自動駕駛版本,兩者共用同一套技術棧與人才基因。比亞迪的組織邏輯在某種程度上接近Tesla AI,將機器人與自動駕駛一體化,從物理AI的第一性原理出發搭建團隊。 HyWorldVLA的發表,讓外界首次看到比亞迪正在展現過去並不顯性的能力——物理AI基礎模型研發。自動駕駛競爭正從功能堆疊進入物理AI能力競爭的階段,比亞迪顯然已經意識到這點。雖然HyWorldVLA是否代表比亞迪已進入第一梯隊還有待更多驗證,但可以確定的是,在所有傳統車廠中,比亞迪率先拋開單純的就事論事做智慧輔助駕駛,而是按照AI系統能力建設團隊,並將研究觸角延伸至機器人與基礎大模型。

Related

相關文章

IT之家生成式AI

讓 32GB 內存能跑 GPT-OSS-120B:Nextorage 將推外接式 AI 加速硬件

群聯(Phison)旗下日本儲存模組品牌 Nextorage 近日宣布,將推出一款名稱暫定為「aiDAPTIV Station」的外接式硬體裝置,目標是讓僅配備 32GB 記憶體的 AI 筆記型電腦,也能順利運行像 OpenAI GPT-OSS-120B 這類參數量高達 120B 的大型語言模型。這項產品預計在今年內率先於日本市場上市,並同步規劃提供預先建構的軟體套件方案,以降低使用者導入門檻。 隨著生成式 AI 應用快速普及,大型語言模型對系統記憶體的需求也越來越高。

剛剛

Claude最大規模MCP升級,月下載狂飆破4億

Anthropic 於 27 日宣布推出代號 MCP 2026-07-28 的協定大改版,官方宣稱這是 MCP 自發布以來規模最大的一次升級。新版將核心架構從有狀態改為無狀態,同時把擴充功能提升為一等公民,並補上企業級安全認證與管理機制,試圖為 AI 智慧體與外部系統的連線訂出業界標準。

剛剛