小鵬甩出TuringViT視覺編碼器:只用十分之一數據,卻把SOTA基線甩在身後
重點摘要
AI資訊AI新閒資訊正文小鵬甩出TuringViT視覺編碼器:只用十分之一數據,卻把SOTA基線甩在身後發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘視覺大模型長期被一個隱形門檻卡著:想拿到頂尖效果,就得先囤夠天量數據和算力,這讓先進視覺能力成了少數頭部團隊的專屬玩具。
小鵬集團於7月21日正式發布TuringViT高效視覺編碼器,這款產品從架構設計、數據處理範式到訓練流程,進行了系統性的重構,聲稱在僅使用業界十分之一訓練數據量的條件下,即可達到甚至超越當前SOTA基線的表現。這項突破意味著過去長期困擾視覺大模型的「高品質數據與巨量算力門檻」有望被打破,讓先進的視覺能力不再是少數頂尖團隊的專利,而是向更廣泛的產業界開放。 TuringViT的定位非常明確,是為視覺語言模型(VLM)與視覺語言動作模型(VLA)時代量身打造,全面支援小鵬集團旗下三大核心業務場景:智能駕駛、智能座艙,以及IRON人形機器人。小鵬希望透過這套編碼器,讓不同硬體平台與應用場景都能享受高效、低成本的視覺理解能力,從而加速智慧汽車與機器人產品的落地。 在技術層面,TuringViT從架構、數據、訓練三個維度同步突破,建構了一套以線性注意力機制為主導、高品質數據治理為基礎、原生動態分辨率為特色的技術體系。這套體系在兼顧模型效果的同時,也大幅提升了運算效率與實際部署的可行性,實現了效果、效率與落地性三者的平衡。 在架構設計上,TuringViT推出了兩個規格版本,滿足不同算力與精度需求。TuringViT-18L包含3組Turing Block,合計15層TLA(Turing Linear Attention)加上3層MHA(Multi-Head Attention),主打動態分辨率下的高效部署。而TuringViT-24L則包含4組Turing Block,合計20層TLA加上4層MHA,在維持線性計算主導的前提下,進一步拉昇模型的特徵表徵能力,適合對精度要求更高的場景。 兩個版本的核心共通點在於大量採用線性注意力機制,取代傳統的標準softmax注意力。這項設計直接影響了高分辨率輸入下的運算效率。實測數據顯示,隨著輸入分辨率不斷提高,TuringViT的推理延遲增長曲線遠比標準softmax ViT更為平緩,在高分辨率下展現出顯著的效率優勢。例如在1536×1536的解析度條件下,TuringViT-18L的推理吞吐量達到Seed1基準模型的1.04倍,相比SigLIP2-ViT-L也有約2倍的提升,顯示出在同等算力資源下能夠處理更多畫面細節。 除了架構創新,小鵬在數據層面也提出了新的治理策略。傳統視覺大模型往往需要耗費大量人力與時間,從海量無標註數據中篩選出高品質樣本,再進行人工標註與訓練。TuringViT則透過系統性的數據篩選與清洗流程,讓模型能夠在僅有十分之一的訓練數據規模下,學到同等甚至更強的特徵表達能力。這不僅降低了數據獲取與處理的成本,也縮短了模型迭代的週期。 訓練流程方面,TuringViT也進行了針對性的優化。小鵬團隊透過動態分辨率策略,讓模型在訓練過程中能夠適應不同尺寸的輸入,而不需要事先將圖片統一縮放至固定尺寸。這種原生動態分辨率設計,使得模型在實際應用中能夠更靈活地處理來自不同傳感器或場景的圖像,進一步提升了部署的適應性與穩定性。 從產業意義來看,TuringViT的發布代表視覺Transformer訓練路徑出現了一條可復現、低成本的新選擇。長期以來,視覺大模型的效果高度依賴於巨量數據與算力堆疊,這使得許多中小型開發團隊或企業難以負擔。小鵬試圖透過這套技術體系,將先進視覺能力從「頭部專屬」推向「行業普惠」,讓更多應用場景有機會採用SOTA等級的視覺編碼器。 在智能駕駛領域,車輛需要即時處理來自多個攝影機的高分辨率影像,並從中提取關鍵的道路、車輛、行人等訊息。TuringViT的高效推理能力,能夠在有限車載晶片算力下,實現更快的感知速度與更精準的物體識別,進而提升整體行車安全。在智能座艙場景中,則可應用於車內乘客行為偵測、手勢辨識、情緒分析等,提供更自然的人機互動體驗。 此外,IRON人形機器人作為小鵬長期布局的戰略方向,同樣需要強大的視覺感知能力來理解環境並執行複雜任務。TuringViT的輕量化與高效率特點,使其能夠在機器人有限的嵌入式平台上運行,同時維持高精度的視覺理解,為機器人的自主導航、物體操作與人機協作打下堅實基礎。 小鵬此次發表的TuringViT,不僅是技術層面的突破,更反映出其對未來VLM與VLA時代的戰略布局。隨著大模型逐漸從語言領域擴展至視覺與多模態,視覺編碼器作為底層核心元件,其性能與成本將直接影響上層應用的普及速度。小鵬選擇在這一節點推出系統性重構的視覺編碼器,顯然希望藉此建立技術護城河,並為旗下多條產品線提供統一的視覺感知能力。 目前業界對TuringViT的關注度相當高,後續實際量產車型與機器人產品的搭載表現,將是驗證這套技術是否真正具備普惠價值的關鍵。小鵬表示,TuringViT已完成內部多輪測試,並將逐步導入下一代智能駕駛與機器人平台,預計在不久後即可看到實際應用成果。
Related
相關文章

機器人走錯路了?與蘇度韓錚聊聊具身智能的3D數據、路徑分野與硅谷競賽
這篇消息聚焦「機器人走錯路了?與蘇度韓錚聊聊具身智能的3D數據、路徑分野與硅谷競賽」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

5.83倍加速,PolicyTrim:讓VLA機器人少走彎路、更快完成任務
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

2026WAIC收官,看見物理AI的落地與未來
2026 年世界人工智能大會(WAIC)正式落幕,本屆大會的主軸明確聚焦於「物理 AI」的落地與未來發展。從展場上的各項技術展示可以看出,AI 不再只是停留在虛擬世界的演算法與模型,而是開始大規模進入工廠、街道、家庭等真實物理空間,與機器人、自動駕駛、智慧製造等硬體深度結合,展現出具身智能的實際應用潛力。

WAIC裡不只有AI丨WAIC2026
WAIC裡不只有AI丨WAIC2026Leo張ToB雜談2026.07.21 12:47 · 來自北京全文6302字00:00 / 11:22AI不是孤立的浪潮,而是一場需要全產業鏈協同的系統性演進。這是我們連續第三年參加WAIC這場全球AI盛會。今年最深的一個印象就是,AI已經真正走到生活、生產之中,並改變了絕大部分產業。
宇樹科技發佈UnifoLM-OminiA-0.3,實現人形機器人多任務自主執行
AI資訊AI新閒資訊正文宇樹科技發佈UnifoLM-OminiA-0.3,實現人形機器人多任務自主執行發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘宇樹科技近日發佈人形機器人通用智能模型UnifoLM-OminiA-0.3,該模型支持全模態交互理解,可統籌家居、康養等多場景任務,實現機器人從環境感知、任務理解到自主執行的完整閉環。

機器人能表演幹活了,但行業還需要更多刁鑽的“壞人”
機器人技術的進步讓它們能流暢表演各類工作,從工廠組裝到服務接待皆可勝任,但行業內卻浮現一個關鍵困境:缺乏足夠「刁鑽的壞人」。這些「壞人」並非破壞者,而是對機器人要求極端嚴苛的測試者或客戶;他們擅長設計突發狀況、極端指令或複雜障礙,迫使機器人暴露隱藏短板。目前許多示範看似完美,卻常在真實場景中因小細節失靈,正說明這種挑剔角色的重要性。