小鵬甩出TuringViT視覺編碼器:只用十分之一數據,卻把SOTA基線甩在身後
重點摘要
AI資訊AI新閒資訊正文小鵬甩出TuringViT視覺編碼器:只用十分之一數據,卻把SOTA基線甩在身後發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘視覺大模型長期被一個隱形門檻卡著:想拿到頂尖效果,就得先囤夠天量數據和算力,這讓先進視覺能力成了少數頭部團隊的專屬玩具。
小鵬集團於7月21日正式發布TuringViT高效視覺編碼器,這款產品從架構設計、數據處理範式到訓練流程,進行了系統性的重構,聲稱在僅使用業界十分之一訓練數據量的條件下,即可達到甚至超越當前SOTA基線的表現。這項突破意味著過去長期困擾視覺大模型的「高品質數據與巨量算力門檻」有望被打破,讓先進的視覺能力不再是少數頂尖團隊的專利,而是向更廣泛的產業界開放。TuringViT的定位非常明確,是為視覺語言模型(VLM)與視覺語言動作模型(VLA)時代量身打造,全面支援小鵬集團旗下三大核心業務場景:智能駕駛、智能座艙,以及IRON人形機器人。
小鵬希望透過這套編碼器,讓不同硬體平台與應用場景都能享受高效、低成本的視覺理解能力,從而加速智慧汽車與機器人產品的落地。在技術層面,TuringViT從架構、數據、訓練三個維度同步突破,建構了一套以線性注意力機制為主導、高品質數據治理為基礎、原生動態分辨率為特色的技術體系。這套體系在兼顧模型效果的同時,也大幅提升了運算效率與實際部署的可行性,實現了效果、效率與落地性三者的平衡。在架構設計上,TuringViT推出了兩個規格版本,滿足不同算力與精度需求。
TuringViT-18L包含3組Turing Block,合計15層TLA(Turing Linear Attention)加上3層MHA(Multi-Head Attention),主打動態分辨率下的高效部署。而TuringViT-24L則包含4組Turing Block,合計20層TLA加上4層MHA,在維持線性計算主導的前提下,進一步拉昇模型的特徵表徵能力,適合對精度要求更高的場景。兩個版本的核心共通點在於大量採用線性注意力機制,取代傳統的標準softmax注意力。這項設計直接影響了高分辨率輸入下的運算效率。
實測數據顯示,隨著輸入分辨率不斷提高,TuringViT的推理延遲增長曲線遠比標準softmax ViT更為平緩,在高分辨率下展現出顯著的效率優勢。例如在1536×1536的解析度條件下,TuringViT-18L的推理吞吐量達到Seed1基準模型的1.04倍,相比SigLIP2-ViT-L也有約2倍的提升,顯示出在同等算力資源下能夠處理更多畫面細節。除了架構創新,小鵬在數據層面也提出了新的治理策略。傳統視覺大模型往往需要耗費大量人力與時間,從海量無標註數據中篩選出高品質樣本,再進行人工標註與訓練。
TuringViT則透過系統性的數據篩選與清洗流程,讓模型能夠在僅有十分之一的訓練數據規模下,學到同等甚至更強的特徵表達能力。這不僅降低了數據獲取與處理的成本,也縮短了模型迭代的週期。訓練流程方面,TuringViT也進行了針對性的優化。小鵬團隊透過動態分辨率策略,讓模型在訓練過程中能夠適應不同尺寸的輸入,而不需要事先將圖片統一縮放至固定尺寸。這種原生動態分辨率設計,使得模型在實際應用中能夠更靈活地處理來自不同傳感器或場景的圖像,進一步提升了部署的適應性與穩定性。從產業意義來看,TuringViT的發布代表視覺Transformer訓練路徑出現了一條可復現、低成本的新選擇。
長期以來,視覺大模型的效果高度依賴於巨量數據與算力堆疊,這使得許多中小型開發團隊或企業難以負擔。小鵬試圖透過這套技術體系,將先進視覺能力從「頭部專屬」推向「行業普惠」,讓更多應用場景有機會採用SOTA等級的視覺編碼器。在智能駕駛領域,車輛需要即時處理來自多個攝影機的高分辨率影像,並從中提取關鍵的道路、車輛、行人等訊息。TuringViT的高效推理能力,能夠在有限車載晶片算力下,實現更快的感知速度與更精準的物體識別,進而提升整體行車安全。在智能座艙場景中,則可應用於車內乘客行為偵測、手勢辨識、情緒分析等,提供更自然的人機互動體驗。
此外,IRON人形機器人作為小鵬長期布局的戰略方向,同樣需要強大的視覺感知能力來理解環境並執行複雜任務。TuringViT的輕量化與高效率特點,使其能夠在機器人有限的嵌入式平台上運行,同時維持高精度的視覺理解,為機器人的自主導航、物體操作與人機協作打下堅實基礎。小鵬此次發表的TuringViT,不僅是技術層面的突破,更反映出其對未來VLM與VLA時代的戰略布局。隨著大模型逐漸從語言領域擴展至視覺與多模態,視覺編碼器作為底層核心元件,其性能與成本將直接影響上層應用的普及速度。小鵬選擇在這一節點推出系統性重構的視覺編碼器,顯然希望藉此建立技術護城河,並為旗下多條產品線提供統一的視覺感知能力。
目前業界對TuringViT的關注度相當高,後續實際量產車型與機器人產品的搭載表現,將是驗證這套技術是否真正具備普惠價值的關鍵。小鵬表示,TuringViT已完成內部多輪測試,並將逐步導入下一代智能駕駛與機器人平台,預計在不久後即可看到實際應用成果。
Related
相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”
眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?
宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態
首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了
三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。
宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品
AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。
IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118
進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。