小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式

重點摘要
首頁 > 智能時代>人工智能 小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式 2026/7/21 12:23:59 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 21 日消息,小鵬集團今日發佈 TuringViT 高效視覺編碼器,面向 VLM / VLA 時代系統性重構視覺編碼器的架構設計、數據範式與訓練流程。小鵬集團表示,TuringViT 將全面支撐智能駕駛、智能座艙、IRON 人形機器人三大業務場景,同時為行業提供了一條可復現、低成本訓練 SOTA 級(State-of-the-Art,最新技術水平)視覺 Transformer 的技術路徑,推動先進視覺大模型從“頭部團隊專屬”走向“行業普惠”。▲ TuringViT 的塊架構和模型配置據介紹,TuringViT 從架構、數據、訓練三個維度同步突破,打造了“線性注意力主導 + 高質量數據治理 + 原生動態分辨率”的完整技術體系,實現了效果、效率與落地性的三重提升。TuringViT 共推出兩個規格版本:TuringViT-18L 包含 3 組 Turing Block(共 15 層 TLA+3 層 MHA),主打動態分辨率下的高效部署;TuringViT-24L 包含 4 組 Turing Block(共 20 層 TLA+4 層 MHA),在保持線性計算主導的前提下進一步提升表徵能力。實測數據顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠平緩於標準 softmax ViT,高分辨率下的效率優勢愈發顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時序視頻處理的端側部署掃清了核心障礙。不同於行業“堆數據規模”
首頁 > 智能時代>人工智能 小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式 2026/7/21 12:23:59 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 21 日消息,小鵬集團今日發佈 TuringViT 高效視覺編碼器,面向 VLM / VLA 時代系統性重構視覺編碼器的架構設計、數據範式與訓練流程。
小鵬集團表示,TuringViT 將全面支撐智能駕駛、智能座艙、IRON 人形機器人三大業務場景,同時為行業提供了一條可復現、低成本訓練 SOTA 級(State-of-the-Art,最新技術水平)視覺 Transformer 的技術路徑,推動先進視覺大模型從“頭部團隊專屬”走向“行業普惠”。▲ TuringViT 的塊架構和模型配置據介紹,TuringViT 從架構、數據、訓練三個維度同步突破,打造了“線性注意力主導 + 高質量數據治理 + 原生動態分辨率”的完整技術體系,實現了效果、效率與落地性的三重提升。
TuringViT 共推出兩個規格版本:TuringViT-18L 包含 3 組 Turing Block(共 15 層 TLA+3 層 MHA),主打動態分辨率下的高效部署;TuringViT-24L 包含 4 組 Turing Block(共 20 層 TLA+4 層 MHA),在保持線性計算主導的前提下進一步提升表徵能力。實測數據顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠平緩於標準 softmax ViT,高分辨率下的效率優勢愈發顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達到 Seed1.5-ViT 的 3.
04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時序視頻處理的端側部署掃清了核心障礙。不同於行業“堆數據規模”的粗放路線,TuringViT 打造了 VISTA-Curation 多模態數據治理流水線,通過提升單樣本的監督價值實現數據效率的量級提升,從“用更多數據”轉向“用更優質的監督”。
針對圖文數據,流水線通過三步精細化篩選實現質量升級:第一步過濾低分辨率、模糊、低紋理的低質量圖片;第二步通過多模型、多提示詞生成多樣化候選字幕,並交叉驗證視覺一致性;第三步在統一對比池中通過相對圖文對齊度、文本信息量、歧義度綜合打分,篩選出視覺貼合度高、語義信息密度高的優質標註,淘汰模糊、泛化、弱對齊的樣本。
▲ 圖像-文本篩選及處理流程針對視頻數據,流水線同樣進行全流程治理:先將長視頻切分為連續短片段並均勻採樣代表幀;再通過語義一致性與運動一致性雙重過濾,保留語義連貫、變化信息有效的片段;最後融合局部幀級細節字幕與全局時序語義字幕,生成具備變換感知能力的視頻標註,讓模型從連續畫面中學習更魯棒的視覺表徵。▲ 視頻-語義篩選及處理流程最終,TuringViT 僅用 0.85B 圖文對(約為 SigLIP2-L 訓練數據規模的 10%),便在 ImageNet-1K 等六項零樣本分類基準上取得 83.
6% 的平均準確率,超越使用 10B 數據訓練的主流開源基線;在 COCO、Flickr30K 圖文檢索任務上同樣優勢顯著,真正實現了“十分之一數據,更優效果”的突破。TuringViT 還採用四階段漸進式原生動態分辨率訓練範式,從預訓練之初就適配下游 VLM / VLA 的輸入特性,告別“固定分辨率預訓練 + 事後適配”的傳統模式。在智能駕駛領域,TuringViT 是第二代 VLA 模型的核心視覺編碼器,負責處理多路環視攝像頭的高分辨率、多幀動態道路場景輸入,為預測式世界模型提供視覺 token。
面向智能座艙與駕泊一體化場景,TuringViT 的 VLM 原生特性讓視覺特徵與語言模型實現更高效的對齊,可以提供更高的識別精度、不同畫幅和比例的視覺輸入,以支撐更多未來的車輛與用戶交互的豐富座艙功能。在小鵬 IRON 人形機器人的技術體系中,TuringViT 充當著“視覺視網膜”的核心角色,為具身智能提供物體細粒度識別、空間關係理解、可操作區域檢測、動態環境追蹤等基礎感知能力。IT之家附 TuringViT 項目主頁如下:https://turingvit.github.
io/廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。
投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:小鵬,視覺大模型,TuringViT消息稱小鵬汽車 AI Infra 負責人陸思淵將離職,下一站是 OpenAI小鵬汽車:MONA L03 帶動全系車型試駕量創歷史新高小鵬汽車:第二代 VLA 模型實現同一套模型打通中國與歐洲,目標 2027 年逐步向海外用戶交付何小鵬稱小鵬與比亞迪是不同的出海模式,希望在歐洲做成中高端品牌小鵬 MONA L03 新車“戰績”刷新,上市 1 小時大定 46859 臺小鵬 MONA L03 新車上市 7 分鐘大定突破 2 萬臺,12.38 萬元起
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。