小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式

重點摘要
首頁 > 智能時代>人工智能 小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式 2026/7/21 12:23:59 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 21 日消息,小鵬集團今日發佈 TuringViT 高效視覺編碼器,面向 VLM / VLA 時代系統性重構視覺編碼器的架構設計、數據範式與訓練流程。小鵬集團表示,TuringViT 將全面支撐智能駕駛、智能座艙、IRON 人形機器人三大業務場景,同時為行業提供了一條可復現、低成本訓練 SOTA 級(State-of-the-Art,最新技術水平)視覺 Transformer 的技術路徑,推動先進視覺大模型從“頭部團隊專屬”走向“行業普惠”。▲ TuringViT 的塊架構和模型配置據介紹,TuringViT 從架構、數據、訓練三個維度同步突破,打造了“線性注意力主導 + 高質量數據治理 + 原生動態分辨率”的完整技術體系,實現了效果、效率與落地性的三重提升。TuringViT 共推出兩個規格版本:TuringViT-18L 包含 3 組 Turing Block(共 15 層 TLA+3 層 MHA),主打動態分辨率下的高效部署;TuringViT-24L 包含 4 組 Turing Block(共 20 層 TLA+4 層 MHA),在保持線性計算主導的前提下進一步提升表徵能力。實測數據顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠平緩於標準 softmax ViT,高分辨率下的效率優勢愈發顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時序視頻處理的端側部署掃清了核心障礙。不同於行業“堆數據規模”
首頁 > 智能時代>人工智能 小鵬集團發佈 TuringViT,宣稱重構視覺大模型訓練範式 2026/7/21 12:23:59 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 21 日消息,小鵬集團今日發佈 TuringViT 高效視覺編碼器,面向 VLM / VLA 時代系統性重構視覺編碼器的架構設計、數據範式與訓練流程。小鵬集團表示,TuringViT 將全面支撐智能駕駛、智能座艙、IRON 人形機器人三大業務場景,同時為行業提供了一條可復現、低成本訓練 SOTA 級(State-of-the-Art,最新技術水平)視覺 Transformer 的技術路徑,推動先進視覺大模型從“頭部團隊專屬”走向“行業普惠”。▲ TuringViT 的塊架構和模型配置據介紹,TuringViT 從架構、數據、訓練三個維度同步突破,打造了“線性注意力主導 + 高質量數據治理 + 原生動態分辨率”的完整技術體系,實現了效果、效率與落地性的三重提升。TuringViT 共推出兩個規格版本:TuringViT-18L 包含 3 組 Turing Block(共 15 層 TLA+3 層 MHA),主打動態分辨率下的高效部署;TuringViT-24L 包含 4 組 Turing Block(共 20 層 TLA+4 層 MHA),在保持線性計算主導的前提下進一步提升表徵能力。實測數據顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠平緩於標準 softmax ViT,高分辨率下的效率優勢愈發顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時序視頻處理的端側部署掃清了核心障礙。不同於行業“堆數據規模”的粗放路線,TuringViT 打造了 VISTA-Curation 多模態數據治理流水線,通過提升單樣本的監督價值實現數據效率的量級提升,從“用更多數據”轉向“用更優質的監督”。針對圖文數據,流水線通過三步精細化篩選實現質量升級:第一步過濾低分辨率、模糊、低紋理的低質量圖片;第二步通過多模型、多提示詞生成多樣化候選字幕,並交叉驗證視覺一致性;第三步在統一對比池中通過相對圖文對齊度、文本信息量、歧義度綜合打分,篩選出視覺貼合度高、語義信息密度高的優質標註,淘汰模糊、泛化、弱對齊的樣本。▲ 圖像-文本篩選及處理流程針對視頻數據,流水線同樣進行全流程治理:先將長視頻切分為連續短片段並均勻採樣代表幀;再通過語義一致性與運動一致性雙重過濾,保留語義連貫、變化信息有效的片段;最後融合局部幀級細節字幕與全局時序語義字幕,生成具備變換感知能力的視頻標註,讓模型從連續畫面中學習更魯棒的視覺表徵。▲ 視頻-語義篩選及處理流程最終,TuringViT 僅用 0.85B 圖文對(約為 SigLIP2-L 訓練數據規模的 10%),便在 ImageNet-1K 等六項零樣本分類基準上取得 83.6% 的平均準確率,超越使用 10B 數據訓練的主流開源基線;在 COCO、Flickr30K 圖文檢索任務上同樣優勢顯著,真正實現了“十分之一數據,更優效果”的突破。TuringViT 還採用四階段漸進式原生動態分辨率訓練範式,從預訓練之初就適配下游 VLM / VLA 的輸入特性,告別“固定分辨率預訓練 + 事後適配”的傳統模式。在智能駕駛領域,TuringViT 是第二代 VLA 模型的核心視覺編碼器,負責處理多路環視攝像頭的高分辨率、多幀動態道路場景輸入,為預測式世界模型提供視覺 token。面向智能座艙與駕泊一體化場景,TuringViT 的 VLM 原生特性讓視覺特徵與語言模型實現更高效的對齊,可以提供更高的識別精度、不同畫幅和比例的視覺輸入,以支撐更多未來的車輛與用戶交互的豐富座艙功能。在小鵬 IRON 人形機器人的技術體系中,TuringViT 充當著“視覺視網膜”的核心角色,為具身智能提供物體細粒度識別、空間關係理解、可操作區域檢測、動態環境追蹤等基礎感知能力。IT之家附 TuringViT 項目主頁如下:https://turingvit.github.io/廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:小鵬,視覺大模型,TuringViT消息稱小鵬汽車 AI Infra 負責人陸思淵將離職,下一站是 OpenAI小鵬汽車:MONA L03 帶動全系車型試駕量創歷史新高小鵬汽車:第二代 VLA 模型實現同一套模型打通中國與歐洲,目標 2027 年逐步向海外用戶交付何小鵬稱小鵬與比亞迪是不同的出海模式,希望在歐洲做成中高端品牌小鵬 MONA L03 新車“戰績”刷新,上市 1 小時大定 46859 臺小鵬 MONA L03 新車上市 7 分鐘大定突破 2 萬臺,12.38 萬元起
Related
相關文章

Google要把AI大模型「刻」進芯片裡
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道安徽最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作Google要把AI大模型「刻」進芯片裡愛範兒·2026年07月21日 20:00大模型芯片,要把大模型「刻」到芯片上。 經歷了一輪人才流失和產品延期之後,Google 一項最早要到 2028 年才見分曉的秘密計劃浮出水面。 據 The Information 援引直接知情人士報道,Google 正在開發一款代號 Frozen v2 的服務器芯片,專門為 Gemini 服務。參與項目的員工稱,按每瓦可生成的 token 數計算,它的能效可能達到 Google 最新 TPU 的 6—10 倍。 Frozen 這個名字,正來自這個設想:把 Gemini 的部分結構永久「刻」進芯片。 大模型芯片,要把大模型「刻」到芯片上 要理解 Frozen v2,得先回到傳統芯片是怎麼工作的。 1945 年,賓夕法尼亞大學莫爾學院開始設計 EDVAC,即電子離散變量自動計算機。它是早期存儲程序計算機的代表。在那之前,電子計算機想改一道程序,往往要重新連接插線、撥動開關,經歷一整套繁瑣操作。 數學家約翰·馮·諾依曼當時是項目顧問,他在團隊討論的基礎上寫下《First Draft of a Report on the EDVAC》,系統描

AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型硅基觀察Pro·2026年07月21日 20:00大模型吞不下應用層 過去一段時間,絕大部分AI應用創業者最焦慮的問題就是:大模型會不會把應用全吃了? 今年以來,OpenAI、Anthropic 持續推出法律、設計、辦公全套垂直套件,微軟依託 Office 生態捆綁 Copilot,不斷向企業滲透。 越來越多人開始相信,只要底層模型持續進化,今天所有AI應用,不過都是等待被官方”內置”的功能。 但就在不久前,曾打造上市安全巨頭Rubrik、如今執掌70億美金企業AI獨角獸Glean的創始人Arvind Jain,做客全球頭部創投播客《20VC》,給出了一個犀利的判斷: OpenAI和Anthropic贏不了真正的應用層企業。原因很簡單,通用模型能解決“標準化生產”,卻永遠無法替代應用公司對垂直業務的深度理解。 更重要的是,前沿閉源大模型的本身也在失去吸引力。目前90%以上企業場景,開源模型已經能完全承接需求。 以下是專訪的內容: 企業開始“不信任”前沿模型了 Palantir CEO Alex Karp7月初在CNBC拋出一個判斷:大型企業對前沿模型廠

WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”
在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

印奇的手機,階躍星辰的賭局
根據鈦媒體的報導,印奇的手機業務與階躍星辰的賭局成為近期科技圈的討論焦點。印奇作為曠視科技的創始人,其跨足手機領域的動作引發市場關注;而階躍星辰則被報導描述為在一場AI技術的賭局中下注。報導聚焦於兩者之間的戰略關聯與市場風險,但目前僅能從標題中窺見其核心方向,具體的產品細節、合作夥伴及定價策略等資訊尚未完整揭露。

在下一個模型發佈之前
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

WAIC重磅成果|上海儀電智算牽頭成立“智算系統架構聯盟”併發布《超節點系統架構規範》
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.