BAT 集體重做「AI 預訓練」,補「髒數據」的坑
最近大半年,國內一批 AI 模型廠商密集啟動“預訓練返工”,起因都指向同一件事:數據不行。它們中,有的此前花了一年死磕萬億參數模型,落地表現卻被市面上 1% 規模的小模型倒掛,最終查出是被髒數據拖了後腿。有的曾因數據標註規則模糊、評測集汙染、垃圾語料冗餘等工程硬傷而導致模型進展遲緩。還有的因數據受限,導致模型遭遇性能瓶頸,索性推倒重來,並重建了數據團隊。與此同時,借 API 中轉站截留交互軌跡、做數據蒸餾等,也成了行業水面下的一場暗戰。數據,正在給模型廠商上一堂教訓深刻的課。這堂課遠比算力消耗、架構選型和人才爭奪更隱蔽。
“AI 下半場的勝負手是數據”,這話聽上去像常識,但直到今天,大家才真正聞到了它背後的血腥味。01數據上的“粗放式彎路”預訓練返工,本質上是在補數據的課。“多就行了”的誤區一位頭部基模公司的數據專家趙翔向回憶,前些年剛開始做預訓練的時候,大家的主流觀點是“數據多就可以了,稍微差一點沒關係,模型自己有轉化能力和魯棒性。”於是開始一味地粗放式堆數據,只求規模不講質量。再加上,當時行業普遍缺乏成熟的大規模數據治理體系,大家為了湊齊數千億甚至上萬億 token 的語料庫,抓取了大量網頁垃圾、髒語料,甚至混入了各種來源不明的清洗包。很多數據的標註和篩選也沒有處理好,導致訓練出來的第一版模型效果較差。
然後大家才發現,不注重數據質量,會讓模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”於是不得不回過頭來重做數據優化。髒數據的代價“底層髒數據的危害遠比想象的大。它會讓你投入的卡、錢、人力都浪費掉,而且還會耽誤你的時間窗口。”某模型廠商前高管、現 AI 創業者王斌告訴。他向描述過一個典型案例。一家中部基模公司,把爬來的技術博客整批灌進預訓練語料,跑到訓練中期才發現,其中相當部分是採集站的機器生成頁,同一個段落被重複了幾萬次。模型在評測集上開始莫名其妙地復讀,等團隊定位到問題,幾萬卡時已經燒掉了,那一版只能作廢重來。事實上,這樣的翻車在行業裡遠不止一例。
不少團隊都是訓練效果出了問題後,才回過頭來補數據治理的課。不當的數據 KPI基元律動創始人王雲鶴也曾在接受媒體採訪時提到過,AI 沒有什麼新鮮事,數據是地基,數據不行,不要怪算力;數據不達標,什麼算法都不行,因為這違背機器學習理論。而且他還特別提到一點,數據團隊要對預訓練團隊有一定話語權,預訓練團隊也要反向對數據提要求。獨立考核會很亂。其實,對數據團隊的考核不當,是不少模型廠商都踩過的一個坑。
比如,有媒體曾描述過,騰訊混元團隊曾在數據治理上,出現過“標註規則定義不清,但驗收線設定過高,團隊為了交差,生產出大批無法使用的數據”的情況;再加上一些打榜數據、冗餘數據的汙染,以至於最後不得不推倒重來,專門重拉團隊從頭清洗數據。“數據團隊的考核只看數據量的話,會很荒謬。”前述數據專家趙翔補充道。因為大模型拼的是數據的信息密度和乾淨程度,而非絕對體積。考核只盯數量,等於在鼓勵團隊拿垃圾湊數。幾百 T 的髒數據灌進去,訓出來的模型反而會變笨,甚至訓練崩潰。02數據背後的“苦活”與“花活”地基要重打,可好數據並不是說有就有的。
互聯網時代攢的家底,不頂用了本地生活、社交、遊戲、電商與搜索,這些在互聯網時代被各家大廠視作“壁壘”的場景數據,到了 AI 時代,不奏效了。因為基模比的是通用能力,某一場景數據的優勢,落到通用能力上,影響變得有限。各家雖然都在拿自己的場景數據訓一些垂直小模型,但最終應用面沒那麼廣。“按理說 Google 各類場景數據最多,應該做得最好,但顯然並不是。Anthropic、OpenAI 這類此前在數據上零積累的廠商反而衝得更猛,國內亦然。”一位基模公司的算法負責人徐棟告訴。大家站到了同一起跑線。
這時候,能拉開差距的是:卡夠不夠,數據拿得快不快,質量夠不夠高,以及有沒有一條能把數據穩定轉化成模型能力的管線。沒有秘方,只有苦活那麼,數據優化到底有沒有捷徑?前述數據專家趙翔向坦言,技巧秘方其實不多。數據工作更偏苦活累活,重要的是持續做下去,投入足夠的人力和定力,把原來 60 分的數據,逐步優化到 90 分,爭取每次優化之後都能拿到一點正反饋。這時候要算兩本賬:一是優化成本,二是訓練週期。“網上那麼多數據,不可能每條都校驗一遍。訓練又有周期,不能等數據全部優化完再開訓。所以要先挑重要的做,分期做,小步快跑,不斷迭代。”趙翔補充道。不過,需要說明的是,數據的難題並不只出在預訓練。
後訓練要的專家數據、Agent 長程軌跡數據,獲取難度和成本也都不低。卡住數據優化的:錢與產能多位 AI 數據從業者告訴,眼下卡住各家數據工作的,主要有兩個因素:錢和產能。一個反直覺的地方在於:大廠看起來都不差錢,但預算拆開,分攤到數據上的其實並不多。“數據在模型廠商的訓練預算裡佔比並不大。業內流傳的一個粗略拆解是:每投 100 塊錢在 AI 訓練上,其中 40 塊花在算力上,30 塊花在人才上,20 塊花在打廣告上,剩下 10 塊錢花在數據上。”某 AI 數據供應商業務負責人周駿表示。
以專家數據為例,周駿告訴,專家的長程任務數據需求量極大,幾家大廠的預算口徑基本都是幾個億,但真到付款時,就比較摳搜。“同樣的專家數據,美國 HLE 調研一條起價一兩萬美金,國內基本只給開一兩千人民幣。”然而,比預算更卡人的,是產能。高質量數據從來都是稀缺的。正規渠道供不夠,各家就開始自找門路。周駿告訴,某些模型廠商會隱蔽地做中轉站生意,做 Token 轉發。一方面有收益,但更重要的是,可以藉此收集大量用戶行為數據。用戶調用各種先進模型時,請求和結果都要從這家廠商的轉發層走一遍,於是真實的任務數據就被留在了平臺上,這比公開爬來的語料更接近訓練想要的有效樣本。
眼下還有一批做 Routing(模型路由)的創業公司,也在盯著“數據”這塊資產;而各家大廠也有類似的路由平臺,但由於優先接自家模型,很難沉澱到其他先進模型的軌跡數據,而且由於模型接入不夠全面,平臺本身用戶量也有限。“這幾年,各家在獲取AI數據上可謂八仙過海,但這些門路能讓一家公司領先多久,並不好說。”周駿補充道。03飛輪還沒轉起來業內有一種聲音認為,大模型本身沒有護城河,真正的護城河更多在於“數據飛輪”:模型越強,越多用戶願意拿它處理高難度任務,迴流的高質量數據就越多,這些數據再喂回去,模型又強出一截。這套邏輯聽上去閉環。但到今天為止,真正把“數據飛輪”轉起來的沒幾家。
除了前面提到的“預算受限”、“外部高質量數據獲取難”外,還有一層原因在公司內部。大廠自己的AI產品每天都在產生用戶行為,可這些數據能不能規模化地回到訓練環節,取決於中間那條通路有沒有修好。眼下這條通路有三處堵點。一處是組織調整還在持續進行中,各部門之間數據牆的破除還在艱難推進中;另一處是數據類人才的匱乏。多位 AI 獵頭告訴,目前市場上比較缺數據清洗、數據管道搭建、數據工程、數據研究等崗位。這些崗位過去被劃在輔助工種裡,行情真正起來,也是最近的事。此外,更重要的是,國內模型廠商還面臨內生數據匱乏的問題。
眼下,長程軌跡數據主要出自 AI Coding 和 AI 辦公這兩個場景:但前者市場份額的一大塊被海外模型 Claude、Codex 佔去;後者的產品能力目前處於初級階段,所能覆蓋的工作場景與複雜度有限,沉澱下來的軌跡數據還較為單薄。04沒有捷徑的長期戰爭回到開頭那句話:“AI 下半場的勝負手是數據”。這話大體沒錯,但大家可能低估了這場仗的週期和複雜度。預訓練返工只是第一波陣痛。數據治理、數據獲取、數據飛輪,每一塊都是硬骨頭。算力可以買,人才可以挖,但高質量數據的積累沒有捷徑,它需要時間、定力和組織層面的系統性投入。多位業內人士向坦言,未來一兩年內,行業很可能還會看到更多“推倒重來”的案例。
這不是某一家的問題,而是整個行業都在補課。真正的分野,大概要等到這輪數據基建基本完成後,才能看得更清楚。誰能先把那條從用戶行為到模型訓練的數據通路修通,誰就有機會在下一階段跑出來。但至少從目前看,這條路的終點還遠得很。後續將持續推出 AI 數據相關的深度觀察。對這一話題感興趣、或想聊聊業內實況的朋友,歡迎添加下方作者交流、探討。* 文中受訪者趙翔、王斌、徐棟、周駿均為化名。▼推薦閱讀▼AI人才3次大遷徙:百度先行、六小虎分化、騰訊「騰籠換鳥」2026-08-25獨家丨從飛書火山整合,看阿里「雲釘一體」踩過的坑2026-08-05
Related
相關文章

海信新一代性能旗艦E7S Pro+正式發佈,原生真彩再進階
海信發表新一代性能旗艦E7S Pro+,覆蓋75、85及100吋三種尺寸,主打原生真彩RGB-Mini LED技術,並全球首發杜比視界第二代MAX,最高可達XDR Pro 6000nits亮度。新機搭載首個家庭智能伴侶級AIOS「JUOS」,支援51維畫質調校與專屬內容模式,強調從顯示技術到AI交互的完整旗艦體驗。100吋版本零售價21,499元,國補後19,999元。
Meta發佈首款無攝像頭AI眼鏡及第三代Ray-Ban Meta,全系接入AI助手Muse
此次發佈標誌著Meta以更細分的產品線應對智能眼鏡長期以來的隱私爭議,並藉此向蘋果AirPods等主流音頻設備發起直接挑戰。為解決前代產品因非自願錄製視頻而引發的“變態眼鏡”爭議,由EssilorLuxottica操刀設計、定價349美元起的Ray-Ban Meta Audio徹底捨棄了視覺模塊。
Meta發佈首款無攝像頭AI眼鏡及第三代Ray-Ban Meta,全系接入AI助手Muse
此次發佈標誌著Meta以更細分的產品線應對智能眼鏡長期以來的隱私爭議,並藉此向蘋果AirPods等主流音頻設備發起直接挑戰。為解決前代產品因非自願錄製視頻而引發的“變態眼鏡”爭議,由EssilorLuxottica操刀設計、定價349美元起的Ray-Ban Meta Audio徹底捨棄了視覺模塊。
為了智能體AI,高通「新造」了第六代驍龍8超級至尊版
“我們正在從以手機為中心的模式,轉向以智能體為中心的新體驗。手機、PC、眼鏡、可穿戴設備以及汽車,都將成為智能體的終端入口。”2026驍龍峰會上,高通公司總裁兼CEO安蒙說。過去二十年,智能手機圍繞App運轉。智能體則需要持續感知、理解上下文、調用工具,並在用戶沒有操作手機時代表用戶執行任務。“這是一次令人興奮的技術變革,智能體AI會創造一種全新的終端工作流程。”安蒙表示,“我們需要重新思考計算引擎的設計。

企業數據太多,AI知道得太少:千問辦公的上下文生意
TechPulse2026.09.23 19:34 · 來自浙江全文2432字00:00 / 07:01一家中大型企業內部的數據規模平均約為150PB,而目前最強模型的上下文窗口多為 100 萬token左右。AI辦公之爭的下一個基點,是上下文。
NVIDIA 發布 Nemotron 3 Diarization:1 億參數開放權重模型,即時分辨 8 位說話者
NVIDIA 在 Hugging Face 上發布了 Nemotron 3 Diarization,這是一個開放權重的說話者分離(diarization)模型,能回答任何對話中的一個關鍵問題:誰在何時說話。這個 1 億參數的模型可追蹤最多 8 位說話者,包括聲音重疊的情況。單一檢查點即可同時處理離線錄音與即時串流。它是否可部署?是的,權重以 OpenMDW License 1.1 發布,允許商業使用。透過 NVIDIA NeMo 在 Linux 上運行,支援 Ampere、Ada Lovelace、Hopper 或 Blackwell GPU。為何需要說話者分離?自動語音辨識(ASR)能提供文字,但無法告訴你誰說了這些話。若缺乏說話者歸屬,摘要系統就無法分辨誰做出承諾、誰提出異議。說話者分離則輸出每個說話者活躍的時間區間。