雷峰網生成式AI

賭注十萬億:字節拒絕走蒸餾捷徑背後,張一鳴的長期主義有多狠?

2026年8月7日 15:29

重點摘要

字節跳動創辦人張一鳴在Seed全員會上明確拒絕使用蒸餾捷徑追趕大語言模型,寧可犧牲短期利益也要堅持從頭訓練,導致其Seed 2.1 Pro在全球LLM排行榜僅列第21名,落後於其他中國模型。字節內部曾三次提議蒸餾均被否決,張一鳴認為蒸餾會導致模型坍縮、失去技術主權,並無法對齊自身商業邏輯。字節正計劃訓練參數規模達10萬億的大模型,以規模換時間,跳過中間追趕步驟,直接挑戰下一輪競爭的世界第一梯隊。

站內 AI 整理稿

張一鳴要的是,下一輪競爭中,Seed模型能力躋身世界第一梯隊 作者丨高允毅 編輯丨岑 峰 近日,The Information爆出,在兩週前的 Seed 全員會上,張一鳴罕見發聲,明確拒絕以蒸餾手段追趕前沿大語言模型。他的態度很堅決:“字節跳動應該願意為了長遠目標犧牲一些短期利益。”最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,智譜 GLM 5.2 Max、DeepSeek V4 Flash 分列第七、第八,中國模型已佔據全球前十近半席位。反觀字節 Seed 2.

1 Pro,僅排在第 21 位,遠低於其他中國模型。論錢,字節年利潤規模位居互聯網頭部;論人,Seed 團隊匯聚了搜廣推體系成長起來的頂尖算法人才;論算力,數萬張 GPU 集群的智算中心正在全國鋪開;論數據,抖音與 TikTok 坐擁全球最大的原生內容池。樣樣不缺的字節,為什麼在大模型榜單上追不上?據字節員工透露,公司內部認為,字節不願蒸餾,被認為是其大語言模型落後於中國其他人工智能實驗室的原因之一。01三次被否決的“兵變”蒸餾(Distillation),通俗說就是拿其他大模型的答案來訓練自己的模型,是行業公認的“捷徑”。而在公開報道中,字節內部至少有三次關於是否蒸餾的路線之爭。

第一次衝突是在2025年1月。DeepSeek-R1橫空出世,其推理風格席捲全球。Seed內部就有研究員提議跟進蒸餾,張一鳴拒絕了。他要的是 Seed 像人類一樣“學習如何思考”,而不是學會模仿 R1 的“碎碎念”。第二次衝突是英偉達Blackwell芯片部署後。算力差距拉大,對手拿到了英偉達最新的入場券,字節只能靠 H20 苦撐,蒸餾呼聲再起。但張一鳴再次說不,字節選擇增資2000億,在烏蘭察布和懷來加蓋智算中心。然後是Kimi K3成功躋身全球頂尖模型榜單帶來的壓力。每次國內開源新模型發佈,都是一次壓力測試。內部焦慮達到頂點,但在張一鳴眼裡,榜單是虛的,商業主權是實的。張一鳴每次都頂住了。

據接近Seed的人士透露,內部對開源模型的蒸餾禁令通過API檢測等技術手段硬性執行,早在2023年4月就已明令禁止將GPT生成數據混入訓練集。“字節剛開始也做蒸餾,後來張一鳴痛定思痛,說我們還是要走長遠路。阿里、騰訊、字節這個量級的公司,不能總靠蒸餾別人過日子。” 國內某大廠高管曾對AI科技評論這樣說。大模型的蒸餾可以用“背老師的作業答案”來形容。這條路見效極快。幾百萬條高質量指令數據灌進去,模型在基準測試上的分數能在短短幾周內突飛猛進,快速逼近被蒸餾模型的水平。在大模型競速的早期,幾乎所有玩家都試過這招。但隨著賽道進入深水區,爭議隨之爆發。

2026 年以來,Anthropic 連續公開指責 Minimax、月之暗面、DeepSeek、阿里通義實驗室存在蒸餾其模型的行為,將中國大模型的快速崛起直接歸因於 “抄捷徑”。不過,頗具諷刺意味的是,Anthropic 自身也被曝多次蒸餾 OpenAI 模型、使用盜版書籍數據訓練。真正讓張一鳴堅持 “不抄捷徑” 的,是更深層的技術判斷:在數據見頂、算力匱乏、全球模型 PK 進入白熱化的階段,靠蒸餾永遠只能追在別人身後,甚至會在下一輪智能躍遷中徹底掉隊。02四個工程“死理”:為什麼字節為何不做“蒸餾派”從技術角度而言,字節 Seed 堅持從頭訓練而不做“蒸餾派”,是一套環環相扣的技術演進邏輯。

從頭訓練雖然痛苦,但它是突破天花板的唯一解。▎拒絕合成數據的"近親繁殖"陷阱蒸餾的本質,是用別人模型的輸出當 “標準答案” 來訓練自己的模型。它看起來高效,卻藏著一個不可逆的致命缺陷:模型坍縮。2024 年 7 月,牛津、劍橋等機構的聯合研究登上《Nature》封面,首次系統證實,如果模型反覆用 AI 生成的數據訓練,原始數據分佈中的尾部信息會逐漸消失,最終產生不可逆的能力退化。就像近親繁殖,第一代看起來健康正常,但基因多樣性在快速流失,繁衍幾代後,隱性缺陷會集中爆發。

而ICLR 2025 的 Meta 研究進一步證實,訓練數據中哪怕只摻入千分之一的合成數據,就足以觸發模型坍縮;比例再低,毒性效應依然存在。而且模型參數量越大,在特定閾值下坍縮效應反而會被放大。不是堆參數就能解決問題。為什麼尾部信息這麼重要?真實世界的知識不是均勻分佈的。常見問題、標準回答只佔信息分佈的 “頭部”,而那些罕見的邊緣場景、反常識的提問、方言俚語的微妙語義、小眾領域的專業知識,都藏在分佈的 “長尾” 裡。這些長尾信息,決定了模型處理未知問題的上限,也是真正的智能邊界。AI 生成的 “標準答案”,天生就會抹平這些長尾。

模型輸出的永遠是概率最高的回答,它會自動過濾掉小眾、反常、不確定的內容,只留下最 “正確” 也最平庸的結果。用這樣的數據反覆訓練,模型會變得越來越自信,也越來越狹隘。雖然基準測試分數可能還在漲,但它的 “世界觀” 已經在悄悄坍縮。這就是蒸餾的天花板,你永遠只能逼近別人的能力上限,而且越追,自己的邊界越窄。而字節最大的底氣,恰恰是數據。抖音日均產出超 8000 萬條短視頻,頭條日均推薦內容以億計,海外 TikTok 覆蓋 150 多個國家和地區,這是全球最龐大的原生人類內容池。

從 PB 級的真實視頻、文本、評論、交互數據中清洗降噪,比直接拿來幾百萬條 GPT 生成的乾淨指令難得多,但只有原生真實數據,才能完整保留現實世界的分佈,包括那些奇怪、鮮活、不可預測的長尾。Scaling Law 的本質,是用更多高質量真實數據推高智能的天花板。合成數據只能在已有邊界內做平滑,永遠無法突破邊界。字節選的,是一條自己定義天花板的路。▎拿回詞表裡的技術主權很多人忽略了一個最底層的細節:詞表。詞表是模型的 “眼睛”,它決定了模型把一段文字切分成多少個基礎單元,每個單元對應一個向量表示。用別人的詞表,就等於接受了別人的語言偏好和認知顆粒度。

比如 Llama 的詞表是針對英語優化的,遇到中文成語、網絡熱梗、彈幕縮寫,常常會被拆成四五個零散的單字。這不僅會大幅降低推理效率、拉高成本,更關鍵的是,語義的關聯性被切碎了,模型從輸入層就沒真正理解中文的表達邏輯。更致命的影響在多模態領域。字節 Seed 系列的核心戰場從來不是純文本大模型,而是原生多模態。Seedance 2.0 已經實現原生音畫同步的視頻生成,支持 60 秒 2K 分辨率視頻和 8 種語言的唇形對齊。這種能力的前提,是模型在底層就實現文本、視頻幀、音頻信號的原子級映射:每一個語義單元,都要和對應的視覺、聲學單元在同一個向量空間裡對齊。

如果你蒸餾了別人的模型,你繼承的就是別人的編碼地基。別人怎麼切分視頻 Token,你就得怎麼切分;別人怎麼對齊音文時序,你就得怎麼對齊。後天微調可以改參數、調效果,但改不了底層的 Token 空間和語義框架。不蒸餾,意味著字節可以從零定義規則:視頻幀以什麼粒度做 Token 化最合理、音頻的節奏特徵怎麼編碼進語言模型、多模態信號怎麼做聯合注意力…… 所有底層決策全部握在自己手裡。對要做視頻生成、多模態交互的字節來說,地基的自主權,比短期的文本榜單排名重要得多。

▎硬件限制下的"重工業"內功靠蒸餾做模型,本質是輕量級的 “微創新”:站在別人現成的基座上做微調,幾百張 GPU 跑幾周就能看到效果,見效快、成本低,是很多廠商快速追趕的首選路徑。但字節選的從頭訓練路線,完全是另一套遊戲規則。要從零訓練 200B 以上參數的 MoE 大模型,比拼的從來不是單點算法的優劣,而是整套工程體系的硬實力。這是真正的 AI “重工業”。超大規模預訓練裡,最致命的指標叫MTBF(平均無故障時間)。一次完整的預訓練週期往往長達數月,要調動數萬張 GPU 並行計算。

這期間任何一張顯卡出現內存錯誤、任何一條高速鏈路發生通信閃斷、任何一個算子觸發精度溢出,都可能讓整個訓練任務中斷,甚至導致前期投入的算力成本全部打水漂。集群規模越大,故障發生的概率就越高。我們可以做一個簡單推算:假設單張 GPU 的平均無故障時間是 10 萬小時,那麼由一萬張卡組成的集群,平均每 10 小時就會遭遇一次硬件故障。如果沒有毫秒級的故障檢測、精準的斷點續訓和完備的容錯恢復機制,大規模從頭訓練根本無從談起。對字節來說,這份挑戰還要再上一個量級。

受美國芯片出口管制限制,字節無法採購英偉達最新的 Blackwell 旗艦芯片,只能使用性能受限的 H20 芯片,單卡訓練效率與海外頂尖平臺差距顯著。別人靠更強的單卡性能就能撐起訓練效率,字節要追上差距,只能靠更大的集群規模、更高的資源利用率和更極致的工程優化來補。這種先天限制,反而倒逼字節把基礎設施能力推到了行業極限。公開信息顯示,字節的訓練集群已佈局內蒙古烏蘭察布、山西大同、河北懷來、張北、安徽蕪湖等多個智算中心,搭建起數萬張卡規模的分佈式算力網絡。

2026 年字節 AI 基礎設施資本開支已上調至超 2000 億元,公司淨利潤同比出現明顯下滑,核心原因正是三四季度算力採購與數據中心建設的集中投入。張一鳴本人也將一半精力傾注在 Seed 團隊。這筆千億級的資金投入,加上創始人級別的注意力傾斜,押注的從來不只是某一個模型的效果,而是一整套能穩定支撐超大規模訓練的全棧工程體系:從底層算子優化、集群通信調度,到訓練故障恢復、算力資源管理,全部自主研發。這套能穩穩撐起 “萬億參數從零訓練” 的訓練框架與基建能力,才是字節真正的技術護城河。走蒸餾路線的廠商,永遠不需要攻克萬卡級穩定訓練的工程難題,自然也沉澱不下這套重工業級的系統能力。

當 Scaling Law 繼續向前演進,模型參數規模持續攀升時,競爭的門檻會從算法轉向工程。到那時,只有手握完整基建能力的玩家,才有資格留在牌桌上。▎獎勵模型的 “靈魂歸屬”:學答案,永遠學不會思維蒸餾學的是 “答案”,從頭訓練學的是 “思維”。用別人模型的輸出訓練,你的模型學到的是對方的輸出分佈,包括說話的語氣、回答的套路、甚至 RLHF 階段被注入的價值觀偏好。它知道什麼問題該說什麼話,但不知道為什麼這麼說;它模仿得了結果,模仿不了背後的推理鏈路。更關鍵的是,模型的 “靈魂” 會打上別人的烙印。什麼是好回答、什麼該拒絕、什麼場景用什麼風格,這些底層偏好,在蒸餾過程中會被一併繼承過來。

後續你再做 RLHF、再調獎勵模型,也只是在別人的地基上做裝修,很難從根本上改變模型的行為模式。而字節需要的,是完全對齊自身業務邏輯的獎勵模型。抖音的推薦講完播率和互動率,電商講點擊到購買的轉化效率,短視頻內容講節奏感和視覺衝擊力,這些獨特的商業邏輯,必須深度植入 Reward Model,讓模型在 RLHF 階段就和字節系產品的目標對齊。如果你蒸餾了GPT-4,模型的"靈魂"裡刻著OpenAI的偏好邏輯。你在後訓練階段再怎麼調,也是在別人的地基上裝修。只有從頭訓練,從預訓練到RLHF全鏈路自主,字節才能讓模型真正對齊到自己那套極致的商業邏輯中。這不僅關乎效果,更關乎可控性。

03字節的底牌:10萬億參數大模型拒絕了捷徑,字節的追趕路徑是什麼?答案正在浮出水面。據《金融時報》報道,字節跳動正在討論訓練一個參數規模10萬億的大模型,顯著超過阿里 Qwen 3.8-Max 的 2.4 萬億參數和月之暗面 K3 的 2.8 萬億參數,是目前國內已知參數規模最大的模型計劃。該項目仍處於早期探索階段,由 Seed Foundation 負責人項亮主導,與預訓練數據負責人沈科協同推進,最終是否正式發佈尚未確定。這是一個非常 “字節” 的選擇:與其在同尺寸參數上苦苦追趕,不如直接把規模拉到同行的數倍,用一次量級躍遷爭取領先位置。

Scaling Law 依然是當前大模型最可靠的進階路徑。在數據質量、訓練效率達標的前提下,參數規模的提升會帶來可預測的能力增長。當主流玩家還在 2-3 萬億參數區間內卷時,字節直接衝擊10萬億,本質是用規模換時間,用更大的投入,跳過中間的追趕步驟,直接摸到下一個梯隊的門檻。但這同樣是一場豪賭。參數規模翻倍,訓練難度不是線性增長,而是指數級上升。數據供給、算力穩定性、對齊難度、推理成本,每一項都是巨大的挑戰。2000 億資本開支、70% 的利潤下滑、創始人一半的精力,所有籌碼都壓在了這條 “更慢更難”的路上。這條路的價值,不止於技術本身。

當 DeepSeek 被 OpenAI 正式指控蒸餾,當美國立法將模型數據竊取納入國家安全範疇,字節的選擇突然有了提前避險的戰略意味。全鏈路自研的模型,沒有知識產權爭議,沒有合規包袱,無論是全球化佈局還是長期技術競爭,都站在更安全的位置。未來 3 年,大模型的技術範式窗口期正在急劇收窄。頭部玩家今天的技術路線選擇,會決定未來十年甚至更久的競爭格局。蒸餾的誘惑在於確定性:你知道終點在哪裡,知道怎麼走最快,投入產出清晰可見。但它的代價,是永遠失去定義終點的資格。張一鳴在會議上,明確望大家以追求智能上限為目標,期待Seed 模型能力能躋身世界第一梯隊。

技術主權,真正參與定義智能上限的機會,正是這條更難走的路的回報。參考鏈接: https://www.theinformation.com/articles/bytedances-founder-rules-distillation-ai-models?rc=gznj9j上車,雷峰網帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

56 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

57 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前