賭注十萬億:字節拒絕走蒸餾捷徑背後,張一鳴的長期主義有多狠?
張一鳴要的是,下一輪競爭中,Seed模型能力躋身世界第一梯隊 作者丨高允毅 編輯丨岑 峰 近日,The Information爆出,在兩週前的 Seed 全員會上,張一鳴罕見發聲,明確拒絕以蒸餾手段追趕前沿大語言模型。他的態度很堅決:“字節跳動應該願意為了長遠目標犧牲一些短期利益。”最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,智譜 GLM 5.2 Max、DeepSeek V4 Flash 分列第七、第八,中國模型已佔據全球前十近半席位。反觀字節 Seed 2.
1 Pro,僅排在第 21 位,遠低於其他中國模型。論錢,字節年利潤規模位居互聯網頭部;論人,Seed 團隊匯聚了搜廣推體系成長起來的頂尖算法人才;論算力,數萬張 GPU 集群的智算中心正在全國鋪開;論數據,抖音與 TikTok 坐擁全球最大的原生內容池。樣樣不缺的字節,為什麼在大模型榜單上追不上?據字節員工透露,公司內部認為,字節不願蒸餾,被認為是其大語言模型落後於中國其他人工智能實驗室的原因之一。01三次被否決的“兵變”蒸餾(Distillation),通俗說就是拿其他大模型的答案來訓練自己的模型,是行業公認的“捷徑”。而在公開報道中,字節內部至少有三次關於是否蒸餾的路線之爭。
第一次衝突是在2025年1月。DeepSeek-R1橫空出世,其推理風格席捲全球。Seed內部就有研究員提議跟進蒸餾,張一鳴拒絕了。他要的是 Seed 像人類一樣“學習如何思考”,而不是學會模仿 R1 的“碎碎念”。第二次衝突是英偉達Blackwell芯片部署後。算力差距拉大,對手拿到了英偉達最新的入場券,字節只能靠 H20 苦撐,蒸餾呼聲再起。但張一鳴再次說不,字節選擇增資2000億,在烏蘭察布和懷來加蓋智算中心。然後是Kimi K3成功躋身全球頂尖模型榜單帶來的壓力。每次國內開源新模型發佈,都是一次壓力測試。內部焦慮達到頂點,但在張一鳴眼裡,榜單是虛的,商業主權是實的。張一鳴每次都頂住了。
據接近Seed的人士透露,內部對開源模型的蒸餾禁令通過API檢測等技術手段硬性執行,早在2023年4月就已明令禁止將GPT生成數據混入訓練集。“字節剛開始也做蒸餾,後來張一鳴痛定思痛,說我們還是要走長遠路。阿里、騰訊、字節這個量級的公司,不能總靠蒸餾別人過日子。” 國內某大廠高管曾對AI科技評論這樣說。大模型的蒸餾可以用“背老師的作業答案”來形容。這條路見效極快。幾百萬條高質量指令數據灌進去,模型在基準測試上的分數能在短短幾周內突飛猛進,快速逼近被蒸餾模型的水平。在大模型競速的早期,幾乎所有玩家都試過這招。但隨著賽道進入深水區,爭議隨之爆發。
2026 年以來,Anthropic 連續公開指責 Minimax、月之暗面、DeepSeek、阿里通義實驗室存在蒸餾其模型的行為,將中國大模型的快速崛起直接歸因於 “抄捷徑”。不過,頗具諷刺意味的是,Anthropic 自身也被曝多次蒸餾 OpenAI 模型、使用盜版書籍數據訓練。真正讓張一鳴堅持 “不抄捷徑” 的,是更深層的技術判斷:在數據見頂、算力匱乏、全球模型 PK 進入白熱化的階段,靠蒸餾永遠只能追在別人身後,甚至會在下一輪智能躍遷中徹底掉隊。02四個工程“死理”:為什麼字節為何不做“蒸餾派”從技術角度而言,字節 Seed 堅持從頭訓練而不做“蒸餾派”,是一套環環相扣的技術演進邏輯。
從頭訓練雖然痛苦,但它是突破天花板的唯一解。▎拒絕合成數據的"近親繁殖"陷阱蒸餾的本質,是用別人模型的輸出當 “標準答案” 來訓練自己的模型。它看起來高效,卻藏著一個不可逆的致命缺陷:模型坍縮。2024 年 7 月,牛津、劍橋等機構的聯合研究登上《Nature》封面,首次系統證實,如果模型反覆用 AI 生成的數據訓練,原始數據分佈中的尾部信息會逐漸消失,最終產生不可逆的能力退化。就像近親繁殖,第一代看起來健康正常,但基因多樣性在快速流失,繁衍幾代後,隱性缺陷會集中爆發。
而ICLR 2025 的 Meta 研究進一步證實,訓練數據中哪怕只摻入千分之一的合成數據,就足以觸發模型坍縮;比例再低,毒性效應依然存在。而且模型參數量越大,在特定閾值下坍縮效應反而會被放大。不是堆參數就能解決問題。為什麼尾部信息這麼重要?真實世界的知識不是均勻分佈的。常見問題、標準回答只佔信息分佈的 “頭部”,而那些罕見的邊緣場景、反常識的提問、方言俚語的微妙語義、小眾領域的專業知識,都藏在分佈的 “長尾” 裡。這些長尾信息,決定了模型處理未知問題的上限,也是真正的智能邊界。AI 生成的 “標準答案”,天生就會抹平這些長尾。
模型輸出的永遠是概率最高的回答,它會自動過濾掉小眾、反常、不確定的內容,只留下最 “正確” 也最平庸的結果。用這樣的數據反覆訓練,模型會變得越來越自信,也越來越狹隘。雖然基準測試分數可能還在漲,但它的 “世界觀” 已經在悄悄坍縮。這就是蒸餾的天花板,你永遠只能逼近別人的能力上限,而且越追,自己的邊界越窄。而字節最大的底氣,恰恰是數據。抖音日均產出超 8000 萬條短視頻,頭條日均推薦內容以億計,海外 TikTok 覆蓋 150 多個國家和地區,這是全球最龐大的原生人類內容池。
從 PB 級的真實視頻、文本、評論、交互數據中清洗降噪,比直接拿來幾百萬條 GPT 生成的乾淨指令難得多,但只有原生真實數據,才能完整保留現實世界的分佈,包括那些奇怪、鮮活、不可預測的長尾。Scaling Law 的本質,是用更多高質量真實數據推高智能的天花板。合成數據只能在已有邊界內做平滑,永遠無法突破邊界。字節選的,是一條自己定義天花板的路。▎拿回詞表裡的技術主權很多人忽略了一個最底層的細節:詞表。詞表是模型的 “眼睛”,它決定了模型把一段文字切分成多少個基礎單元,每個單元對應一個向量表示。用別人的詞表,就等於接受了別人的語言偏好和認知顆粒度。
比如 Llama 的詞表是針對英語優化的,遇到中文成語、網絡熱梗、彈幕縮寫,常常會被拆成四五個零散的單字。這不僅會大幅降低推理效率、拉高成本,更關鍵的是,語義的關聯性被切碎了,模型從輸入層就沒真正理解中文的表達邏輯。更致命的影響在多模態領域。字節 Seed 系列的核心戰場從來不是純文本大模型,而是原生多模態。Seedance 2.0 已經實現原生音畫同步的視頻生成,支持 60 秒 2K 分辨率視頻和 8 種語言的唇形對齊。這種能力的前提,是模型在底層就實現文本、視頻幀、音頻信號的原子級映射:每一個語義單元,都要和對應的視覺、聲學單元在同一個向量空間裡對齊。
如果你蒸餾了別人的模型,你繼承的就是別人的編碼地基。別人怎麼切分視頻 Token,你就得怎麼切分;別人怎麼對齊音文時序,你就得怎麼對齊。後天微調可以改參數、調效果,但改不了底層的 Token 空間和語義框架。不蒸餾,意味著字節可以從零定義規則:視頻幀以什麼粒度做 Token 化最合理、音頻的節奏特徵怎麼編碼進語言模型、多模態信號怎麼做聯合注意力…… 所有底層決策全部握在自己手裡。對要做視頻生成、多模態交互的字節來說,地基的自主權,比短期的文本榜單排名重要得多。
▎硬件限制下的"重工業"內功靠蒸餾做模型,本質是輕量級的 “微創新”:站在別人現成的基座上做微調,幾百張 GPU 跑幾周就能看到效果,見效快、成本低,是很多廠商快速追趕的首選路徑。但字節選的從頭訓練路線,完全是另一套遊戲規則。要從零訓練 200B 以上參數的 MoE 大模型,比拼的從來不是單點算法的優劣,而是整套工程體系的硬實力。這是真正的 AI “重工業”。超大規模預訓練裡,最致命的指標叫MTBF(平均無故障時間)。一次完整的預訓練週期往往長達數月,要調動數萬張 GPU 並行計算。
這期間任何一張顯卡出現內存錯誤、任何一條高速鏈路發生通信閃斷、任何一個算子觸發精度溢出,都可能讓整個訓練任務中斷,甚至導致前期投入的算力成本全部打水漂。集群規模越大,故障發生的概率就越高。我們可以做一個簡單推算:假設單張 GPU 的平均無故障時間是 10 萬小時,那麼由一萬張卡組成的集群,平均每 10 小時就會遭遇一次硬件故障。如果沒有毫秒級的故障檢測、精準的斷點續訓和完備的容錯恢復機制,大規模從頭訓練根本無從談起。對字節來說,這份挑戰還要再上一個量級。
受美國芯片出口管制限制,字節無法採購英偉達最新的 Blackwell 旗艦芯片,只能使用性能受限的 H20 芯片,單卡訓練效率與海外頂尖平臺差距顯著。別人靠更強的單卡性能就能撐起訓練效率,字節要追上差距,只能靠更大的集群規模、更高的資源利用率和更極致的工程優化來補。這種先天限制,反而倒逼字節把基礎設施能力推到了行業極限。公開信息顯示,字節的訓練集群已佈局內蒙古烏蘭察布、山西大同、河北懷來、張北、安徽蕪湖等多個智算中心,搭建起數萬張卡規模的分佈式算力網絡。
2026 年字節 AI 基礎設施資本開支已上調至超 2000 億元,公司淨利潤同比出現明顯下滑,核心原因正是三四季度算力採購與數據中心建設的集中投入。張一鳴本人也將一半精力傾注在 Seed 團隊。這筆千億級的資金投入,加上創始人級別的注意力傾斜,押注的從來不只是某一個模型的效果,而是一整套能穩定支撐超大規模訓練的全棧工程體系:從底層算子優化、集群通信調度,到訓練故障恢復、算力資源管理,全部自主研發。這套能穩穩撐起 “萬億參數從零訓練” 的訓練框架與基建能力,才是字節真正的技術護城河。走蒸餾路線的廠商,永遠不需要攻克萬卡級穩定訓練的工程難題,自然也沉澱不下這套重工業級的系統能力。
當 Scaling Law 繼續向前演進,模型參數規模持續攀升時,競爭的門檻會從算法轉向工程。到那時,只有手握完整基建能力的玩家,才有資格留在牌桌上。▎獎勵模型的 “靈魂歸屬”:學答案,永遠學不會思維蒸餾學的是 “答案”,從頭訓練學的是 “思維”。用別人模型的輸出訓練,你的模型學到的是對方的輸出分佈,包括說話的語氣、回答的套路、甚至 RLHF 階段被注入的價值觀偏好。它知道什麼問題該說什麼話,但不知道為什麼這麼說;它模仿得了結果,模仿不了背後的推理鏈路。更關鍵的是,模型的 “靈魂” 會打上別人的烙印。什麼是好回答、什麼該拒絕、什麼場景用什麼風格,這些底層偏好,在蒸餾過程中會被一併繼承過來。
後續你再做 RLHF、再調獎勵模型,也只是在別人的地基上做裝修,很難從根本上改變模型的行為模式。而字節需要的,是完全對齊自身業務邏輯的獎勵模型。抖音的推薦講完播率和互動率,電商講點擊到購買的轉化效率,短視頻內容講節奏感和視覺衝擊力,這些獨特的商業邏輯,必須深度植入 Reward Model,讓模型在 RLHF 階段就和字節系產品的目標對齊。如果你蒸餾了GPT-4,模型的"靈魂"裡刻著OpenAI的偏好邏輯。你在後訓練階段再怎麼調,也是在別人的地基上裝修。只有從頭訓練,從預訓練到RLHF全鏈路自主,字節才能讓模型真正對齊到自己那套極致的商業邏輯中。這不僅關乎效果,更關乎可控性。
03字節的底牌:10萬億參數大模型拒絕了捷徑,字節的追趕路徑是什麼?答案正在浮出水面。據《金融時報》報道,字節跳動正在討論訓練一個參數規模10萬億的大模型,顯著超過阿里 Qwen 3.8-Max 的 2.4 萬億參數和月之暗面 K3 的 2.8 萬億參數,是目前國內已知參數規模最大的模型計劃。該項目仍處於早期探索階段,由 Seed Foundation 負責人項亮主導,與預訓練數據負責人沈科協同推進,最終是否正式發佈尚未確定。這是一個非常 “字節” 的選擇:與其在同尺寸參數上苦苦追趕,不如直接把規模拉到同行的數倍,用一次量級躍遷爭取領先位置。
Scaling Law 依然是當前大模型最可靠的進階路徑。在數據質量、訓練效率達標的前提下,參數規模的提升會帶來可預測的能力增長。當主流玩家還在 2-3 萬億參數區間內卷時,字節直接衝擊10萬億,本質是用規模換時間,用更大的投入,跳過中間的追趕步驟,直接摸到下一個梯隊的門檻。但這同樣是一場豪賭。參數規模翻倍,訓練難度不是線性增長,而是指數級上升。數據供給、算力穩定性、對齊難度、推理成本,每一項都是巨大的挑戰。2000 億資本開支、70% 的利潤下滑、創始人一半的精力,所有籌碼都壓在了這條 “更慢更難”的路上。這條路的價值,不止於技術本身。
當 DeepSeek 被 OpenAI 正式指控蒸餾,當美國立法將模型數據竊取納入國家安全範疇,字節的選擇突然有了提前避險的戰略意味。全鏈路自研的模型,沒有知識產權爭議,沒有合規包袱,無論是全球化佈局還是長期技術競爭,都站在更安全的位置。未來 3 年,大模型的技術範式窗口期正在急劇收窄。頭部玩家今天的技術路線選擇,會決定未來十年甚至更久的競爭格局。蒸餾的誘惑在於確定性:你知道終點在哪裡,知道怎麼走最快,投入產出清晰可見。但它的代價,是永遠失去定義終點的資格。張一鳴在會議上,明確望大家以追求智能上限為目標,期待Seed 模型能力能躋身世界第一梯隊。
技術主權,真正參與定義智能上限的機會,正是這條更難走的路的回報。參考鏈接: https://www.theinformation.com/articles/bytedances-founder-rules-distillation-ai-models?rc=gznj9j上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。