張一鳴的10萬億參數大模型:還能跑贏時間嗎?

2026年8月15日 11:28
張一鳴的10萬億參數大模型:還能跑贏時間嗎?
站內 AI 整理稿

AI商業評論2026.08.15 11:26 · 來自上海全文4133字頂層的固執與底層的焦慮文|AI商業評論2026年7月底的一個傍晚,字節跳動Seed團隊的全員會氣氛凝重。創始人張一鳴罕見地出現了。這位自2021年卸任CEO後便淡出日常管理的創始人,平時不在國內,"AI部門是他最關心和接觸最多的"。但這一次,他不是來打氣的。"不要用別人的輸出,換一時的榜單排名。"張一鳴對臺下約2000名Seed研究人員說。他明確反對通過蒸餾競爭對手的模型來追趕,認為字節應該"為長期目標犧牲一部分短期利益",堅持"長期主義和延遲滿足"。話音落下,會議室裡有人鬆了一口氣,也有人握緊了拳頭。

他們都知道,這不是一次普通的戰略宣導。就在這次會議之前,Seed內部至少發生過三次關於"是否採用蒸餾路線"的激烈討論——DeepSeek-R1發佈後一次,Blackwell芯片部署後一次,Kimi K3發佈後又一次。每一次,張一鳴都投了否決票。而此時,豆包大語言模型在全球LLM排行榜上僅列第21位,遠低於Kimi K3(第2位)和阿里Qwen 3.8 Max(第4位)。CEO梁汝波在不久後的年中全員會上也不得不承認:"大語言模型和海外領先模型的差距有所拉大。

"那麼問題來了:當競爭對手用蒸餾這條"捷徑"在榜單上狂奔時,張一鳴的"不蒸餾"宣言,究竟是高瞻遠矚的戰略定力,還是追趕無力之下的一塊遮羞布?01 三次否決,頂層的固執與底層的焦慮蒸餾在大模型圈是一條心照不宣的捷徑。用市場上先進的大模型訓練自己的小模型,成本低、見效快,能在短時間內把能力提上來。DeepSeek、Kimi、阿里Qwen,或多或少都走了這條路。甚至Anthropic已經公開指控多家中國公司蒸餾其Claude模型。張一鳴的邏輯是:蒸餾只能逼近對手,永遠無法超越;沿著別人的軌跡走,最多成為"更好的模仿者"。技術上,這套說辭站得住腳。

牛津大學和Meta的研究表明,過度依賴合成數據會導致"模型坍縮",尾部信息不可逆丟失。蒸餾還會帶來詞表依賴和獎勵模型錯位的問題——你繼承的是別人的價值觀,而不是自己的商業邏輯。但技術正確不等於商業正確。當Kimi K3以2.8萬億參數橫掃榜單、阿里Qwen 3.8 Max以2.4萬億參數緊追不捨時,字節拿得出手的語言模型是什麼?Seed 2.1 Pro,在全球LLM排行榜上僅列第21位。CEO梁汝波在年中全員會上不得不公開承認:"大語言模型和海外領先模型的差距有所拉大。"張一鳴從去年下半年開始,將一半精力傾注在Seed團隊,定期參加核心技術覆盤會。這種級別的創始人介入,在字節歷史上極為罕見。

但高度介入的另一面是:當創始人把個人技術潔癖注入公司戰略,組織的容錯空間還有多大?02 10萬億參數的豪賭大力出奇跡2.0?否決蒸餾之後,字節給出的替代方案是一個讓全行業側目的數字:10萬億參數。據英國《金融時報》報道,字節正在預訓練一個參數規模最高可達10萬億的超大模型,體量是Kimi K3的三倍以上,對標Anthropic最先進的Mythos系統。項目由Seed Foundation負責人項亮主導,目前僅處於預訓練初期,完整週期預計3至6個月,能否正式發佈仍是未知數。但這裡有一個被刻意迴避的問題:10萬億參數,拿什麼喂?

2022年DeepMind的Chinchilla論文已經證明:參數規模翻倍,訓練數據量也應同步增加。研究機構Epoch AI估算,全球公開的人類高質量文本大約只有300萬億Token,按照當前消耗速度,可能在2026年至2032年間被"吃幹抹淨"。字節一邊拒絕蒸餾抄答案,一邊要訓練全球最大的模型之一,這意味著它必須自己準備海量"教材"。為此,字節甚至將數據團隊整合升格為一級部門"AI數據與安全"。但就在這個節骨眼上,原AI數據與安全負責人傅越被傳離職。核心數據負責人的出走,給10萬億參數模型的"教材供應"蒙上了一層陰影。更值得追問的是:字節是不是在重複自己最熟悉的那套打法——大力出奇跡?

從今日頭條到抖音,字節過去十年的成功公式是海量資源+快速迭代+流量變現。但大模型不是短視頻。參數堆到10萬億,如果數據質量、訓練框架、優化方案跟不上,可能只會造出一個更昂貴的"笨蛋"。業內已有聲音指出,"將參數規模一次推到同行數倍以爭取領先位置的舉措,像一場賭博"。而這場賭博的籌碼,是天文數字的錢。2025年,字節全年資本開支超過1500億元,其中約900億用於AI算力採購。2026年,這一數字被曝超過2000億元。豆包App月活3.

45億,日均Token調用量達180萬億,但光鮮的用戶數據背後是一張觸目驚心的成本賬單:單次推理成本中,硬件折舊佔58%,電力消耗佔29%,每天算力消耗達數千萬元。收入方面,每天2億多人使用的豆包,日收入不足百萬元,主要來自電商佣金。唯一能讓賬面好看一點的是Seedance——這款視頻生成模型的年化收入已達20億美元(約135億元人民幣),單月超10億元,剛好能抵消豆包的算力成本。也就是說,字節AI業務的財務現狀是:視頻模型賺錢養語言模型,語言模型燒錢換用戶規模,用戶規模換不來同等收入。當張一鳴說"願意為長期目標犧牲短期收益"時,他犧牲的究竟是誰的收益?

03 偏科與動盪,Seedance的光環照不亮LLM的短板字節並非一事無成。恰恰相反,它在AI視頻生成領域做到了全球頂尖。Seedance 2.0原生支持多模態混合輸入,火山引擎MaaS收入的一半以上由其貢獻。但是,字節真正能拿得出手的AI成果集中在視頻(文娛)內容生成,而B端產業客戶真正看重的通用基座能力——長文檔理解、邏輯推理、代碼生成、複雜任務拆解——恰恰是字節的短板。這種"偏科"直接反映在了商業戰場上。2026年夏天,在上海舉辦的WAIC(世界人工智能大會)——國內最重要的to B與產業AI公共舞臺——字節跳動繼續選擇放棄獨立官方展臺,僅以第三方合作微弱露出。

而就在同一時期,字節卻在ChinaJoy(遊戲展)上為抖音直播和朝夕光年設置了超大展臺,布展面積超過了騰訊。一個想做企業AI服務巨頭的公司,在to B主舞臺上隱身,在to C遊戲展上狂歡。這不僅僅是市場策略的選擇,更是底層能力缺位的外化——當你的語言模型還不足以支撐B端客戶的複雜工作流時,你確實沒什麼可展示的。比技術路線更耐人尋味的是人的動盪。2025年6月,豆包大模型大語言模型團隊負責人喬木因合規問題被辭退。隨後,顧全全離職創業,傅越離職,周暢從阿里"挖角"過來卻引發競業訴訟。更劇烈的是組織層面的"揮刀":成立近十年、數千人規模的飛書"一夜拆分",產品團隊併入豆包,GTM團隊併入火山引擎。

飛書負責人謝欣——2014年字節只有300人時的第一任HR負責人、張一鳴時代的元老——從直接向梁汝波彙報,改為向豆包負責人趙祺彙報。梁汝波解釋這是為了"更好地打造面向辦公與生產力場景的優質產品"。但一個無法迴避的事實是:當一家公司的AI戰略需要靠"拆分元老業務"來推進時,這究竟是資源整合的魄力,還是底層焦慮的應激反應?04 考場還在嗎?讓我們回到張一鳴的那句話:"不要用別人的輸出,換一時的榜單排名。"這句話放在技術倫理的框架下無可指摘。但放在商業競爭的語境裡,它暴露了一個危險的假設——時間站在字節這一邊。現實是,AI大模型的競爭正在呈現"贏家通吃"的特徵。用戶心智一旦形成,遷移成本極高。

當Kimi和DeepSeek用蒸餾快速迭代、佔領市場時,字節卻在堅持"自研"的清白。這種清高,用戶會買單嗎?答案正在浮現。2026年5月,豆包啟動付費,推出68/200/500元三檔會員。社交平臺上很快出現"豆包笨還收費"的質疑。一位用戶的吐槽很直白:"既然收費了,免費的肯定會打折扣,完全可以Kimi或智譜換著用,總有還在免費的大廠。"付費用戶不會容忍"略好於免費版"的差異化,他們要的是質的飛躍。而豆包目前的能力,顯然還沒準備好回答這個問題。更微妙的是政治風險和美國監管。

利用美國公司擁有的西方模型的輸出結果來訓練本地模型已成為一個重大的地緣政治熱點,避免這種做法可以保護公司免受被列入貿易黑名單或遭受華盛頓制裁的風險。2026年以來,Anthropic連續指控MiniMax、月之暗面、DeepSeek、阿里蒸餾Claude模型,字節恰好不在名單上。有人解讀為"提前避險",但另一種解讀同樣成立:字節之所以沒被指控,可能是因為它的語言模型能力還不足以引起Anthropic的警惕。張一鳴說,要"延遲滿足"。但延遲滿足的前提是,你知道那個"滿足"終將到來。如果10萬億參數模型在預訓練中遭遇瓶頸,高質量數據真的在2032年前就被耗盡——那麼,延遲滿足會不會變成無限期拖延?

8月6日,梁汝波在全員會上說,公司戰略要"高度優先,粗主幹,優化長期"。他否認"字節因為外部壓力才堅持自研",表示是希望團隊"延遲滿足,打好技術基礎"。但敘事之外,有一組冰冷的數字不容忽視:豆包日均Token消耗180萬億,距離內部目標250-300萬億仍有差距;豆包LLM全球排名第21,語言模型能力"落後半年";2000億年投入,日收入不足百萬;10萬億參數模型還在預訓練初期,3-6個月後能否發佈仍是未知數。張一鳴把"不蒸餾"上升到了產品文化的高度。但文化不能當飯吃,技術潔癖也不能自動轉化為市場份額。在AI這場考試中,有人選擇抄答案,有人選擇自己寫。張一鳴選擇了後者,這值得尊重。

但一個殘酷的問題是:當你終於寫完自己的答案時,考場還在嗎?2000億買一張"不蒸餾"的清白,值不值?答案可能要到2027年才能揭曉。但那時,榜單上的對手,還會給你留位置嗎?

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛