張一鳴的「慢」,和整個行業的「快」

新眸2026.08.12 18:20 · 來自江蘇全文4406字大模型的虛火還在燒。文 | 新眸,作者 | 桑明強不久前,字節跳動創始人張一鳴與Seed負責人吳永輝共同召開了一場Seed全員會,除了給團隊打氣,會上他還談到了對模型蒸餾的看法:不要把蒸餾當作提升模型能力的捷徑,哪怕這意味著可能會落後於國內同行。很多人只看到了不走捷徑的字節,反而忽略了它背後的戰略定力。舉個例子,SP時代比短信訂閱數,團購時代比覆蓋城市數,O2O比地推鐵軍,短視頻比日活。每一次大家都在比那個最容易量化、最容易寫進PR稿、最容易讓投資人興奮的數字。每一次都有人在那個數字上跑到第一,然後呢?
歷史的經驗告訴我們,真正活下來的,從來不是數字最好看的那個。今天的AI行業,正在把這場數字遊戲玩到極致。比參數,從百億到萬億;比榜單,MMLU、GSM8K、HumanEval、Arena Elo一個接一個;比單項能力,誰的視頻生成手指更正常,誰的代碼通過率高几個點,誰的多模態又在某個benchmark刷新紀錄。KOL加班做對比視頻,結論永遠是"國產又贏了"。朋友圈一片歡騰,彷彿AGI下週就來。可你把目光從這些數字上移開,去問真在生產環境用AI的人,得到的多半是另一種答案。
模型在榜單上無所不能,到了具體工作裡,更像個聰明但不靠譜的實習生,什麼都能聊兩句,真交給他一件完整的事,你還得在後面收拾爛攤子。這就是我們今天面對的局面:參數越來越大,榜單越來越好看,熱鬧越來越多,可AI和真實世界之間那道溝,非但沒填上,反而越變越寬。榜單上的勝利與現實中的困境今年7月,月之暗面發佈Kimi K3,參數精確到2.78萬億,全球最大開源模型。那天我的朋友圈被刷了屏。結果三天後的晚上,月之暗面發公告,說"用戶請求量大幅超出預估,逼近現有集群承載極限",即日起暫停C端新用戶訂閱。這件事本身就能說明一些問題。
花這麼多錢,燒這麼多卡,訓練出參數上碾壓同行的模型,結果連最基本的用戶訪問都扛不住。這就像車廠造出臺發動機參數全球第一的跑車,一開出來發現油箱只能裝十公里的油。另外,榜單本身的可信度也越來越可疑。今年八月,兩家機構發佈同月份國內AI應用月活數據,同一個豆包,一家5.28億,另一家3.82億,差了1.46億。沒有誰造假,只是月活這個用了二十年的指標,到了AI產品這兒突然測不準了。插件調用算不算?API訪問算不算?連統計口徑都沒有共識,那些煞有介事的排名,看看就好。視頻生成領域的榜單競賽,已經到了走火入魔的地步。
可靈、即夢、Vidu這些,每過一端時間就有一家宣佈在某個評測集登頂,KOL迅速跟進出"深度評測",結論永遠是"國產又贏了"。可你去問真正用這些工具做內容的人,他們關心的根本不是誰在benchmark上高零點幾分。他們關心生成一條視頻要等多久,改十次能不能有一次能用,複雜場景人物會不會崩,商用版權有沒有保障。這些問題,沒有一個榜單能回答。我想起2011年的千團大戰。全國五千多家團購網站,開發佈會都在說用戶數、覆蓋城市、單日交易額,數字一個比一個嚇人。王興那時候就講,團購的核心不是鋪多少城市,是每個城市能不能把單位經濟模型跑正。沒人聽。大家都燒錢搶市場,燒到最後,活下來的是美團。
今天AI行業的邏輯很類似。大家都在拼那些容易量化、容易傳播、容易寫進PR稿的數字,很少有人願意碰真正難的事:怎麼讓模型在工業現場穩定工作,怎麼讓AI在零容錯的金融醫療場景給出可解釋、可審計的結論,怎麼把推理成本降到企業願意大規模買單的程度。這些事不性感,上不了熱搜,也沒法在發佈會上用一張PPT展示,但它們才是AI真正進入生產體系的門檻。蘋果就是最好的例子。2024年WWDC上Apple Intelligence被吹得天花亂墜,結果跳票兩年,今年WWDC才拿出像樣的版本,核心能力還得靠接OpenAI和谷歌的API。發佈會當天,蘋果股價從盤中317美元跌到收盤301美元,市值蒸發2300億美元。
華爾街邏輯很簡單:你演示的這些,ChatGPT兩年前就有了,我們等了兩年,就等來了這個?這就是參數繁榮掩蓋下的真相:我們在實驗室裡、在評測集上、在精心準備的demo裡取得的所有勝利,到了真實世界都要重新打一遍折,而且這個折扣,經常大到讓你懷疑人生。抄作業抄不出第一名張一鳴為什麼對蒸餾這麼敏感?技術上的蒸餾本來是正經方向,用大模型輸出訓練小模型,讓小模型在特定場景接近大模型能力,同時降低推理成本。但在今天的國內AI圈,蒸餾已經異化成了一條抄近路的產業鏈。坦白地說,新模型發佈流程現在高度標準化。國外發布或者更新一個新模型,最多幾周時間,國內就有一堆模型宣佈"在各項基準上追平甚至超越"。怎麼做到的?
說白了很簡單:拿新模型的輸出當訓練數據,蒸餾到自己的模型裡,再針對benchmark做專門優化。OpenRouter有個數據很說明問題。今年1月,開源模型處理的token佔比是34%,到了6月變成65%。半年翻了近一倍。開源模型突飛猛進的背後,有多少是真正的技術突破,有多少是蒸餾和benchmark過擬合帶來的虛假繁榮?關於這個問題,很多人自己心裡都有數。今年7月,前OpenAI研究員Diogo Almeida發了篇博客,說當年那篇奠定Scaling Law的論文,從根上就有個bug,計算推理最優分配時算錯了,導致整個行業過去五年都在訓練"參數過大、訓練不足"的模型。
DeepMind的Sander Dieleman第一時間轉發,說這個bug大概率讓行業在錯誤方向浪費了鉅額算力。這件事最耐人尋味的是,這麼多聰明人,這麼多頂級公司,幾年時間,上萬張GPU燒進去,居然沒人發現這個基礎錯誤。為什麼?因為所有人都在同一條賽道上狂奔,沒人停下來問問路對不對。大家都在堆參數,你不堆你就落後;大家都在刷榜單,你不刷你就融不到錢。路徑依賴一旦形成,連質疑的聲音都會被淹沒。蒸餾就是這條路徑依賴的終極形態。可問題是,抄作業永遠抄不出第一名。如張一鳴所講,你蒸餾Claude,最多無限接近它。更要命的是,這種路徑依賴會從根上廢掉一個團隊的研究能力。
當你的工程師習慣了用別人的輸出訓練模型,他們就再也不會去想,怎麼從第一性原理出發改進模型結構,怎麼構建真正高質量的數據集,怎麼解決那些根本性的技術難題。這才是張一鳴真正擔心的。他看到的不是一時的榜單高低,是整個團隊的創新文化會不會被捷徑腐蝕。Builder.ai破產就是很典型的例子。這家估值15億美元的英國公司,拿了微軟和卡塔爾投資局4.5億美元,對外宣傳AI可以自動寫代碼,客戶想要什麼軟件幾分鐘就能生成。今年五月破產清算時大家才發現,所謂AI自動生成,後臺是七百多個印度程序員在一行行手寫代碼。最諷刺的是,這家公司還上過福布斯"改變世界的50家AI公司"榜單。這樣的故事不是個例。
從Humane AI Pin到Rabbit R1,過去兩年倒下的AI公司已經數不清。有機構統計,2024到2026年入場的AI公司,40%已經關停,原因驚人地一致:沒有核心技術,沒有數據壁壘,沒有真正的場景,大模型一旦更新了同樣的功能,它們的存在價值立刻歸零。歷史不會重複,但總是押著同樣的韻腳。今天AI行業的參數競賽、榜單崇拜、蒸餾捷徑,和當年的手機參數大戰、新能源PPT造車,本質上是同一件事:用容易量化的數字,迴避真實場景裡的艱難跋涉。離開排行榜之後,什麼才是真正的繁榮當然不是說參數不重要,也不是說榜單毫無價值。技術發展早期,量化指標確實能幫我們看清進步的軌跡。
但當整個行業把手段當成目的,把指標當成目標,事情就開始變味了。移動互聯網那十年的繁榮,不是因為手機芯片從單核跑到了八核,是因為iPhone重新定義了智能手機,是微信、支付寶、美團、滴滴這些產品,真正改變了十幾億人吃飯、出行、社交、付錢的方式。特斯拉帶動的新能源革命,也不是因為電池能量密度每年提升幾個百分點,是它證明了電動車可以比燃油車更好開、更智能、更便宜,把整個產業鏈帶了起來。這些繁榮背後當然有技術參數的進步,但參數是結果,不是原因。真正驅動繁榮的,是技術和真實需求的深度結合,是產品在具體場景裡創造的真實價值。今天AI行業的問題,恰恰在於太多人把參數當成了原因。
他們覺得只要模型足夠大,一切問題都會迎刃而解;只要榜單分數足夠高,商業化自然會來。可現實是,GPT-4到GPT-5,參數翻了幾倍,能力強了不少,但真正願意為AI付費的個人用戶並沒有幾何倍數增長。很多企業買了大模型API,用了幾個月就發現,除了寫文案做總結,好像也找不到更多真正能落地的場景。麥肯錫有個報告(《The State of AI in 2025》),2025年企業在AI上的投入比前一年翻了一番,但真正把AI部署到核心生產流程的比例,只從12%漲到了16%。剩下的84%,要麼還在做POC,要麼用了幾次就扔在那兒了。錢花了,熱鬧看了,最後發現AI並沒有像預期那樣重構業務流程。為什麼會這樣?
因為真實世界太複雜了。你在實驗室裡訓練模型,用的是乾淨的、標註好的數據。可到了工業現場,傳感器數據是有噪聲的,生產環境是動態變化的,很多關鍵參數根本沒法直接測量——催化劑的活性、熱態工件的變形量、化學反應的中間狀態,這些東西你連數據都採不到,模型再大,有什麼用?你在評測集上做數學題正確率99%,可到了金融風控,一個錯誤判斷可能就是幾千萬損失;到了醫療診斷,一個幻覺可能就是重大事故。這些場景要求的不是99%的正確率,是六個九、七個九的可靠性,是每一個決策都可解釋、可追溯、可審計。這也是為什麼真正在產業裡深耕的人,對那些天花亂墜的模型發佈越來越淡定。好消息是,已經有人開始往這個方向走了。
微軟今年財報會上,納德拉講的重點已經不是Copilot又加了多少參數,是財富500強裡有多少家在用Azure的AI平臺,是Copilot Studio裡企業自己搭建的Agent數量,是商業模式從席位訂閱轉向"席位+按量計費"。谷歌在Gemini at Work上展示的,也不是什麼炫酷demo,是大眾、華納兄弟、Snap這些公司怎麼把Gemini真正嵌到生產流程裡。國內的騰訊WorkBuddy、阿里QoderWork、字節TRAE、金山WPS AI,也都在做同樣的事——不再比誰的模型更聰明,開始比誰能更深度地嵌入工作流,誰能真正幫用戶解決問題。當然,這條路註定更難走。
它要求你沉到行業裡去,理解客戶的真實痛點,和客戶一起打磨產品,忍受很長時間沒有高光時刻的寂寞。它不像發佈一個萬億參數模型那樣能上頭條,不像刷到榜單第一那樣能讓投資人興奮,也不像KOL的評測視頻那樣能帶來潮水般的流量。但這才是真正的AI浪潮該有的樣子。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。