字節押注 5 萬億參數大模型:超 Kimi K3 和 Qwen 3.8-Max,張一鳴內部下令嚴禁蒸餾
字節跳動傳出正在討論訓練參數規模超過 5 萬億的大語言模型,若最終落地,將一舉超越目前國內已知的所有同類模型,成為參數量最大的存在。根據媒體報導,這個數字明顯壓過阿里通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,規模差距相當顯著。不過這項計畫仍處於早期討論階段,模型最終是否會正式發布,目前還沒有定論。據了解,這個新模型由字節跳動旗下 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科合作推進。Seed 團隊也為此重新梳理組織架構、劃分職責並調配資源,顯示字節內部對這個項目相當重視。
接近 Seed 團隊的人士透露,背後的想法很直接:與其在現有模型尺寸上繼續追趕其他業者,不如一口氣把參數規模推到同行的數倍,直接爭取領先位置。這項技術規劃背後,其實是字節高層一連串明確的戰略表態。創辦人張一鳴近日在內部會議中罕見地針對 AI 研發路線發言,強調做模型要堅持長期主義、延遲滿足感,而不是用別人的輸出去換一時的榜單排名。他明確指出,字節應該願意為長期目標犧牲一部分短期收益,這番話被視為對內部研發方向的一次定調。更值得注意的是,目前字節內部對開源模型嚴禁蒸餾,甚至透過 API 檢測等方式加強限制。張一鳴認為,蒸餾雖然可以在短期內快速提升模型表現,但會干擾真正意義上的長期技術突破。
這項禁令顯示字節在 AI 研發上,選擇了一條相對艱難但更重視自主技術累積的路線。到了 8 月 6 日的 2026 年中全員大會上,字節跳動執行長梁汝波又把這套邏輯完整講了一遍。他表示,在大語言模型上字節會繼續堅持自研、做好基本功,接受短期落後,堅持優化長期。所謂優化長期,就是以用戶和增量社會價值為中心,不為短期波動所動;落到 AI 業務上,就是相信 AGI、堅持自研。梁汝波特別澄清了外界對字節自研動機的猜測。他說:「昨天有外部報道說,我們是因為外部壓力才堅持自研的,這是瞎猜。真實原因是希望團隊延遲滿足感,打好技術基礎,這對長期實現 AGI 很關鍵。
」這番話直接回應了市場上關於字節是否因競爭壓力而被迫自研的各種傳聞。從張一鳴到梁汝波,這次高層接連發聲,不只是單純的技術規劃,更像是一次完整的戰略宣告。對內,字節希望統一研發思路,讓團隊理解並接受長期投入的節奏;對外,則釋放明確訊號——字節無意跟隨其他公司的技術路線內卷,而是打算走出一條屬於自己的成長曲線。值得注意的是,字節跳動近期在 AI 領域動作頻繁。旗下 Seed 團隊先前才發布了 Seedance 2.5 音視頻聯合生成模型,主打「一鏡成片」,單次生成時長從 15 秒延長至 30 秒,並支持多輪無縫延長,讓複雜情節更連貫。
該模型深度優化材質、光影與膚質,有效消除過去 AI 生成影片常見的「塑膠感」,實現更接近真實拍攝的質感,並已陸續上線即夢 AI、豆包專業版,API 也接入火山方舟,覆蓋影視、廣告、教育、工業製造及自動駕駛等場景。這些產品層面的進展,與這次超大參數模型的討論相互呼應,顯示字節在 AI 領域的布局正從應用端一路延伸到最底層的模型研發。而張一鳴與梁汝波對「長期主義」與「延遲滿足感」的反覆強調,也讓外界看到字節在 AI 競賽中試圖跳脫短期榜單競爭、追求更根本技術突破的企圖心。不過,5 萬億參數的模型能否真正落地,以及訓練這樣規模的模型所需的算力、數據與成本,都是外界關注的焦點。
目前字節內部對此事仍保持低調,計畫也尚未有明確的發布時間表。但可以確定的是,字節跳動在 AI 大模型領域的野心,已經不再只是追趕,而是試圖透過一次跳躍式的投入,重新定義自己在這波 AI 競賽中的位置。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。
Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing
Alibaba’s Qwen team has released Qwen-Image-2.1, a unified text-to-image generation and image editing model. Its visual generation component has 7B parameters across 32 single-stream DiT layers.