字節押注 5 萬億參數大模型:超 Kimi K3 和 Qwen 3.8-Max,張一鳴內部下令嚴禁蒸餾
重點摘要
字節跳動正討論訓練參數超過5萬億的大語言模型,規模將超越阿里Qwen 3.8-Max與月之暗面K3,成為國內已知最大模型,但計畫仍屬早期階段。創辦人張一鳴在內部會議強調長期主義與延遲滿足感,明確禁止蒸餾開源模型,CEO梁汝波也重申堅持自研,接受短期落後以優化長期發展。
字節跳動傳出正在討論訓練參數規模超過 5 萬億的大語言模型,若最終落地,將一舉超越目前國內已知的所有同類模型,成為參數量最大的存在。根據媒體報導,這個數字明顯壓過阿里通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,規模差距相當顯著。不過這項計畫仍處於早期討論階段,模型最終是否會正式發布,目前還沒有定論。 據了解,這個新模型由字節跳動旗下 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科合作推進。Seed 團隊也為此重新梳理組織架構、劃分職責並調配資源,顯示字節內部對這個項目相當重視。接近 Seed 團隊的人士透露,背後的想法很直接:與其在現有模型尺寸上繼續追趕其他業者,不如一口氣把參數規模推到同行的數倍,直接爭取領先位置。 這項技術規劃背後,其實是字節高層一連串明確的戰略表態。創辦人張一鳴近日在內部會議中罕見地針對 AI 研發路線發言,強調做模型要堅持長期主義、延遲滿足感,而不是用別人的輸出去換一時的榜單排名。他明確指出,字節應該願意為長期目標犧牲一部分短期收益,這番話被視為對內部研發方向的一次定調。 更值得注意的是,目前字節內部對開源模型嚴禁蒸餾,甚至透過 API 檢測等方式加強限制。張一鳴認為,蒸餾雖然可以在短期內快速提升模型表現,但會干擾真正意義上的長期技術突破。這項禁令顯示字節在 AI 研發上,選擇了一條相對艱難但更重視自主技術累積的路線。 到了 8 月 6 日的 2026 年中全員大會上,字節跳動執行長梁汝波又把這套邏輯完整講了一遍。他表示,在大語言模型上字節會繼續堅持自研、做好基本功,接受短期落後,堅持優化長期。所謂優化長期,就是以用戶和增量社會價值為中心,不為短期波動所動;落到 AI 業務上,就是相信 AGI、堅持自研。 梁汝波特別澄清了外界對字節自研動機的猜測。他說:「昨天有外部報道說,我們是因為外部壓力才堅持自研的,這是瞎猜。真實原因是希望團隊延遲滿足感,打好技術基礎,這對長期實現 AGI 很關鍵。」這番話直接回應了市場上關於字節是否因競爭壓力而被迫自研的各種傳聞。 從張一鳴到梁汝波,這次高層接連發聲,不只是單純的技術規劃,更像是一次完整的戰略宣告。對內,字節希望統一研發思路,讓團隊理解並接受長期投入的節奏;對外,則釋放明確訊號——字節無意跟隨其他公司的技術路線內卷,而是打算走出一條屬於自己的成長曲線。 值得注意的是,字節跳動近期在 AI 領域動作頻繁。旗下 Seed 團隊先前才發布了 Seedance 2.5 音視頻聯合生成模型,主打「一鏡成片」,單次生成時長從 15 秒延長至 30 秒,並支持多輪無縫延長,讓複雜情節更連貫。該模型深度優化材質、光影與膚質,有效消除過去 AI 生成影片常見的「塑膠感」,實現更接近真實拍攝的質感,並已陸續上線即夢 AI、豆包專業版,API 也接入火山方舟,覆蓋影視、廣告、教育、工業製造及自動駕駛等場景。 這些產品層面的進展,與這次超大參數模型的討論相互呼應,顯示字節在 AI 領域的布局正從應用端一路延伸到最底層的模型研發。而張一鳴與梁汝波對「長期主義」與「延遲滿足感」的反覆強調,也讓外界看到字節在 AI 競賽中試圖跳脫短期榜單競爭、追求更根本技術突破的企圖心。 不過,5 萬億參數的模型能否真正落地,以及訓練這樣規模的模型所需的算力、數據與成本,都是外界關注的焦點。目前字節內部對此事仍保持低調,計畫也尚未有明確的發布時間表。但可以確定的是,字節跳動在 AI 大模型領域的野心,已經不再只是追趕,而是試圖透過一次跳躍式的投入,重新定義自己在這波 AI 競賽中的位置。
Related
相關文章

Neon 開源 4B 模型:文檔搜索能力超 GPT-5.6 Sol,成本僅為 1/100
首頁 > 智能時代>人工智能 Neon 開源 4B 模型:文檔搜索能力超 GPT-5.6 Sol,成本僅為 1/100 2026/8/7 13:25:16 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,Neon 昨日(8 月 6 日)發佈博文,宣佈攜手 Castform 公司,披露一套面向檢索模型的訓練方案。

珍貴訪談:Jeff Dean談AI的下一次範式升級
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

DeepSeek Harness 負責人吐槽“融資材料”吹過頭:V4-Pro編程能力僅差Claude旗艦0.3%,前端服務費高達10%
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

梁文鋒,告別“價格屠夫”
DeepSeek宣布近期將大幅調漲API服務定價,結束過去兩年的「地板價」策略,引發開發者社群熱議。此舉主因是全球算力資源緊張與推理成本高漲,也反映大模型行業正從「貼錢換規模」的價格戰,轉向更理性的定價框架。
