字節押注 5 萬億參數大模型:超 Kimi K3 和 Qwen 3.8-Max,張一鳴內部下令嚴禁蒸餾

2026年8月7日 01:306200 次瀏覽

重點摘要

字節跳動正討論訓練參數超過5萬億的大語言模型,規模將超越阿里Qwen 3.8-Max與月之暗面K3,成為國內已知最大模型,但計畫仍屬早期階段。創辦人張一鳴在內部會議強調長期主義與延遲滿足感,明確禁止蒸餾開源模型,CEO梁汝波也重申堅持自研,接受短期落後以優化長期發展。

站內 AI 整理稿

字節跳動傳出正在討論訓練參數規模超過 5 萬億的大語言模型,若最終落地,將一舉超越目前國內已知的所有同類模型,成為參數量最大的存在。根據媒體報導,這個數字明顯壓過阿里通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,規模差距相當顯著。不過這項計畫仍處於早期討論階段,模型最終是否會正式發布,目前還沒有定論。據了解,這個新模型由字節跳動旗下 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科合作推進。Seed 團隊也為此重新梳理組織架構、劃分職責並調配資源,顯示字節內部對這個項目相當重視。

接近 Seed 團隊的人士透露,背後的想法很直接:與其在現有模型尺寸上繼續追趕其他業者,不如一口氣把參數規模推到同行的數倍,直接爭取領先位置。這項技術規劃背後,其實是字節高層一連串明確的戰略表態。創辦人張一鳴近日在內部會議中罕見地針對 AI 研發路線發言,強調做模型要堅持長期主義、延遲滿足感,而不是用別人的輸出去換一時的榜單排名。他明確指出,字節應該願意為長期目標犧牲一部分短期收益,這番話被視為對內部研發方向的一次定調。更值得注意的是,目前字節內部對開源模型嚴禁蒸餾,甚至透過 API 檢測等方式加強限制。張一鳴認為,蒸餾雖然可以在短期內快速提升模型表現,但會干擾真正意義上的長期技術突破。

這項禁令顯示字節在 AI 研發上,選擇了一條相對艱難但更重視自主技術累積的路線。到了 8 月 6 日的 2026 年中全員大會上,字節跳動執行長梁汝波又把這套邏輯完整講了一遍。他表示,在大語言模型上字節會繼續堅持自研、做好基本功,接受短期落後,堅持優化長期。所謂優化長期,就是以用戶和增量社會價值為中心,不為短期波動所動;落到 AI 業務上,就是相信 AGI、堅持自研。梁汝波特別澄清了外界對字節自研動機的猜測。他說:「昨天有外部報道說,我們是因為外部壓力才堅持自研的,這是瞎猜。真實原因是希望團隊延遲滿足感,打好技術基礎,這對長期實現 AGI 很關鍵。

」這番話直接回應了市場上關於字節是否因競爭壓力而被迫自研的各種傳聞。從張一鳴到梁汝波,這次高層接連發聲,不只是單純的技術規劃,更像是一次完整的戰略宣告。對內,字節希望統一研發思路,讓團隊理解並接受長期投入的節奏;對外,則釋放明確訊號——字節無意跟隨其他公司的技術路線內卷,而是打算走出一條屬於自己的成長曲線。值得注意的是,字節跳動近期在 AI 領域動作頻繁。旗下 Seed 團隊先前才發布了 Seedance 2.5 音視頻聯合生成模型,主打「一鏡成片」,單次生成時長從 15 秒延長至 30 秒,並支持多輪無縫延長,讓複雜情節更連貫。

該模型深度優化材質、光影與膚質,有效消除過去 AI 生成影片常見的「塑膠感」,實現更接近真實拍攝的質感,並已陸續上線即夢 AI、豆包專業版,API 也接入火山方舟,覆蓋影視、廣告、教育、工業製造及自動駕駛等場景。這些產品層面的進展,與這次超大參數模型的討論相互呼應,顯示字節在 AI 領域的布局正從應用端一路延伸到最底層的模型研發。而張一鳴與梁汝波對「長期主義」與「延遲滿足感」的反覆強調,也讓外界看到字節在 AI 競賽中試圖跳脫短期榜單競爭、追求更根本技術突破的企圖心。不過,5 萬億參數的模型能否真正落地,以及訓練這樣規模的模型所需的算力、數據與成本,都是外界關注的焦點。

目前字節內部對此事仍保持低調,計畫也尚未有明確的發布時間表。但可以確定的是,字節跳動在 AI 大模型領域的野心,已經不再只是追趕,而是試圖透過一次跳躍式的投入,重新定義自己在這波 AI 競賽中的位置。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

38 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前