字節跳動討論訓練超5萬億參數大模型,規模或超國內現有最大模型
重點摘要
字節跳動正討論訓練參數規模超過5萬億的大語言模型,若落地將超越阿里通義千問與月之暗面Kimi K3,成為國內已知參數最大的模型。該項目仍處於早期階段,由Seed Foundation負責人項亮主導,並與預訓練數據負責人沈科合作推進,團隊正進行組織調整以支持超大規模訓練。
據《晚點 LatePost》報導,字節跳動內部正積極討論訓練一款參數規模超過五萬億的大語言模型。若此項目最終落地,其規模將一舉超越阿里巴巴通義千問 Qwen3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,成為目前中國境內已知參數規模最龐大的模型。不過,該項目目前仍處於早期規劃階段,最終是否會正式對外發布,尚存在不確定性。報導指出,這項超大規模模型計劃由字節跳動 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科攜手合作推進。
為了支撐這個極具挑戰性的項目,Seed 團隊內部正進行組織調整,包括重新梳理研發職責、優化資源配置,以全力支持超大規模模型的訓練工作。這也顯示字節跳動在基礎模型研發上的投入力度正在持續加深。資料顯示,項亮與沈科均為字節跳動人工智能與大模型研發體系中的關鍵人物,兩人皆出身於字節核心的「搜廣推」技術體系。項亮本科畢業於中國科學技術大學,博士階段就讀於中國科學院自動化研究所,於 2016 年加入字節跳動,曾負責機器學習中臺 AML 團隊,後續出任豆包大模型 Foundation 團隊負責人。沈科則於 2018 年從清華大學畢業後加入字節,目前主要負責大語言模型預訓練數據的相關工作。
近年來,國內外 AI 廠商持續擴大模型參數規模,並圍繞訓練數據、算力以及基礎架構展開激烈競爭,超大規模模型研發已成為頭部企業探索通用人工智能能力的重要方向。字節跳動此次佈局,也反映出中國大模型競爭正從應用層面的創新,進一步延伸至基礎模型能力的深度建設。業界普遍認為,模型參數規模的擴張,往往伴隨更強的推理能力與知識理解能力,但同時也對算力資源、數據品質與訓練效率提出更高要求。從市場格局來看,當前中國大模型領域的競爭已進入白熱化階段。阿里、月之暗面等廠商相繼推出超大規模模型,並在各自優勢領域持續迭代。
字節跳動若成功推出超過五萬億參數的模型,勢必將重新洗牌國內大模型市場的競爭格局,並對其他廠商形成壓力。不過,超大規模模型的訓練成本與技術難度極高,如何在有限資源下實現高效訓練,仍是字節跳動必須面對的課題。值得注意的是,字節跳動創辦人張一鳴日前在內部會議中強調,大模型研發需堅持長期主義與延遲滿足感,反對為短期榜單排名而利用他人模型輸出的蒸餾技術。他明確表示,即便暫時落後,Seed 團隊也絕不依賴蒸餾來改進模型。這番談話被外界視為字節跳動對 AI 研發倫理的態度表態,也為此次超大規模模型計劃定下基調。
業內分析指出,字節跳動在 AI 領域的佈局向來以應用見長,從抖音、今日頭條到豆包等產品,皆展現出強大的場景落地能力。然而,基礎模型的研發能力同樣至關重要,直接影響到未來 AI 應用的上限。此次 Seed 團隊的組織調整與資源重組,顯示字節跳動正試圖在基礎模型領域建立更深的技術護城河,以支撐其龐大的產品生態體系。隨著 AI 技術的快速演進,超大規模模型的訓練已成為全球科技巨頭競逐的焦點。字節跳動此次的規劃,不僅是對自身技術實力的考驗,也是對中國 AI 產業整體發展方向的觀察指標。未來,若該項目順利推進,將有望為中文大模型的發展樹立新的標竿,並進一步推動 AI 技術在更多領域的落地應用。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。