字節跳動討論訓練超5萬億參數大模型,規模或超國內現有最大模型
據《晚點 LatePost》報導,字節跳動內部正積極討論訓練一款參數規模超過五萬億的大語言模型。若此項目最終落地,其規模將一舉超越阿里巴巴通義千問 Qwen3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,成為目前中國境內已知參數規模最龐大的模型。不過,該項目目前仍處於早期規劃階段,最終是否會正式對外發布,尚存在不確定性。報導指出,這項超大規模模型計劃由字節跳動 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科攜手合作推進。
為了支撐這個極具挑戰性的項目,Seed 團隊內部正進行組織調整,包括重新梳理研發職責、優化資源配置,以全力支持超大規模模型的訓練工作。這也顯示字節跳動在基礎模型研發上的投入力度正在持續加深。資料顯示,項亮與沈科均為字節跳動人工智能與大模型研發體系中的關鍵人物,兩人皆出身於字節核心的「搜廣推」技術體系。項亮本科畢業於中國科學技術大學,博士階段就讀於中國科學院自動化研究所,於 2016 年加入字節跳動,曾負責機器學習中臺 AML 團隊,後續出任豆包大模型 Foundation 團隊負責人。沈科則於 2018 年從清華大學畢業後加入字節,目前主要負責大語言模型預訓練數據的相關工作。
近年來,國內外 AI 廠商持續擴大模型參數規模,並圍繞訓練數據、算力以及基礎架構展開激烈競爭,超大規模模型研發已成為頭部企業探索通用人工智能能力的重要方向。字節跳動此次佈局,也反映出中國大模型競爭正從應用層面的創新,進一步延伸至基礎模型能力的深度建設。業界普遍認為,模型參數規模的擴張,往往伴隨更強的推理能力與知識理解能力,但同時也對算力資源、數據品質與訓練效率提出更高要求。從市場格局來看,當前中國大模型領域的競爭已進入白熱化階段。阿里、月之暗面等廠商相繼推出超大規模模型,並在各自優勢領域持續迭代。
字節跳動若成功推出超過五萬億參數的模型,勢必將重新洗牌國內大模型市場的競爭格局,並對其他廠商形成壓力。不過,超大規模模型的訓練成本與技術難度極高,如何在有限資源下實現高效訓練,仍是字節跳動必須面對的課題。值得注意的是,字節跳動創辦人張一鳴日前在內部會議中強調,大模型研發需堅持長期主義與延遲滿足感,反對為短期榜單排名而利用他人模型輸出的蒸餾技術。他明確表示,即便暫時落後,Seed 團隊也絕不依賴蒸餾來改進模型。這番談話被外界視為字節跳動對 AI 研發倫理的態度表態,也為此次超大規模模型計劃定下基調。
業內分析指出,字節跳動在 AI 領域的佈局向來以應用見長,從抖音、今日頭條到豆包等產品,皆展現出強大的場景落地能力。然而,基礎模型的研發能力同樣至關重要,直接影響到未來 AI 應用的上限。此次 Seed 團隊的組織調整與資源重組,顯示字節跳動正試圖在基礎模型領域建立更深的技術護城河,以支撐其龐大的產品生態體系。隨著 AI 技術的快速演進,超大規模模型的訓練已成為全球科技巨頭競逐的焦點。字節跳動此次的規劃,不僅是對自身技術實力的考驗,也是對中國 AI 產業整體發展方向的觀察指標。未來,若該項目順利推進,將有望為中文大模型的發展樹立新的標竿,並進一步推動 AI 技術在更多領域的落地應用。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。