曝字節擬訓練超5萬億參數大模型 參數規模超Kimi K3

2026年8月7日 09:29

重點摘要

據《晚點 LatePost》報道,字節跳動正在討論訓練一個參數規模超 5 萬億的模型,它超過阿里的 Qwen 3.8-Max(2.4 萬億參數)和月之暗面的 K3(2.8 萬億參數),也是目前國內已知參數規模最大的模型。

站內 AI 整理稿

據《晚點 LatePost》報導,字節跳動內部正在討論一項極具野心的大模型訓練計畫,擬打造一個參數規模超過 5 萬億的巨型語言模型。若此計畫順利推進,該模型將一舉超越阿里巴巴旗下通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面(Moonshot AI)Kimi 背後 K3 模型的 2.8 萬億參數,成為中國已知參數規模最大的大模型。這項討論目前仍處於早期階段,具體的訓練時間表、算力配置以及後續部署方案尚未對外公開,但消息一出已引發業界高度關注。 字節跳動近年來在大模型領域的布局日趨積極。從 2023 年推出「豆包」系列應用,到 2024 年成立專門的 AI 研究團隊,再到旗下火山引擎對外提供大模型服務,字節跳動的 AI 戰略已從單純的應用層快速向上游底層模型延伸。此次傳出參數規模超過 5 萬億的訓練計畫,意味著字節跳動不僅要與國內頭部模型廠商正面競爭,更企圖在參數規模這一關鍵指標上建立領先優勢。 在中國大模型「軍備競賽」中,參數規模一直是外界衡量模型能力的重要標尺之一。阿里巴巴的 Qwen 3.8-Max 以 2.4 萬億參數在業界取得先發地位,隨後月之暗面推出的 K3 模型以 2.8 萬億參數刷新紀錄,成為國內已知參數最大的模型。如今字節跳動若成功訓練出超 5 萬億參數模型,將使中國大模型的參數天花板直接翻倍,並可能帶動新一輪的算力需求與技術競爭。 不過,參數規模並非模型能力的唯一決定因素。業界普遍認為,超大規模模型在訓練穩定性、推理成本、以及實際場景中的可用性上面臨巨大挑戰。以 GPT-4 為例,其參數規模傳聞在 1.8 萬億左右,但透過 MoE(混合專家)架構與優化訓練方法,取得了遠超單純參數量級的效果。字節跳動若採用類似技術路線,或許能在不增加過多算力負擔的情況下,實現更高效的模型能力提升。 從字節跳動的業務生態來看,超大模型的訓練不僅是為了技術展示,更可能服務於其龐大的內容平台與商業化場景。抖音、今日頭條、TikTok 等產品每天產生海量的用戶生成內容與互動數據,一個強大的底層模型能夠在推薦系統、內容理解、智能客服、廣告投放等多個環節帶來顯著效率提升。此外,火山引擎對外提供的模型服務也需要持續迭代參數規模與能力,以滿足企業客戶對更高性能 AI 的需求。 值得注意的是,訓練超 5 萬億參數的模型需要極其龐大的算力資源與資金投入。目前國內算力供應仍受制於高端 GPU 進口限制,字節跳動是否已儲備足夠的 AI 晶片庫存,或轉向自研晶片與國產替代方案,將直接影響該計畫的可行性。此前有消息指出,字節跳動已大量採購 NVIDIA H100 與 H800 系列 GPU,並積極布局雲端算力基礎設施,但具體規模仍屬商業機密。 另一方面,監管環境也是不可忽視的因素。中國對生成式 AI 服務的監管框架已趨於完善,超大規模模型在訓練數據合規、內容安全、以及算法備案等方面都需要符合相關規定。字節跳動作為頭部互聯網平台,先前已有多款 AI 產品完成備案,此次若啟動超大模型訓練,勢必在合規層面做好充分準備。 從時間線來看,目前討論尚處於早期階段,意味著距離實際訓練啟動乃至模型發布仍有相當長的路要走。業界推測,字節跳動可能先進行小規模的技術驗證與架構設計,再逐步擴大訓練規模。月之暗面與阿里巴巴等競爭對手也不會坐視不管,很可能在近期公布各自的下一代模型規劃,讓這場大模型參數競賽更加白熱化。 對於用戶與開發者而言,字節跳動的超大模型若成功落地,將帶來更強勁的 AI 能力,尤其是在多模態理解、長文本生成、複雜推理等高階任務上。同時,超大模型的推理成本如何控制,將直接影響其商業化應用的普及速度。字節跳動過去在成本控制與規模化運營上有豐富經驗,若能將超大模型的推理成本壓低至可接受範圍,將對整個行業產生深遠影響。 總體而言,字節跳動擬訓練超 5 萬億參數大模型的消息,不僅是單一公司的技術動向,更反映了中國 AI 大模型領域從「百模大戰」進入「參數軍備賽」新階段的趨勢。隨著各大廠商持續在參數規模、訓練效率、應用場景上展開競爭,中國大模型的整體水準有望在短期內躍升至世界前列。然而,參數規模的競賽能否轉化為實際的商業價值與用戶體驗提升,仍有待時間檢驗。

Related

相關文章

IT之家模型更新

阿里千問:推出定時任務、辦公助理、語音通話等多項新功能

首頁 > 智能時代>人工智能 阿里千問:推出定時任務、辦公助理、語音通話等多項新功能 2026/8/7 10:32:28 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 未央、山有扶蘇 的線索投遞! IT之家 8 月 7 日消息,千問 App 今日宣佈功能上新,推出思考研究、定時任務、辦公助理、語音通話、智能體廣場等多項新功能,同時支持最新旗艦模型 Qwen3.8-MAX。

剛剛
IT之家模型更新

消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成

首頁 > 智能時代>人工智能 消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成 2026/8/7 9:39:42 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 7 日消息,據路透社消息,兩位知情人士透露,阿里巴巴計劃向其下一代通義千問開源模型的大型商用用戶收取費用,要求從收益中抽取一定比例的分成。

剛剛

宇樹科技IPO戰略配售曝光:DeepSeek獲配93.3萬股,鎖定36個月

宇樹科技IPO戰略配售結果曝光,DeepSeek獲配93.33萬股,認購金額約1.41億元,鎖定期36個月;騰訊旗下公司亦獲配約90.33萬股。本次發行價150.8元,發行市值約609億元,募資總額約60.99億元,但市盈率與市銷率均高於同業平均,投資者需留意股價波動風險。

1 小時前4200
雷峰網模型更新

150.8元/股!宇樹科技超百名員工參與IPO「盛宴」,一批90後千萬富豪或將誕生;DeepSeek擬上調API服務定價;字節擬訓練超5萬億參數大模型

這篇消息聚焦「150.8元/股!宇樹科技超百名員工參與IPO「盛宴」,一批90後千萬富豪或將誕生;DeepSeek擬上調API服務定價;字節擬訓練超5萬億參數大模型」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

2 小時前
IT之家模型更新

國內已知最大規模!消息稱字節跳動正討論訓練超 5 萬億參數模型

首頁 > 智能時代>人工智能 國內已知最大規模!消息稱字節跳動正討論訓練超 5 萬億參數模型 2026/8/6 21:42:47 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,晚點 LatePost 今天(6 日)晚間爆料稱,字節跳動正在討論訓練一個參數規模超 5 萬億的模型,超過阿里的 Qwen 3.8-Max(2.4 萬億參數)和月之暗面的 K3(2.

5 小時前

AI辦公大戰,賣模型的DeepSeek們怎麼活?

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

6 小時前