曝字節擬訓練超5萬億參數大模型 參數規模超Kimi K3

2026年8月7日 09:29
站內 AI 整理稿

據《晚點 LatePost》報導,字節跳動內部正在討論一項極具野心的大模型訓練計畫,擬打造一個參數規模超過 5 萬億的巨型語言模型。若此計畫順利推進,該模型將一舉超越阿里巴巴旗下通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面(Moonshot AI)Kimi 背後 K3 模型的 2.8 萬億參數,成為中國已知參數規模最大的大模型。這項討論目前仍處於早期階段,具體的訓練時間表、算力配置以及後續部署方案尚未對外公開,但消息一出已引發業界高度關注。字節跳動近年來在大模型領域的布局日趨積極。

從 2023 年推出「豆包」系列應用,到 2024 年成立專門的 AI 研究團隊,再到旗下火山引擎對外提供大模型服務,字節跳動的 AI 戰略已從單純的應用層快速向上游底層模型延伸。此次傳出參數規模超過 5 萬億的訓練計畫,意味著字節跳動不僅要與國內頭部模型廠商正面競爭,更企圖在參數規模這一關鍵指標上建立領先優勢。在中國大模型「軍備競賽」中,參數規模一直是外界衡量模型能力的重要標尺之一。阿里巴巴的 Qwen 3.8-Max 以 2.4 萬億參數在業界取得先發地位,隨後月之暗面推出的 K3 模型以 2.8 萬億參數刷新紀錄,成為國內已知參數最大的模型。

如今字節跳動若成功訓練出超 5 萬億參數模型,將使中國大模型的參數天花板直接翻倍,並可能帶動新一輪的算力需求與技術競爭。不過,參數規模並非模型能力的唯一決定因素。業界普遍認為,超大規模模型在訓練穩定性、推理成本、以及實際場景中的可用性上面臨巨大挑戰。以 GPT-4 為例,其參數規模傳聞在 1.8 萬億左右,但透過 MoE(混合專家)架構與優化訓練方法,取得了遠超單純參數量級的效果。字節跳動若採用類似技術路線,或許能在不增加過多算力負擔的情況下,實現更高效的模型能力提升。從字節跳動的業務生態來看,超大模型的訓練不僅是為了技術展示,更可能服務於其龐大的內容平台與商業化場景。

抖音、今日頭條、TikTok 等產品每天產生海量的用戶生成內容與互動數據,一個強大的底層模型能夠在推薦系統、內容理解、智能客服、廣告投放等多個環節帶來顯著效率提升。此外,火山引擎對外提供的模型服務也需要持續迭代參數規模與能力,以滿足企業客戶對更高性能 AI 的需求。值得注意的是,訓練超 5 萬億參數的模型需要極其龐大的算力資源與資金投入。目前國內算力供應仍受制於高端 GPU 進口限制,字節跳動是否已儲備足夠的 AI 晶片庫存,或轉向自研晶片與國產替代方案,將直接影響該計畫的可行性。

此前有消息指出,字節跳動已大量採購 NVIDIA H100 與 H800 系列 GPU,並積極布局雲端算力基礎設施,但具體規模仍屬商業機密。另一方面,監管環境也是不可忽視的因素。中國對生成式 AI 服務的監管框架已趨於完善,超大規模模型在訓練數據合規、內容安全、以及算法備案等方面都需要符合相關規定。字節跳動作為頭部互聯網平台,先前已有多款 AI 產品完成備案,此次若啟動超大模型訓練,勢必在合規層面做好充分準備。從時間線來看,目前討論尚處於早期階段,意味著距離實際訓練啟動乃至模型發布仍有相當長的路要走。業界推測,字節跳動可能先進行小規模的技術驗證與架構設計,再逐步擴大訓練規模。

月之暗面與阿里巴巴等競爭對手也不會坐視不管,很可能在近期公布各自的下一代模型規劃,讓這場大模型參數競賽更加白熱化。對於用戶與開發者而言,字節跳動的超大模型若成功落地,將帶來更強勁的 AI 能力,尤其是在多模態理解、長文本生成、複雜推理等高階任務上。同時,超大模型的推理成本如何控制,將直接影響其商業化應用的普及速度。字節跳動過去在成本控制與規模化運營上有豐富經驗,若能將超大模型的推理成本壓低至可接受範圍,將對整個行業產生深遠影響。總體而言,字節跳動擬訓練超 5 萬億參數大模型的消息,不僅是單一公司的技術動向,更反映了中國 AI 大模型領域從「百模大戰」進入「參數軍備賽」新階段的趨勢。

隨著各大廠商持續在參數規模、訓練效率、應用場景上展開競爭,中國大模型的整體水準有望在短期內躍升至世界前列。然而,參數規模的競賽能否轉化為實際的商業價值與用戶體驗提升,仍有待時間檢驗。

Related

相關文章

IT之家模型更新

鴻蒙 PC 生態首款 AI 編程智能體工作臺,阿里 Qoder 支持鴻蒙電腦

作者:沁滄(實習) 責編:沁滄 評論: 9 月 21 日消息,阿里 Qoder 今日宣佈,Qoder 登陸鴻蒙 PC 應用市場,是鴻蒙 PC 生態首款 AI 編程智能體工作臺。據介紹,Qoder 團隊與鴻蒙團隊緊密配合,重點解決了幾個關鍵問題:讓 Qoder 的完整任務閉環 —— 從理解意圖、拆解步驟、調用工具到交付結果 —— 在鴻蒙系統上流暢運行,確保核心體驗不打折。

3 小時前

百度文庫網盤宣佈AI辦公出海,庫庫AI全球月活超4000萬

通用智能體“庫庫AI”全球AI辦公月活已超4000萬,百度文庫網盤去年推出的海外一站式AI辦公平臺Oreate AI同步煥新為庫庫AI海外版“Kooko”,海外用戶一年內突破1000萬。作為百度文庫網盤三年前佈局的通用AI辦公產品,庫庫AI前身GenFlow於2025年4月上線1.

6 小時前
智東西模型更新

5499元起,vivo X500系列三機齊發:動態影像成核心戰略,首發2nm旗艦芯

作者 | 雲鵬 編輯 | 李水青 9月21日上海現場報道,剛剛vivo正式發佈X500系列手機,包括X500、X500 Pro、X500 Pro Max三款機型,起售價分別為5499元、6499元、6999元。 發佈會上,vivo副總裁、產品副總裁黃韜宣佈該系列是vivo影像進入下一個10年的開篇之作,並首次完整落地藍圖動態影像技術棧。 系統層面,OriginOS 7升級了不少AI個性化功能,比如用戶上傳一張寵物照片,AI即可生成高精度的3D建模萌寵互動主題。

7 小時前
智東西模型更新

公眾號插圖、秋招物料、潮玩設計,實測商湯SenseNova U1 Pro:生圖模型走向真實任務交付

作者 | 畢偉豪 編輯|漠影 時常會有人感慨,各種生圖模型讓人眼花繚亂,但一到真正交稿時,還是免不了反覆“抽卡”。好不容易挑到一張滿意的圖,改個字、換個元素,又得重新開始。 抽到一張好看的圖,和完成一項工作,畢竟不是一回事。 在真實工作中,做一張圖往往只是任務的一部分:公眾號文章需要封面和多張配圖,企業招聘需要海報、易拉寶、摺頁等一整套物料,設計過程中還可能隨時需要改文字、換人物服裝、調整局部元素。 這也意味著,辦公場景中的生圖需求,對模型提出的要求已經不只是畫面效果。

9 小時前

用 AI 造謠再收費刪帖:自媒體博主敲詐科技企業 230 萬元被抓

今年以來,上海警方共偵破涉企謠言案件百餘起,依法清理涉企不實信息 8.7 萬餘條;累計偵破涉企黑客類案件 68 起,抓獲犯罪嫌疑人 210 餘名。上海警方重點介紹了一起故意製造企業負面輿情、實施敲詐勒索的案件:犯罪嫌疑人針對一家剛剛宣佈獲得融資的科技企業,連續發佈十餘篇不實文章持續抹黑造謠,敲詐 230 萬元。

10 小時前