曝字節擬訓練超5萬億參數大模型 參數規模超Kimi K3
重點摘要
據《晚點 LatePost》報道,字節跳動正在討論訓練一個參數規模超 5 萬億的模型,它超過阿里的 Qwen 3.8-Max(2.4 萬億參數)和月之暗面的 K3(2.8 萬億參數),也是目前國內已知參數規模最大的模型。
據《晚點 LatePost》報導,字節跳動內部正在討論一項極具野心的大模型訓練計畫,擬打造一個參數規模超過 5 萬億的巨型語言模型。若此計畫順利推進,該模型將一舉超越阿里巴巴旗下通義千問 Qwen 3.8-Max 的 2.4 萬億參數,以及月之暗面(Moonshot AI)Kimi 背後 K3 模型的 2.8 萬億參數,成為中國已知參數規模最大的大模型。這項討論目前仍處於早期階段,具體的訓練時間表、算力配置以及後續部署方案尚未對外公開,但消息一出已引發業界高度關注。字節跳動近年來在大模型領域的布局日趨積極。
從 2023 年推出「豆包」系列應用,到 2024 年成立專門的 AI 研究團隊,再到旗下火山引擎對外提供大模型服務,字節跳動的 AI 戰略已從單純的應用層快速向上游底層模型延伸。此次傳出參數規模超過 5 萬億的訓練計畫,意味著字節跳動不僅要與國內頭部模型廠商正面競爭,更企圖在參數規模這一關鍵指標上建立領先優勢。在中國大模型「軍備競賽」中,參數規模一直是外界衡量模型能力的重要標尺之一。阿里巴巴的 Qwen 3.8-Max 以 2.4 萬億參數在業界取得先發地位,隨後月之暗面推出的 K3 模型以 2.8 萬億參數刷新紀錄,成為國內已知參數最大的模型。
如今字節跳動若成功訓練出超 5 萬億參數模型,將使中國大模型的參數天花板直接翻倍,並可能帶動新一輪的算力需求與技術競爭。不過,參數規模並非模型能力的唯一決定因素。業界普遍認為,超大規模模型在訓練穩定性、推理成本、以及實際場景中的可用性上面臨巨大挑戰。以 GPT-4 為例,其參數規模傳聞在 1.8 萬億左右,但透過 MoE(混合專家)架構與優化訓練方法,取得了遠超單純參數量級的效果。字節跳動若採用類似技術路線,或許能在不增加過多算力負擔的情況下,實現更高效的模型能力提升。從字節跳動的業務生態來看,超大模型的訓練不僅是為了技術展示,更可能服務於其龐大的內容平台與商業化場景。
抖音、今日頭條、TikTok 等產品每天產生海量的用戶生成內容與互動數據,一個強大的底層模型能夠在推薦系統、內容理解、智能客服、廣告投放等多個環節帶來顯著效率提升。此外,火山引擎對外提供的模型服務也需要持續迭代參數規模與能力,以滿足企業客戶對更高性能 AI 的需求。值得注意的是,訓練超 5 萬億參數的模型需要極其龐大的算力資源與資金投入。目前國內算力供應仍受制於高端 GPU 進口限制,字節跳動是否已儲備足夠的 AI 晶片庫存,或轉向自研晶片與國產替代方案,將直接影響該計畫的可行性。
此前有消息指出,字節跳動已大量採購 NVIDIA H100 與 H800 系列 GPU,並積極布局雲端算力基礎設施,但具體規模仍屬商業機密。另一方面,監管環境也是不可忽視的因素。中國對生成式 AI 服務的監管框架已趨於完善,超大規模模型在訓練數據合規、內容安全、以及算法備案等方面都需要符合相關規定。字節跳動作為頭部互聯網平台,先前已有多款 AI 產品完成備案,此次若啟動超大模型訓練,勢必在合規層面做好充分準備。從時間線來看,目前討論尚處於早期階段,意味著距離實際訓練啟動乃至模型發布仍有相當長的路要走。業界推測,字節跳動可能先進行小規模的技術驗證與架構設計,再逐步擴大訓練規模。
月之暗面與阿里巴巴等競爭對手也不會坐視不管,很可能在近期公布各自的下一代模型規劃,讓這場大模型參數競賽更加白熱化。對於用戶與開發者而言,字節跳動的超大模型若成功落地,將帶來更強勁的 AI 能力,尤其是在多模態理解、長文本生成、複雜推理等高階任務上。同時,超大模型的推理成本如何控制,將直接影響其商業化應用的普及速度。字節跳動過去在成本控制與規模化運營上有豐富經驗,若能將超大模型的推理成本壓低至可接受範圍,將對整個行業產生深遠影響。總體而言,字節跳動擬訓練超 5 萬億參數大模型的消息,不僅是單一公司的技術動向,更反映了中國 AI 大模型領域從「百模大戰」進入「參數軍備賽」新階段的趨勢。
隨著各大廠商持續在參數規模、訓練效率、應用場景上展開競爭,中國大模型的整體水準有望在短期內躍升至世界前列。然而,參數規模的競賽能否轉化為實際的商業價值與用戶體驗提升,仍有待時間檢驗。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。