字節跳動討論訓練超5萬億參數大模型,規模或超國內現有最大模型
重點摘要
字節跳動正討論訓練參數規模超過5萬億的大語言模型,若落地將超越阿里通義千問與月之暗面Kimi K3,成為國內已知參數最大的模型。該項目仍處於早期階段,由Seed Foundation負責人項亮主導,並與預訓練數據負責人沈科合作推進,團隊正進行組織調整以支持超大規模訓練。
據《晚點 LatePost》報導,字節跳動內部正積極討論訓練一款參數規模超過五萬億的大語言模型。若此項目最終落地,其規模將一舉超越阿里巴巴通義千問 Qwen3.8-Max 的 2.4 萬億參數,以及月之暗面 Kimi K3 的 2.8 萬億參數,成為目前中國境內已知參數規模最龐大的模型。不過,該項目目前仍處於早期規劃階段,最終是否會正式對外發布,尚存在不確定性。 報導指出,這項超大規模模型計劃由字節跳動 Seed Foundation 負責人項亮主導,並與大語言模型預訓練數據負責人沈科攜手合作推進。為了支撐這個極具挑戰性的項目,Seed 團隊內部正進行組織調整,包括重新梳理研發職責、優化資源配置,以全力支持超大規模模型的訓練工作。這也顯示字節跳動在基礎模型研發上的投入力度正在持續加深。 資料顯示,項亮與沈科均為字節跳動人工智能與大模型研發體系中的關鍵人物,兩人皆出身於字節核心的「搜廣推」技術體系。項亮本科畢業於中國科學技術大學,博士階段就讀於中國科學院自動化研究所,於 2016 年加入字節跳動,曾負責機器學習中臺 AML 團隊,後續出任豆包大模型 Foundation 團隊負責人。沈科則於 2018 年從清華大學畢業後加入字節,目前主要負責大語言模型預訓練數據的相關工作。 近年來,國內外 AI 廠商持續擴大模型參數規模,並圍繞訓練數據、算力以及基礎架構展開激烈競爭,超大規模模型研發已成為頭部企業探索通用人工智能能力的重要方向。字節跳動此次佈局,也反映出中國大模型競爭正從應用層面的創新,進一步延伸至基礎模型能力的深度建設。業界普遍認為,模型參數規模的擴張,往往伴隨更強的推理能力與知識理解能力,但同時也對算力資源、數據品質與訓練效率提出更高要求。 從市場格局來看,當前中國大模型領域的競爭已進入白熱化階段。阿里、月之暗面等廠商相繼推出超大規模模型,並在各自優勢領域持續迭代。字節跳動若成功推出超過五萬億參數的模型,勢必將重新洗牌國內大模型市場的競爭格局,並對其他廠商形成壓力。不過,超大規模模型的訓練成本與技術難度極高,如何在有限資源下實現高效訓練,仍是字節跳動必須面對的課題。 值得注意的是,字節跳動創辦人張一鳴日前在內部會議中強調,大模型研發需堅持長期主義與延遲滿足感,反對為短期榜單排名而利用他人模型輸出的蒸餾技術。他明確表示,即便暫時落後,Seed 團隊也絕不依賴蒸餾來改進模型。這番談話被外界視為字節跳動對 AI 研發倫理的態度表態,也為此次超大規模模型計劃定下基調。 業內分析指出,字節跳動在 AI 領域的佈局向來以應用見長,從抖音、今日頭條到豆包等產品,皆展現出強大的場景落地能力。然而,基礎模型的研發能力同樣至關重要,直接影響到未來 AI 應用的上限。此次 Seed 團隊的組織調整與資源重組,顯示字節跳動正試圖在基礎模型領域建立更深的技術護城河,以支撐其龐大的產品生態體系。 隨著 AI 技術的快速演進,超大規模模型的訓練已成為全球科技巨頭競逐的焦點。字節跳動此次的規劃,不僅是對自身技術實力的考驗,也是對中國 AI 產業整體發展方向的觀察指標。未來,若該項目順利推進,將有望為中文大模型的發展樹立新的標竿,並進一步推動 AI 技術在更多領域的落地應用。
Related
相關文章

PPIO正式發佈“Fusion融合模型”:用十分之一的價格超越頂級模型的智商
PPIO正式推出Fusion融合模型,透過智能模型網關將複雜任務分派給多個專家模型並行作答,再經由思考編排與交叉驗證融合出最終答案,以提升回答品質並控制成本。在DRACO深度研究基準測試中,Fusion以三個開源模型融合後的評分超越Claude Fable 5,成本僅為其十分之一,證明智能增量可來自調用層的組織方式。此技術旨在解決單一模型偏科與幻覺問題,並已驗證於大規模Token調用場景,為Agent時代提供更聰明且經濟的模型使用方案。

DeepSeek V4 Flash低價斬殺線背後:當梁文鋒也卷不動算力賬單(含實測)
DeepSeek V4 Flash低價斬殺線背後:當梁文鋒也卷不動算力賬單(含實測)大模型之家2026.08.07 09:32 · 來自北京全文3964字00:00 / 10:31“低價”往往是擊穿同行防禦最鋒利的武器,但它也是最先傷到自己的一把雙刃劍。文 | 大模型之家 8月6日,DeepSeek在用戶後臺突然發佈調價預告,宣佈計劃在近期對全部API接口服務進行整體提價,且預計漲幅較大。

輸入法牌桌,要被豆包和千問掀了?
豆包與千問近期推出輸入法產品,將生成式AI直接嵌入打字流程,使輸入法從被動鍵盤升級為主動寫作助手,重新定義其價值。儘管AI功能帶來差異化,但用戶長期累積的個人詞庫與使用習慣形成高替換成本,短期內難以撼動既有市場格局。然而,此舉將迫使搜狗、百度等傳統廠商加速整合大模型能力,以免在下一輪競爭中失去主動權。

Edge AI Daily 早報(8月7日)
Edge AI Daily 早報(8月7日)Edge AI Daily2026.08.07 08:24 · 來自北京全文6732字00:00 / 17:39Adobe集成ChatGPT開啟對話創意;Mirendil押注算力;法國電銷禁令;Hugging Face數據危機與對齊裂痕;LG開源回收模型;微軟裁員聚焦AI;Prime Agent ARC反超人類;辛頓警告成真,AI自主突破沙箱;谷歌收購Mechanize;蘋果Passkey洩露IP;谷歌印度項目環保爭議;WindBorne獨家數據優勢;2.5B模型蒸餾縫合教師優勢。硅谷前沿:一、Adobe把70款工具塞進ChatGPT,創意王座讓位給對話1.戰略轉向:Adobe將70餘款核心工具(Photoshop、Premiere、Firefly等)打包為ChatGPT插件,用戶通過“@Adobe”指令即可調用,免登錄可用基礎功能,登錄Creative Cloud後解鎖生成式AI與雲端同步。此舉標誌著創意軟件從“應用即界面”向“對話即界面”轉型,Adobe選擇寄生在ChatGPT(月活超10億)的對話界面中,而非自建AI平臺。2.競爭壓力與渠道策略:Adobe面臨Canva(月活2.65億)和Figma的低門檻夾擊,同時ChatGPT正成為用戶工作起點。Adobe的解法是放棄爭奪界面層,轉而成為ChatGPT背後的創意引擎,通過免費增值漏斗將觸達規模擴大至10億級用戶,類似2011年從盒裝軟件轉向訂閱制的戰略級基礎設施遷移。3.全平臺覆蓋與風險:Adobe同步向Claude、Copilot、Slack、Gemini擴展集成,旨在成為所有AI平臺的底層創意引擎。但風險在於對ChatGPT平臺的不可控依賴,且聊天界面的“請求-響應”模式天然不適合像素級精修等深度創作,插件當前主要爭奪“輕創意”市場,專業用戶仍需桌面應用完成複雜操作。

AMD 宣佈計劃收購 Taalas 公司,補強 AI 推理芯片路線圖
AMD 於 8 月 7 日宣布計劃收購 AI 推理芯片初創公司 Taalas,該公司專注於為特定 AI 模型打造客製化加速器,以犧牲通用性換取更低成本與更高輸出速度。Taalas 的技術基於 Meta 的 Llama 3.1 模型,採用台積電成熟製程與高速 SRAM,其推理速度可比傳統 GPU 快數千倍,但無法後續升級。交易金額未公開,但 Taalas 自 2023 年成立以來已累計獲得 2.19 億美元風險投資。

剛剛,GPT-5.6全員免費!下一代巨獸Astra打響閃電戰
OpenAI宣布GPT-5.6 Luna的文本對話功能全面免費開放,並為免費版新增「Think」按鈕,同時升級最強模型Sol,統一快慢思考模式並降低事實錯誤率。此外,爆料指出OpenAI可能在下週推出下一代大型模型Astra,其規模號稱是史上最大,目標是挑戰Anthropic的Fable 5。