智東西生成式AI

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲

2026年8月7日 23:56
曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲

重點摘要

字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

站內 AI 整理稿

智東西(公眾號:zhidxcom) 作者 | 王涵 編輯 | 雲鵬 智東西8月7日報道,今天,英國《金融時報》援引知情人士報道,字節跳動正在訓練一個參數量高達10萬億的AI模型。而這一數字,在昨日晚間的晚點 LatePost獨家報道中還是“超5萬億”。即使是5萬億,這一模型的規模也已經超過目前中國已發佈的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10萬億,那字節的新模型規模將超越約有8萬億參數的Mythos 5。截至文章發表前,字節跳動未對此發表回應。

▲英國《金融時報》報道 據外媒報道,其中一位知情人士透露,字節的這一模型還處於早期階段,目前正在進行為期3到6個月的預訓練,如果一切順利,之後會進行微調併發布,具體的模型尺寸將在後期階段才能確定。另據晚點 LatePost報道,字節的新模型將由Seed Foundation負責人項亮主導,與大語言模型預訓練數據負責人沈科合作。字節這一“巨無霸”大模型的爆料,引起了不少外網網友的關注。有網友化用了漫威電影《蜘蛛俠》中的經典臺詞“With great power comes great responsibility.(能力越大責任越大)”,說“能力越大,競爭越大。

(AI)走到這一步並不讓人意外,如果他們的模型能像Kimi K3那樣持續進化,那就會逼著所有人都得加速追趕,否則只能出局。” ▲網友評論(來源:X) 還有網友認為:“10萬億參數(的模型)還沒正式推出,就已經改寫了推理的算賬邏輯。” ▲網友評論(來源:X) 此前,字節跳動將飛書團隊一分為二,產品團隊併入豆包,銷售線劃歸火山引擎。對這一拆分決定,晚點 LatePost報道,字節跳動創始人張一鳴在與Seed負責人吳永輝共同召開的Seed全員會上解釋稱,把火山引擎、飛書和豆包的資源整合到一起,是為了構築在算力和數據上的優勢。

▲字節跳動創始人張一鳴(來源:36氪) 在會上,張一鳴認可了編程(Coding)的關鍵地位。這一點,字節跳動CEO梁汝波在8月6日召開的字節年度全員會“All-Hands”上再次強調,據財新報道,他坦承豆包大模型在AI Coding方面並不算突出,還用Anthropic的Claude Code舉例。但張一鳴也提醒稱,編程只是眼下的熱點之一,要著眼其他領域。同時,張一鳴反對模型蒸餾,蒸餾能在短期內改善模型表現但本質上仍是在複製已有的能力。沿著這條路走,模型能力最多隻能不斷逼近對方,很難真正實現超越。張一鳴表態,即使不蒸餾意味著字節在技術上會短暫落後國內競爭對手,但也不想走捷徑。

模型蒸餾(Model distillation)是將一個大型、複雜的AI模型壓縮為更小、更快模型的過程,即通過訓練小型模型複製大型教師模型的知識和輸出。張一鳴還透露,過去幾年,字節已經在AI方向投入了很多,未來還會投入更多。結語:國內大模型迎來窗口期,字節跳動“雙線”進攻 Anthropic的Mythos 5因安全顧慮被暫時禁用,目前僅對經批准的組織開放;Fable 5此前也因安全問題被美國政府勒令”停服”。近期,OpenAI的模型同樣頻繁爆出不受控的安全問題。大洋彼岸的接連“暴雷”,給國內大模型的發展“撕”開了一個難得的窗口期。過去幾周,月之暗面的Kimi K3和阿里巴巴的Qwen 3.

8 Max在基準測試中表現搶眼,僅在某些領域落後於Anthropic的Fable 5,國內外開發者的反饋也相當積極。跑分之外,更值得關注的是下一階段的動作。英國《金融時報》報道,業內人士透露,多家中國實驗室正在訓練Fable 5規模的模型,而字節跳動幾乎是在這條賽道上押注最激進的一家。與阿里、騰訊等同行不同,字節跳動的AI大模型大多為閉源,但其最新的SeeDance模型在視頻生成領域已躋身全球最先進之列,面向消費者的AI應用豆包月活已達3.24億,是國內最受歡迎的AI應用。與飛書合併後,豆包也開始向B端市場衝刺。

一邊是產品端的B端加速,一邊是訓練端的激進規模與對Coding的強調,字節跳動開始“雙線進攻”。來源:英國《金融時報》、晚點 LatePost、財新

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前
IT之家生成式AI

王興興回應 DeepSeek 投資宇樹:將在三方面開展重點合作

宇樹科技即將在科創板上市,DeepSeek 參與戰略配售,獲配約 1.41 億元。宇樹科技 CEO 王興興表示,雙方將在通用人工智慧、高性能通用機器人及 AI 大模型三方面展開重點合作。王興興也透露,2025 年度宇樹科技人形機器人出貨量已超過 5,500 臺。

3 小時前