曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲

2026年8月7日 23:56
曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
站內 AI 整理稿

(公眾號:zhidxcom) 作者 | 王涵 編輯 | 雲鵬 8月7日報道,今天,英國《金融時報》援引知情人士報道,字節跳動正在訓練一個參數量高達10萬億的AI模型。而這一數字,在昨日晚間的晚點 LatePost獨家報道中還是“超5萬億”。即使是5萬億,這一模型的規模也已經超過目前中國已發佈的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10萬億,那字節的新模型規模將超越約有8萬億參數的Mythos 5。截至文章發表前,字節跳動未對此發表回應。

▲英國《金融時報》報道 據外媒報道,其中一位知情人士透露,字節的這一模型還處於早期階段,目前正在進行為期3到6個月的預訓練,如果一切順利,之後會進行微調併發布,具體的模型尺寸將在後期階段才能確定。另據晚點 LatePost報道,字節的新模型將由Seed Foundation負責人項亮主導,與大語言模型預訓練數據負責人沈科合作。字節這一“巨無霸”大模型的爆料,引起了不少外網網友的關注。有網友化用了漫威電影《蜘蛛俠》中的經典臺詞“With great power comes great responsibility.(能力越大責任越大)”,說“能力越大,競爭越大。

(AI)走到這一步並不讓人意外,如果他們的模型能像Kimi K3那樣持續進化,那就會逼著所有人都得加速追趕,否則只能出局。” ▲網友評論(來源:X) 還有網友認為:“10萬億參數(的模型)還沒正式推出,就已經改寫了推理的算賬邏輯。” ▲網友評論(來源:X) 此前,字節跳動將飛書團隊一分為二,產品團隊併入豆包,銷售線劃歸火山引擎。對這一拆分決定,晚點 LatePost報道,字節跳動創始人張一鳴在與Seed負責人吳永輝共同召開的Seed全員會上解釋稱,把火山引擎、飛書和豆包的資源整合到一起,是為了構築在算力和數據上的優勢。

▲字節跳動創始人張一鳴(來源:36氪) 在會上,張一鳴認可了編程(Coding)的關鍵地位。這一點,字節跳動CEO梁汝波在8月6日召開的字節年度全員會“All-Hands”上再次強調,據財新報道,他坦承豆包大模型在AI Coding方面並不算突出,還用Anthropic的Claude Code舉例。但張一鳴也提醒稱,編程只是眼下的熱點之一,要著眼其他領域。同時,張一鳴反對模型蒸餾,蒸餾能在短期內改善模型表現但本質上仍是在複製已有的能力。沿著這條路走,模型能力最多隻能不斷逼近對方,很難真正實現超越。張一鳴表態,即使不蒸餾意味著字節在技術上會短暫落後國內競爭對手,但也不想走捷徑。

模型蒸餾(Model distillation)是將一個大型、複雜的AI模型壓縮為更小、更快模型的過程,即通過訓練小型模型複製大型教師模型的知識和輸出。張一鳴還透露,過去幾年,字節已經在AI方向投入了很多,未來還會投入更多。結語:國內大模型迎來窗口期,字節跳動“雙線”進攻 Anthropic的Mythos 5因安全顧慮被暫時禁用,目前僅對經批准的組織開放;Fable 5此前也因安全問題被美國政府勒令”停服”。近期,OpenAI的模型同樣頻繁爆出不受控的安全問題。大洋彼岸的接連“暴雷”,給國內大模型的發展“撕”開了一個難得的窗口期。過去幾周,月之暗面的Kimi K3和阿里巴巴的Qwen 3.

8 Max在基準測試中表現搶眼,僅在某些領域落後於Anthropic的Fable 5,國內外開發者的反饋也相當積極。跑分之外,更值得關注的是下一階段的動作。英國《金融時報》報道,業內人士透露,多家中國實驗室正在訓練Fable 5規模的模型,而字節跳動幾乎是在這條賽道上押注最激進的一家。與阿里、騰訊等同行不同,字節跳動的AI大模型大多為閉源,但其最新的SeeDance模型在視頻生成領域已躋身全球最先進之列,面向消費者的AI應用豆包月活已達3.24億,是國內最受歡迎的AI應用。與飛書合併後,豆包也開始向B端市場衝刺。

一邊是產品端的B端加速,一邊是訓練端的激進規模與對Coding的強調,字節跳動開始“雙線進攻”。來源:英國《金融時報》、晚點 LatePost、財新

Related

相關文章

智東西生成式AI

一文看懂昇騰超節點:AI Infra已進入系統工程階段

(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

29 分鐘前
鈦媒體生成式AI

Anew labs,“蒸餾”的行家

醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

4 小時前

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上

Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。

4 小時前