曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲

(公眾號:zhidxcom) 作者 | 王涵 編輯 | 雲鵬 8月7日報道,今天,英國《金融時報》援引知情人士報道,字節跳動正在訓練一個參數量高達10萬億的AI模型。而這一數字,在昨日晚間的晚點 LatePost獨家報道中還是“超5萬億”。即使是5萬億,這一模型的規模也已經超過目前中國已發佈的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10萬億,那字節的新模型規模將超越約有8萬億參數的Mythos 5。截至文章發表前,字節跳動未對此發表回應。
▲英國《金融時報》報道 據外媒報道,其中一位知情人士透露,字節的這一模型還處於早期階段,目前正在進行為期3到6個月的預訓練,如果一切順利,之後會進行微調併發布,具體的模型尺寸將在後期階段才能確定。另據晚點 LatePost報道,字節的新模型將由Seed Foundation負責人項亮主導,與大語言模型預訓練數據負責人沈科合作。字節這一“巨無霸”大模型的爆料,引起了不少外網網友的關注。有網友化用了漫威電影《蜘蛛俠》中的經典臺詞“With great power comes great responsibility.(能力越大責任越大)”,說“能力越大,競爭越大。
(AI)走到這一步並不讓人意外,如果他們的模型能像Kimi K3那樣持續進化,那就會逼著所有人都得加速追趕,否則只能出局。” ▲網友評論(來源:X) 還有網友認為:“10萬億參數(的模型)還沒正式推出,就已經改寫了推理的算賬邏輯。” ▲網友評論(來源:X) 此前,字節跳動將飛書團隊一分為二,產品團隊併入豆包,銷售線劃歸火山引擎。對這一拆分決定,晚點 LatePost報道,字節跳動創始人張一鳴在與Seed負責人吳永輝共同召開的Seed全員會上解釋稱,把火山引擎、飛書和豆包的資源整合到一起,是為了構築在算力和數據上的優勢。
▲字節跳動創始人張一鳴(來源:36氪) 在會上,張一鳴認可了編程(Coding)的關鍵地位。這一點,字節跳動CEO梁汝波在8月6日召開的字節年度全員會“All-Hands”上再次強調,據財新報道,他坦承豆包大模型在AI Coding方面並不算突出,還用Anthropic的Claude Code舉例。但張一鳴也提醒稱,編程只是眼下的熱點之一,要著眼其他領域。同時,張一鳴反對模型蒸餾,蒸餾能在短期內改善模型表現但本質上仍是在複製已有的能力。沿著這條路走,模型能力最多隻能不斷逼近對方,很難真正實現超越。張一鳴表態,即使不蒸餾意味著字節在技術上會短暫落後國內競爭對手,但也不想走捷徑。
模型蒸餾(Model distillation)是將一個大型、複雜的AI模型壓縮為更小、更快模型的過程,即通過訓練小型模型複製大型教師模型的知識和輸出。張一鳴還透露,過去幾年,字節已經在AI方向投入了很多,未來還會投入更多。結語:國內大模型迎來窗口期,字節跳動“雙線”進攻 Anthropic的Mythos 5因安全顧慮被暫時禁用,目前僅對經批准的組織開放;Fable 5此前也因安全問題被美國政府勒令”停服”。近期,OpenAI的模型同樣頻繁爆出不受控的安全問題。大洋彼岸的接連“暴雷”,給國內大模型的發展“撕”開了一個難得的窗口期。過去幾周,月之暗面的Kimi K3和阿里巴巴的Qwen 3.
8 Max在基準測試中表現搶眼,僅在某些領域落後於Anthropic的Fable 5,國內外開發者的反饋也相當積極。跑分之外,更值得關注的是下一階段的動作。英國《金融時報》報道,業內人士透露,多家中國實驗室正在訓練Fable 5規模的模型,而字節跳動幾乎是在這條賽道上押注最激進的一家。與阿里、騰訊等同行不同,字節跳動的AI大模型大多為閉源,但其最新的SeeDance模型在視頻生成領域已躋身全球最先進之列,面向消費者的AI應用豆包月活已達3.24億,是國內最受歡迎的AI應用。與飛書合併後,豆包也開始向B端市場衝刺。
一邊是產品端的B端加速,一邊是訓練端的激進規模與對Coding的強調,字節跳動開始“雙線進攻”。來源:英國《金融時報》、晚點 LatePost、財新
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。