8萬億,梁文鋒也開始卷“超大”

字母榜2026.09.22 20:43 · 來自北京全文3463字00:00 / 10:03參數越大越氣派。文 | 字母榜DeepSeek也加入參數大競賽了。據The Information報道,DeepSeek目前正在訓練一個約2萬億參數的新模型;梁文鋒還在近期一場投資者會議上表示,公司下一步計劃繼續把模型推到8萬億參數。放在一年前,8萬億還是個難以想象的數字。但現在,Kimi K3已經做到2.8萬億參數;字節正在預訓練一個最高可能達到10萬億參數的新模型;阿里也公開表示,下一代模型將向5萬億到10萬億參數推進。
Anthropic並不公開模型參數,但FT此前援引業內估計稱,其最新旗艦Mythos 5大約就在8萬億參數左右。大模型兜了一圈,又開始比誰更大。只是這一次,大家卷的參數,已經不是上一輪Scaling裡的那種參數了。01DeepSeek今年4月發佈V4-Pro時,官方披露的規模是1.6萬億總參數、490億激活參數。8萬億的後續規劃,相當於V4-Pro的5倍。這事兒放在DeepSeek身上其實挺反常,畢竟DeepSeek去年給整個AI行業留下最深的印象,並不在參數上。它曾一度讓AI行業重新討論,也許前沿模型不需要無限燒GPU。
2024年底發佈V3時,DeepSeek特意把訓練賬單擺到了檯面上:6710億總參數、每個Token激活370億參數,完整訓練消耗278.8萬H800 GPU小時。按照每GPU小時2美元計算,官方給出的訓練成本只有557.6萬美元。這個數字,以及背後代表的效率,成了DeepSeek後來最重要的標籤之一。DeepSeek沒有OpenAI、Anthropic那樣充裕的先進GPU供應;公司過去也長期依賴梁文鋒旗下幻方量化自我輸血,不接受外部融資。它的條件決定了它的路線——既然錢和算力有限,就儘可能從架構、訓練和推理效率裡摳性能。但現在,條件變了。
DeepSeek今年6月剛完成成立以來首輪外部融資,募資約74億美元;目前第二輪約500億元人民幣(約75億美元)的融資已經進入最後敲定階段,對應估值約5000億元人民幣。如果本次融資順利完成,DeepSeek幾個月內累計外部融資將接近150億美元、約1000億元人民幣。與此同時,DeepSeek已聘請中信證券籌備科創板IPO,新增資本明確將用於算力基礎設施、模型開發和人才投入;9月21日,原高瓴創投合夥人嚴文韜正式加入DeepSeek並出任CFO,結束了公司成立三年來CFO一直空缺的狀態。
以前的DeepSeek,是在有限的錢和算力裡儘可能把模型做好;現在融資、上市都在往前推,手裡的錢多了,算力也能跟著往上堆。有條件以後,DeepSeek也開始大膽卷參數了。這和追求效率其實並不衝突,效率高了,同樣的錢能把規模做得更大。02最近兩個月,前沿模型的總參數規模正在明顯往上抬。把這輪競賽重新推到聚光燈下的,是月之暗面。今年7月,Kimi K3做到了2.8萬億總參數、1040億激活參數。K3至今仍是已經正式發佈、參數規模最大的開放權重模型。它不只是大。官方評測裡,K3的GPQA Diamond達到93.5,Terminal-Bench 2.1達到88.3,已經和同期GPT-5.
6 Sol、Claude Fable 5打得很近。規模做到了數萬億,性能也做到了第一梯隊。8月,字節被曝要做個更大的。8月6日,《晚點 LatePost》率先披露,字節正在討論訓練一個超過5萬億參數的新模型,由Seed Foundation負責人項亮主導。據報道,字節內部似乎認為,與其在現有尺寸上繼續追趕,不如一次把參數規模推到同行數倍。一天後,8月7日,FT援引知情人士報道稱,字節正在預訓練的新模型規模最高可能達到10萬億參數;路透社跟進時,還拿它與Anthropic最前沿的Mythos相比——後者雖然從未公開參數規模,但業內估計已經達到約8萬億。
字節的新模型如果做到10T,將超過Mythos目前流傳的規模。現在,5T以上的超大參數量又開始反覆出現在前沿模型的討論裡。今天,阿里CEO吳泳銘公開宣佈,下一代模型計劃做到5萬億到10萬億參數;DeepSeek則在訓練2T模型的同時,把後續目標放到了8T。可以理解為,頭部實驗室重新把更大的總參數規模當成了衝擊能力上限的一條重要路線。就連不公開參數的美國閉源模型也逃不開外界的審視,Anthropic的Mythos被外界估到8T;OpenAI從GPT-4時代起就不再公開模型規模,但社區流傳著Astra達到了10T級MoE的說法。
參數量從未失去吸引力,如同遊戲面板上的戰力值——人們知道它不能代表全部,但它永遠是最直觀、最有壓迫感的那個數字。大模型行業其實有段時間不太愛談參數。這兩年,蒸餾、小模型、MoE、強化學習和推理時計算輪番上陣,比起炫耀自己有幾千億、幾萬億參數,模型廠商更願意講性能、成本和效率。單純把模型做大,很容易顯得有錢沒地方燒。時至今日,參數量被重新抬了上來,又一次成為了前沿模型的“排面”。不過,今天的5T、8T、10T,和上一輪Scaling裡的“參數越多,模型越大”,已經不是同一回事了。03參數量能重新上桌,最直接的原因是超大模型的主流架構變了。
過去的大模型,主流還是Dense架構,參數規模和計算量基本綁在一起。簡單說,就是模型裡有多少參數,每次計算基本都得一起上。參數越多,能力上限往往越高,但訓練和推理成本也跟著往上漲。現在,越來越多超大模型用的是MoE,Mixture of Experts,混合專家架構。它更像一家養了很多專家的公司,模型可以擁有幾百、幾千個專家,但每次任務只挑其中一小部分上班。比如Kimi K3有2.8T總參數,但每個Token只激活104B,大約3.7%;DeepSeek V4-Pro有1.6T總參數,每個Token只激活49B,大約3%。
所以今天說一個模型有5T、8T甚至10T參數,並不意味著它每生成一個Token都要跑完這10T參數。模型能裝多少,和每次要算多少,變成了兩個不同的數字。參數可以理解成模型用來承載知識、模式和能力的空間。總參數越大,模型理論上就有更大的空間去學習更多、更復雜的分佈;MoE又允許它只在需要的時候調用其中一部分。於是,模型可以繼續增加總參數的容量,而不需要讓每一次計算都同比變重。依然拿K3舉例,它把總參數做到2.8T,規模約是K2.5的3倍,但896個專家裡,每個Token只激活16個。月之暗面稱,靠更稀疏的MoE和一系列架構優化,K3的整體Scaling效率相比K2提升了約2.5倍。
而Agent時代,恰好又把這種“容量”重新推到了競爭中心。過去衡量一個Chatbot,能力往往是一項一項測的。數學看數學,代碼看代碼,問答看知識。模型在幾個關鍵Benchmark上把峰值做高,就足以證明自己很強。但Agent把這些能力串進了同一條任務鏈。一個真實的長任務,可能從搜索資料開始,中間讀網頁、看圖片、寫代碼、調用終端,再遇到報錯、修改方案、調用別的工具,甚至把子任務分給其他Agent。OpenAI今年9月發佈Agents API時,就把長時間運行、上下文管理、工具使用和子Agent協調直接列成了Agent的核心基礎設施,並強調Agent需要可靠運行數小時甚至數天。
一次問答裡,某項能力偶爾失手可能只丟一道題;幾十步、上百步的Agent任務裡,任何一個薄弱環節都可能中斷整條鏈路。任務越長,對能力覆蓋面和穩定性的要求就越高。前沿競爭因此開始出現明顯的“木桶效應”。METR現在甚至直接用“任務時間跨度”衡量Agent能力,因為任務越長,對模型持續完成一連串不同操作的要求越高。Chatbot時代更容易看到能力峰值,Agent時代開始越來越看能力覆蓋面。這時候,更大的參數容量就有了新的價值。任務越長,模型越不能偏科;Agent能做的事情越多,底座需要覆蓋的能力就越廣。MoE打開了容量繼續擴張的空間,Agent則把容量的價值進一步放大。
於是,模型廠商一邊拼命提高效率,一邊又重新把參數往5T、8T、10T推。省下來的算力並沒有讓Scaling消失,反而給Scaling騰出了新的空間。
Related
相關文章
Anthropic上線Claude Opus 5.5 ,任務成本大降 40%
Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。其中三項編程測試(Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0)均拿下最高分,分別為 66.4%、54.4% 和 57.

後摩智能確認其下代大模型端邊 AI 芯片採用 3D CIM 存算一體架構
作者:溯波(實習) 責編:溯波 評論: 9 月 22 日消息,後摩智能 (HOUMO.AI) 在近日舉行的 2026 全球 AI 芯片峰會上確認,該公司下代大模型端邊 AI 芯片將採用 3D CIM 存算一體架構,結合融合存算與 3D DRAM 技術。
剛剛,高通2nm雙旗艦來了,為智能體AI重造架構,手機能跑300億參數大模型
作者 | ZeR0 編輯 | 漠影 剛剛,高通最強手機芯片來了!夏威夷毛伊島9月22日現場報道,在驍龍峰會2026上,高通一口氣推出兩款採用2nm製程的旗艦芯片——第六代驍龍8超級至尊版和第六代驍龍8至尊版。這是高通首次在旗艦產品線同時推出兩款驍龍8至尊版平臺,也是驍龍平臺首次採用2nm製程。

拿下 2 億日活躍用戶後,消息稱字節跳動豆包收縮對話團隊
作者:清源 責編:清源 評論: 9 月 22 日消息,《晚點 LatePost》今天(22 日)晚間發佈消息稱,豆包通用 Session 團隊正在減員,規模預計減半。該團隊此前約有 50 人,一度是豆包內規模最大的團隊,主要負責豆包的對話(Chat)產品能力,包括策略、評測等工作。

聯合國秘書長古特雷斯呼籲全球監管人工智能,避免出現殺人機器人
作者:遠洋 責編:遠洋 評論: 9 月 22 日消息,據彭博社報道,聯合國秘書長進一步呼籲對人工智能實施監管,以避免出現企業權力氾濫、殺人機器人橫行的反烏托邦未來。安東尼奧 · 古特雷斯(Antonio Guterres)在聯合國大會上向各國領導人發表卸任前最後一次講話,就人工智能的各類風險發出警示。

OPPO 推出“AI 心力球”可穿戴新品,體驗價 499 元
作者:潞源 責編:潞源 評論: 感謝網友 Autumn_Dream、野原小哀、files 的線索投遞!9 月 22 日消息,OPPO 今天召開新品發佈會,除了推出 Find X10 系列手機新品以外,OPPO 本次還帶來了全新品類穿戴產品“AI 心力球”。