8萬億,梁文鋒也開始卷“超大”

2026年9月22日 20:45
8萬億,梁文鋒也開始卷“超大”
站內 AI 整理稿

字母榜2026.09.22 20:43 · 來自北京全文3463字00:00 / 10:03參數越大越氣派。文 | 字母榜DeepSeek也加入參數大競賽了。據The Information報道,DeepSeek目前正在訓練一個約2萬億參數的新模型;梁文鋒還在近期一場投資者會議上表示,公司下一步計劃繼續把模型推到8萬億參數。放在一年前,8萬億還是個難以想象的數字。但現在,Kimi K3已經做到2.8萬億參數;字節正在預訓練一個最高可能達到10萬億參數的新模型;阿里也公開表示,下一代模型將向5萬億到10萬億參數推進。

Anthropic並不公開模型參數,但FT此前援引業內估計稱,其最新旗艦Mythos 5大約就在8萬億參數左右。大模型兜了一圈,又開始比誰更大。只是這一次,大家卷的參數,已經不是上一輪Scaling裡的那種參數了。01DeepSeek今年4月發佈V4-Pro時,官方披露的規模是1.6萬億總參數、490億激活參數。8萬億的後續規劃,相當於V4-Pro的5倍。這事兒放在DeepSeek身上其實挺反常,畢竟DeepSeek去年給整個AI行業留下最深的印象,並不在參數上。它曾一度讓AI行業重新討論,也許前沿模型不需要無限燒GPU。

2024年底發佈V3時,DeepSeek特意把訓練賬單擺到了檯面上:6710億總參數、每個Token激活370億參數,完整訓練消耗278.8萬H800 GPU小時。按照每GPU小時2美元計算,官方給出的訓練成本只有557.6萬美元。這個數字,以及背後代表的效率,成了DeepSeek後來最重要的標籤之一。DeepSeek沒有OpenAI、Anthropic那樣充裕的先進GPU供應;公司過去也長期依賴梁文鋒旗下幻方量化自我輸血,不接受外部融資。它的條件決定了它的路線——既然錢和算力有限,就儘可能從架構、訓練和推理效率裡摳性能。但現在,條件變了。

DeepSeek今年6月剛完成成立以來首輪外部融資,募資約74億美元;目前第二輪約500億元人民幣(約75億美元)的融資已經進入最後敲定階段,對應估值約5000億元人民幣。如果本次融資順利完成,DeepSeek幾個月內累計外部融資將接近150億美元、約1000億元人民幣。與此同時,DeepSeek已聘請中信證券籌備科創板IPO,新增資本明確將用於算力基礎設施、模型開發和人才投入;9月21日,原高瓴創投合夥人嚴文韜正式加入DeepSeek並出任CFO,結束了公司成立三年來CFO一直空缺的狀態。

以前的DeepSeek,是在有限的錢和算力裡儘可能把模型做好;現在融資、上市都在往前推,手裡的錢多了,算力也能跟著往上堆。有條件以後,DeepSeek也開始大膽卷參數了。這和追求效率其實並不衝突,效率高了,同樣的錢能把規模做得更大。02最近兩個月,前沿模型的總參數規模正在明顯往上抬。把這輪競賽重新推到聚光燈下的,是月之暗面。今年7月,Kimi K3做到了2.8萬億總參數、1040億激活參數。K3至今仍是已經正式發佈、參數規模最大的開放權重模型。它不只是大。官方評測裡,K3的GPQA Diamond達到93.5,Terminal-Bench 2.1達到88.3,已經和同期GPT-5.

6 Sol、Claude Fable 5打得很近。規模做到了數萬億,性能也做到了第一梯隊。8月,字節被曝要做個更大的。8月6日,《晚點 LatePost》率先披露,字節正在討論訓練一個超過5萬億參數的新模型,由Seed Foundation負責人項亮主導。據報道,字節內部似乎認為,與其在現有尺寸上繼續追趕,不如一次把參數規模推到同行數倍。一天後,8月7日,FT援引知情人士報道稱,字節正在預訓練的新模型規模最高可能達到10萬億參數;路透社跟進時,還拿它與Anthropic最前沿的Mythos相比——後者雖然從未公開參數規模,但業內估計已經達到約8萬億。

字節的新模型如果做到10T,將超過Mythos目前流傳的規模。現在,5T以上的超大參數量又開始反覆出現在前沿模型的討論裡。今天,阿里CEO吳泳銘公開宣佈,下一代模型計劃做到5萬億到10萬億參數;DeepSeek則在訓練2T模型的同時,把後續目標放到了8T。可以理解為,頭部實驗室重新把更大的總參數規模當成了衝擊能力上限的一條重要路線。就連不公開參數的美國閉源模型也逃不開外界的審視,Anthropic的Mythos被外界估到8T;OpenAI從GPT-4時代起就不再公開模型規模,但社區流傳著Astra達到了10T級MoE的說法。

參數量從未失去吸引力,如同遊戲面板上的戰力值——人們知道它不能代表全部,但它永遠是最直觀、最有壓迫感的那個數字。大模型行業其實有段時間不太愛談參數。這兩年,蒸餾、小模型、MoE、強化學習和推理時計算輪番上陣,比起炫耀自己有幾千億、幾萬億參數,模型廠商更願意講性能、成本和效率。單純把模型做大,很容易顯得有錢沒地方燒。時至今日,參數量被重新抬了上來,又一次成為了前沿模型的“排面”。不過,今天的5T、8T、10T,和上一輪Scaling裡的“參數越多,模型越大”,已經不是同一回事了。03參數量能重新上桌,最直接的原因是超大模型的主流架構變了。

過去的大模型,主流還是Dense架構,參數規模和計算量基本綁在一起。簡單說,就是模型裡有多少參數,每次計算基本都得一起上。參數越多,能力上限往往越高,但訓練和推理成本也跟著往上漲。現在,越來越多超大模型用的是MoE,Mixture of Experts,混合專家架構。它更像一家養了很多專家的公司,模型可以擁有幾百、幾千個專家,但每次任務只挑其中一小部分上班。比如Kimi K3有2.8T總參數,但每個Token只激活104B,大約3.7%;DeepSeek V4-Pro有1.6T總參數,每個Token只激活49B,大約3%。

所以今天說一個模型有5T、8T甚至10T參數,並不意味著它每生成一個Token都要跑完這10T參數。模型能裝多少,和每次要算多少,變成了兩個不同的數字。參數可以理解成模型用來承載知識、模式和能力的空間。總參數越大,模型理論上就有更大的空間去學習更多、更復雜的分佈;MoE又允許它只在需要的時候調用其中一部分。於是,模型可以繼續增加總參數的容量,而不需要讓每一次計算都同比變重。依然拿K3舉例,它把總參數做到2.8T,規模約是K2.5的3倍,但896個專家裡,每個Token只激活16個。月之暗面稱,靠更稀疏的MoE和一系列架構優化,K3的整體Scaling效率相比K2提升了約2.5倍。

而Agent時代,恰好又把這種“容量”重新推到了競爭中心。過去衡量一個Chatbot,能力往往是一項一項測的。數學看數學,代碼看代碼,問答看知識。模型在幾個關鍵Benchmark上把峰值做高,就足以證明自己很強。但Agent把這些能力串進了同一條任務鏈。一個真實的長任務,可能從搜索資料開始,中間讀網頁、看圖片、寫代碼、調用終端,再遇到報錯、修改方案、調用別的工具,甚至把子任務分給其他Agent。OpenAI今年9月發佈Agents API時,就把長時間運行、上下文管理、工具使用和子Agent協調直接列成了Agent的核心基礎設施,並強調Agent需要可靠運行數小時甚至數天。

一次問答裡,某項能力偶爾失手可能只丟一道題;幾十步、上百步的Agent任務裡,任何一個薄弱環節都可能中斷整條鏈路。任務越長,對能力覆蓋面和穩定性的要求就越高。前沿競爭因此開始出現明顯的“木桶效應”。METR現在甚至直接用“任務時間跨度”衡量Agent能力,因為任務越長,對模型持續完成一連串不同操作的要求越高。Chatbot時代更容易看到能力峰值,Agent時代開始越來越看能力覆蓋面。這時候,更大的參數容量就有了新的價值。任務越長,模型越不能偏科;Agent能做的事情越多,底座需要覆蓋的能力就越廣。MoE打開了容量繼續擴張的空間,Agent則把容量的價值進一步放大。

於是,模型廠商一邊拼命提高效率,一邊又重新把參數往5T、8T、10T推。省下來的算力並沒有讓Scaling消失,反而給Scaling騰出了新的空間。

Related

相關文章

​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰

AI資訊AI新聞資訊正文​DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰發佈於AI新聞資訊發佈時間 :2026年9月23號 9:52閱讀 :1分鐘人工智能技術的快速發展正在從單純的產業競爭,加速上升至全球安全與地緣政治的核心議題。據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。與此同時,包括阿里巴巴支持的月之暗面等其他中國人工智能企業也正逐步走向國際舞臺,共同參與探討如何在全球範圍內應對通用人工智能帶來的長遠挑戰。隨著各大 AI 實驗室的技術迭代不斷刷新邊界,如何平衡技術創新與安全紅線已成為全球多邊治理機制的當務之急。此次 DeepSeek 赴聯合國安理會分享其對 AI 風險的研判與實踐,不僅為國際社會提供了來自中國科技企業的技術觀察視角,也標誌著全球 AI 治理正在加速向多邊協作與深度對話的全新階段邁進。相關推薦世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管世衛組織2026年9月21日發佈《人工智能相關健康研究:倫理審查與監管》報告,指出AI正加速健康研究和醫療進步,但若缺乏倫理防線與監管,可能帶來新風險,危及人權、社會公平和公眾信任。報告對現有倫理審查機制發出警告,強調需加強倫理審查與監管。2026年9月23號 9:4652.5kGrok Bot 上線僅一個月,周活躍用戶數正式突破 40 萬大關馬斯克旗下SpaceX AI團隊推出的Grok Bot智能體上線約一個月,周活躍用戶已突破40萬。截至9月14日達41.8萬人,環比增長24%,顯示其市場熱度與

剛剛
雷峰網生成式AI

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026 本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻! 只靠語言和 token,AI 永遠跨不過物理世界這道門檻! 作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。但這條路線撞上了天花板:預訓練的邊際收益肉眼可見地遞減;模型一旦部署到真實世界,漏洞百出。2026 年,“世界模型”接棒 Scaling Law,成了牌桌上最擁擠的籌碼。然而,這個詞本身,同時被四條技術路線認領,而它們對“理解世界”這件事,幾乎各說各話。第一條賭湧現:Sora、Genie 這類視頻生成路線相信,只要下一幀逼得夠真,物理規律就會自己從像素裡長出來。第二條賭幾何:李飛飛聯合創立的 World Labs,從底層表徵就鎖死三維一致性,直接生成可自由探索的虛擬世界。第三條賭仿真:英偉達 Cosmos、Omniverse,把顯式物理引擎當作機器人的練兵場。第四條路最孤峭,也最反常識:2018 年圖靈獎得主、深度學習三位“教父”之一 Yann LeCun,押注 JEPA(聯合嵌入預測架構),它不生成未來,只在抽象表徵的空間裡預測未來。四條路的根本分歧,本質上在於一個問題:機器要“懂”物理世界,究竟該去復刻它,還是去推理它?前三條都在不同程度上試圖讓機器“看見並重建”世界;JEPA 卻選擇另一條路——編碼器先丟掉那些根本不可預測的細節,只保留可預測、可規劃的結構,然後在抽象表徵空間裡預測未來。在 LeCun 眼裡,連“預測像素”這件事本身都是偽命題:你把攝像頭對準房間一角開始錄像,下一幀會拍到什麼,取決於鏡頭外有沒

剛剛
雷峰網生成式AI

樂享以太大模型,讓中國具身智能坐上定義席

樂享以太大模型,讓中國具身智能坐上定義席 本文作者: 叢末 2026-09-23 09:46 導語: 從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。 從“預測”到“求解”:樂享以太大模型重塑 Physical AI 解題範式。 作者丨幸麗娟 編輯丨董子博 具身智能行業一直在等一個 ChatGPT 時刻。但這個時刻,未必長得像 ChatGPT。決定這個時刻的,不是機器人會聊天,也不是機器人學會了幾個動作,而是在不確定環境裡,機器人能不能自主思考、判斷和執行,在無序的事件中,持續完成任務。過去兩年,行業積累的幾乎全是“能力上限”的展示:選好場景、選好時機、反覆調試,再拍出一條完美的Demo。上限可以“被編輯”出來展示。真實效果如何,卻少有人敢公開測。但機器人真正進入現實世界,考驗的不只是最好時能做到什麼,更是環境不斷變化時,它還能不能把事情做下去。9 月 16 日傍晚。上海閔行一家燒烤店門口,樂享科技讓兩臺機器人擺起了燒烤攤。接下來近一個小時,它們要接單、烤串、上菜。這場直播的規則,測的正是機器人在這種真實環境裡的應變能力。沒有剪輯,沒有遙控,沒有預設腳本。更絕的是,觀眾可以實時幹預:隨機出題,自由改造場地佈局,隨手改道具擺放位置,臨時打斷正在進行的任務並追加需求。現場 3 桌、6 名顧客的主線任務,就是“幹擾”,看機器人能不能像人一樣自己“圓場子”。而就在不久前,這家公司剛剛站在了一場輿論風暴的中心。故事線是這樣的:7 月,樂享上線以太大模型官網並公開完整技術路線;8月26日,一段機器人協作收拾房間的10分鐘一鏡到底 Demo,在具身圈傳開。9 月 3 日,OpenAI 上線 GPT-6 Astra 官網;三天後,首席科學家 Jakub Pachocki 發表萬字長文《異星心智》。9 月 10 日,樂享創始人郭人傑發文,三問 OpenAI:技術理

剛剛

OpenAI 重磅發佈 GPT-6 Sol 與 Luna 模型:API 價格腰斬,性能直逼頂級旗艦

AI資訊AI新聞資訊正文OpenAI 重磅發佈 GPT-6 Sol 與 Luna 模型:API 價格腰斬,性能直逼頂級旗艦發佈於AI新聞資訊發佈時間 :2026年9月23號 9:26閱讀 :1分鐘OpenAI 今日正式發佈了 GPT-6系列的最新成員 ——GPT-6Sol 與 GPT-6Luna。這兩款新模型採用了與 GPT-6Astra 類似的方法進行訓練,旨在將 Astra 在專業工作、事實性、編程、計算機使用及對齊等方面的頂尖性能,帶入速度更快、更經濟的小尺寸模型中。官方表示,雖然 GPT-6Astra 依然是追求最佳效果和無妥協體驗的首選,但 Sol 與 Luna 在大幅降低成本的同時,展現出了極其強悍的綜合競爭力。在價格方面,GPT-6Sol 和 Luna 模型的 API 價格相比 GPT-5.6的促銷價直接降低了50%。此外,OpenAI 還針對基於 GPT-6的開發者優化了提示緩存,默認提供更高的緩存命中率,幫助智能體重用更多上下文,從而實現更快的響應並進一步節省費用。在核心性能表現上:業務流程與智能體表現:在 AutomationBench 跨應用業務流程測試中,GPT-6Sol 在高強度下表現優於 Claude Opus5,且成本僅為其每任務成本的9%;在 Last Exam 智能體評估中,GPT-6Sol 的得分超越了 Claude Opus5的最高分,同時每任務成本降低60%。事實可靠性:在去標識化的真實世界對話中,GPT-6Sol 的錯誤率約為前代的一半,接近 Astra 級的可靠性,Luna 的事實可靠性也迎來了大幅提升。編程與軟件工程:兩款模型均針對 AI Coding Agent 工作負載進行了深度優化。在 DeepSWE v1.1軟件工程測試中,GPT-6Sol 取得68.8% 的成績,距離最高成績僅差1.1個百分點,單任務成本卻低約80%;

剛剛

OpenAI 宣佈將在 AI 模型開發早期階段引入第三方獨立安全評估

據相關報道,該公司計劃打破傳統的內部閉環測試模式,將第三方獨立機構正式引入 AI 模型開發週期的更早階段,對其進行系統性的安全風險評估。為了確保這一創新機制能夠真正發揮實質性作用,OpenAI 同時明確了此類外部評估得以有效開展的核心優先事項。

剛剛