剛被索賠1.4萬億,Meta連夜開源30B小鋼炮:扎克伯格點名DeepSeek、Qwen、Kimi

2026年8月12日 09:36
剛被索賠1.4萬億,Meta連夜開源30B小鋼炮:扎克伯格點名DeepSeek、Qwen、Kimi
站內 AI 整理稿

象先志2026.08.12 09:34 · 來自安徽全文2866字00:00 / 07:42Muse首次開源:Meta把旗艦蒸餾進30B,本地Agent時代真要來了?文 | 象先志Meta最近的日子,冰火兩重天。一邊,加州、科羅拉多、肯塔基、新澤西四個州的總檢察長把索賠數字喊到了1.4萬億美元——幾乎等於Meta 1.48萬億的總市值,指控它故意把Facebook和Instagram設計成讓青少年上癮的產品。另一邊,Meta Superintelligence Labs在8月10日突然開源了Muse Glimmer:一個30B參數的Agent模型,直接掛上最寬鬆的Apache 2.0許可證。

這是Muse系列第一次開源。此前這條線一直閉源,只走API。Muse Glimmer是個什麼模型先把公開資料能確認的規格擺上桌。Muse Glimmer由Meta Superintelligence Labs訓練——就是Scale AI創始人Alexandr Wang帶隊的那家實驗室。官方定位很明確:不做聊天機器人,做常駐本地的Agent(always-on local agent)。架構上,它是一個30B的稠密多模態模型:27.9B的文本解碼器,配一個1.9B的ViT視覺編碼器和GELU投影層。

文本部分52層Transformer,用分組查詢注意力(32個Q頭對2個KV頭),外加混合滑動窗口——每三層2048窗口的局部注意力,夾一層全序列注意力,局部層用RoPE、全局層用NoPE,藉此把上下文撐到128k以上。許可證是Apache 2.0:商用、修改、再分發,基本不設門檻。權重已在Hugging Face開放,GGUF和Unsloth變體同步放出。落地速度也快得反常:發佈當天,llama.cpp、Hugging Face Transformers、Ollama 0.32.

7、LM Studio、SGLang全部day-0支持,MLX、vLLM隨後幾天跟進,AMD、Arm、Intel、NVIDIA都參與了設備端優化。Meta這次明顯是有備而來。30B怎麼塞進24GB顯卡30B模型全精度要55GB以上的內存,RTX 5090都裝不下。Meta用了兩板斧。第一板斧是量化。權重壓到約4-bit,語言模型本體縮到20GB以內,省出來的顯存留給KV cache、視覺編碼器和投機解碼的小模型,整體落在24GB或32GB的包絡裡。官方的說法是,壓縮對Agent任務的性能幾乎無損。第二板斧是投機解碼,這塊值得拆開講。

傳統解碼是一個詞一個詞往外蹦,每一步都要把30B參數完整過一遍。Glimmer配了一個基於DFlash的輕量drafter,數據流是這樣的:小模型先"瞎猜"一大段,主模型一次前向就把整段驗完——猜對的白賺,猜錯的改掉。生成質量不變,速度直接翻倍起。實測數字:RTX 5090上解碼從74.9 tok/s拉到233 tok/s,提速3.1倍;M5 Max的MacBook提速1.8倍到50 tok/s,M4 Max提速1.5倍。SGLang那邊更狠,RTX 5090上NVFP4加DFlash,單用戶236 tok/s,批量吞吐衝到1452 tok/s。

說白了,Meta用工程手段把一個60GB級的模型,壓進了24GB級設備,還跑得足夠快——本地Agent最怕的就是想五分鐘憋一句話,這個問題算是正面解決了。打工人的素質,是蒸餾出來的能力從哪來?答案是自家閉源旗艦。Glimmer的訓練分三段:預訓練階段用Muse Spark的輸出做logit蒸餾;中訓階段加長上下文、塞入更密集的Agent數據;後訓練結合監督微調、on-policy蒸餾和強化學習。所謂logit蒸餾,說人話就是:老師模型(Muse Spark)不只要告訴學生"答案是什麼",連"每個候選詞的信心分佈"都手把手教過去。

複雜推理鏈路和Agent交互數據,全部由這個龐然大物生成,再灌進30B的小身板。這套流程砸出來的能力清單很Agent向:精確schema的工具調用、多步推理、工具調用失敗後自己診斷報錯並重試、讀截圖和圖表的多模態輸入、100多種語言,還兼容OpenClaw這類編排框架。不過這裡得潑點冷水。官方對比裡,Glimmer在MCP Atlas上拿到75.5分,壓過Gemma4-31B的54.2和Qwen3.6-27B的62.5;但在OSWorld-Verified、TerminalBench 2.1和SWE-Bench Verified上,反超的恰恰是Qwen3.6-27B。

也就是說,這個"小鋼炮"在工具調用鏈路上很強,真到電腦操作和終端寫代碼的硬碰硬,同尺寸的國產模型還站在它前面。為什麼偏偏現在開源時間點選得很微妙,三條線擰在一起。第一條線是開源生態的攻守易形。扎克伯格同日發了一封14頁的長文《The Future is for Everyone》,給Meta的AI路線定調:超級智能應該交到每個人手裡,反對把它集中在少數公司,並明確主張蒸餾訓練、呼籲美國放寬對開源AI的限制。他直接點名DeepSeek、Qwen、Kimi是開源領域的領先者。去年春天Meta一度收回開源腳步,現在等於公開承認:這塊地盤被中國模型佔了,得搶回來。第二條線是Muse系列的商業佈局。

Muse Spark上個月剛開始賣API,但在編碼、推理、寫作的公開榜單上仍落後於Anthropic和OpenAI的旗艦,Meta的策略是打價格——這跟DeepSeek、月之暗面、阿里用寬鬆許可證打市場的路數如出一轍。開源Glimmer,等於把旗艦蒸餾出的能力免費下放,給API業務引流。Alexandr Wang同天還預告,Muse Spark 1.2的開源權重版也在路上。第三條線,就是開頭那場1.4萬億美元的官司。四個州按"每個受影響青少年用戶乘以法定罰款上限"的算法算出這個天價,Meta在法庭文件裡反擊稱這是"博頭條的數字",消費者保護執法史上從無先例。

8月奧克蘭開庭在即,此時高舉"開源""隱私""個人超級智能"的大旗,敘事上的收益顯而易見——合理推演是,Glimmer的發佈節奏,很難說與這場輿論戰完全無關。還有個細節值得記下:據《紐約時報》,Meta內部還在搞一個代號Watermelon的更強模型,開不開源沒說法。所以Glimmer的定位很清楚——開源的是旗艦的蒸餾產物,看家本事還攥在手裡。結語把鏡頭拉遠,Glimmer真正有意思的地方在於它驗證了一條產品路線:雲端旗艦負責把能力推到上限,本地小模型靠蒸餾承接,再用量化和投機解碼塞進消費級硬件。文件、日曆、代碼、聊天記錄這些高頻又私密的活,遲早要留在設備上跑。

而這場發佈會外的那層背景更直白:當扎克伯格需要點名三家中國實驗室來證明開源的重要性時,開源大模型的重心在哪兒,已經不用多解釋了。

Related

相關文章

鈦媒體生成式AI

王興興“錯配”梁文鋒?

王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛