小扎高調開戰閉源AI!推30B智能體模型,消費級顯卡就能跑,楊立昆點贊
編譯 | 茄子 編輯 | 程茜 8月11日消息,昨晚,Meta推出300億參數本地Agent模型Muse Glimmer,並宣佈開放權重,這也是Meta成立超級智能實驗室後首次開放模型權重。隨後,Meta創始人兼CEO馬克·扎克伯格(Mark Zuckerberg)髮長文闡述Meta的超級智能路線,並呼籲減少美國對開源AI模型的限制,批評部分AI廠商通過封閉模型控制技術和用戶,同時支持繼續實施芯片出口管制。他還預告Meta即將開放最新旗艦模型Muse Spark 1.2的權重。
▲扎克伯格官宣開放Muse Glimmer權重併發長文(圖源:X) 據技術博客稱,Muse Glimmer可以調用工具、進行多步推理、處理文字和圖片,並在工具執行失敗後分析問題並重新嘗試。Meta將其定位為本地個人Agent的基礎模型,可用於整理文件、管理日程、起草消息、本地編程和函數調用等場景。Meta稱,Muse Glimmer針對持續運行的本地Agent工作流進行優化,量化後的體積不到20GB,可以在部分Mac或配備單張消費級顯卡的PC上運行,即使沒有網絡連接也能執行任務。
Meta前首席AI科學家、AI公司AMI Labs創始人、圖靈獎得主楊立昆(Yann LeCun)直接在扎克伯格評論區鼓掌稱,(開放權重)是很棒的一步。▲楊立昆評論(圖源:X) Meta首席AI官、超級智能實驗室負責人亞歷山大·王(Alexandr Wang)稱,Muse Glimmer是一款300億參數稠密模型,採用Apache 2.0開源協議開放權重,可在24GB顯存顯卡上本地運行,且不會削弱智能體任務的執行穩定性。▲亞歷山大·王官宣開放Muse Glimmer權重並預告開放Muse Spark 1.
2權重(圖源:X) Meta已在Hugging Face開放Muse Glimmer的模型權重,開發者可以下載並在本地部署。▲Muse Glimmer的開放權重頁面(圖源:Hugging Face) Muse Glimmer發佈後,多名開發者測試了它在個人設備上的運行效果。現有實測顯示,該模型能夠離線操作Mac應用、一次生成多款可運行遊戲,並在單張RTX 4090上支持長上下文,但其響應速度、token消耗和工具接口仍存在優化空間。有網友實測稱,Muse Glimmer的著色器生成能力十分亮眼。他在BF16精度下對比Meta Muse Glimmer 30B與Qwen 3.6 27B。
他讓二者生成FBM動態地形,Muse Glimmer 30B一次就能產出完整山地渲染圖,Qwen 3.6 27B重試4次輸出的仍是模糊失效畫面。▲網友對比Muse Glimmer 30B和Qwen 3.6 27B的著色器生成能力(圖源:X) 基準測試方面,在Meta公佈的22項Agent、編程、多模態和通用能力測試中,Muse Glimmer拿下12項SOTA,優勢主要集中在Agent任務和部分推理測試。但該模型在桌面操作、編程、多模態上弱於Qwen 3.6;在兩項安全測試中,Gemma 4以更低的違規率和攻擊成功率領先Muse Glimmer。
▲Muse Glimmer在Agent、編程、多模態測試中的表現(圖源:Meta) 從技術路線看,Meta稱,Muse Glimmer能夠在本地運行,主要依靠知識蒸餾、4比特量化和DFlash推測解碼。Meta將完整精度下超過55GB的模型壓縮至不到20GB,並利用配套草稿模型提高輸出速度。扎克伯格在長文中稱,超級智能不應集中在少數公司或個人手中。Meta超級智能實驗室將恢復開放部分模型,面向數十億用戶提供免費或低價的個人Agent,並允許有更高需求的用戶付費購買額外算力;該公司還將推出連Meta自身也無法讀取用戶數據的完全私密模式。
▲Meta認為應將超級智能普及到每個人手中(圖源:Meta) 此外,扎克伯格還在長文中宣佈設立“未來屬於每個人”基金(Future Is For Everyone Fund),用於支持Meta在美國建設和運營數據中心的社區。外媒Axios隨後確認,該基金初始規模為10億美元(約合人民幣68億元),將用於支持當地教師、急救人員以及能源和水務基礎設施。Muse Glimmer開源鏈接: https://huggingface.co/meta-models/Muse-Glimmer-30B 扎克伯格文章鏈接: https://www.meta.
com/thefutureisforeveryone/ 一、三組網友實測:能操作Mac、生成遊戲,單卡支持13萬token上下文 一位開發者通過Cua Driver驗證了Muse Glimmer的本地電腦操作能力,他讓Muse Glimmer在Mac本地操作備忘錄和提醒事項。在實測中,該模型結合macOS輔助功能接口與屏幕圖像識別完成點擊操作,完成了備忘錄中新建清單、提醒事項中添加日程提醒任務。▲Muse Glimmer在本地操作macOS備忘錄(圖源:X) ▲Muse Glimmer在本地操作macOS提醒事項(圖源:X) 這位開發者稱,這是他們第一次感到“離線操作電腦”真正具備了可用性。
儘管Muse Glimmer在搭載蘋果自研芯片的消費級設備上仍存在較高延遲,但如果任務對速度要求不高,這是他首款願意推薦用於“啟動後無需持續監督”工作流的本地模型。不過,Muse Glimmer在測試中也在操作上產生混亂。比如,在Muse Glimmer執行任務時,工具定義、屏幕截圖和輔助功能樹會迅速佔用該模型上下文,測試團隊精簡工具接口後,Muse Glimmer才順利完成任務。針對這一問題,這位開發者稱計劃減少工具及電腦狀態信息的上下文佔用,使模型能夠將更多上下文用於任務本身,並連續運行更長時間。
AI平臺Atomic Chat對比了Muse Glimmer、Gemma 4 31B和Qwen 3.6 27B的本地編程能力。三款模型分別在配備32GB顯存的RTX 5090上運行,並根據相同提示詞一次生成《太空侵略者》《俄羅斯方塊》和《打磚塊》三款復古街機遊戲。▲Atomic Chat比較三款本地模型生成復古街機遊戲的效果(圖源:X) Atomic Chat稱,Muse Glimmer生成的三款遊戲均可正常運行。《太空侵略者》中的敵機會隨擊殺加速,《俄羅斯方塊》可以鎖定方塊並消除行,《打磚塊》中的磚塊也能正常擊碎,測試過程中沒有出現卡死或崩潰。
相比之下,Gemma 4生成的《俄羅斯方塊》存在方塊堆積邏輯問題;Qwen 3.6雖然完成了三款遊戲,但《打磚塊》中的部分球會直接穿過擋板。不過,Muse Glimmer也花費了更多時間和token。其運行記錄為8.34萬token、耗時17.7分鐘,明顯高於Qwen 3.6的2.37萬token和5.4分鐘,以及Gemma 4的1.78萬token和4.5分鐘。▲Atomic Chat比較Muse Glimmer、Gemma 4 31B和Qwen 3.6 27B的本地編程能力(圖源:X) 另一名開發者主要測試了Muse Glimmer在消費級顯卡上的部署效率。
他稱,在單張RTX 4090上運行UD-Q4KXL量化版本時,該模型在不量化KV緩存、不開啟DFlash推測解碼的情況下,可配置13萬token上下文,佔用約19.34GB顯存,輸入預處理速度超過3100 token/s,輸出速度約為50 token/s。加入DFlash草稿模型後,Muse Glimmer在8萬token上下文下佔用23.93GB顯存,基本用滿RTX 4090,輸出速度則提高至75 token/s。
▲開發者在單張RTX 4090上測試Muse Glimmer的UD-Q4KXL量化版本效果(圖源:X) 該開發者稱,Muse Glimmer通過讓多組注意力查詢共享同一組緩存數據,降低了長文本處理所需的顯存。因此,他認為,在不壓縮KV緩存精度的情況下,該模型也能在單張24GB顯卡上支持13萬token上下文。▲開發者在單張RTX 4090上測試Muse Glimmer(圖源:X) 二、可調用工具並處理報錯,官方演示從零開發智能家居面板 Meta稱,一個能夠管理日程、起草消息和整理文件的個人Agent,需要同時具備長流程執行、準確調用工具、多模態理解、長上下文記憶和指令遵循等能力。
Muse Glimmer可以在多輪操作中維持任務計劃,並按照工具預先定義的數據格式發起調用。如果工具執行失敗或返回異常結果,模型可以判斷錯誤原因並重新嘗試,而不是直接停止任務。該模型配備獨立的感知編碼器,可以同時處理文字和圖片,理解軟件截圖、圖表及文檔。Muse Glimmer還支持100多種語言,並允許開發者調節推理強度,在響應速度和輸出質量之間進行選擇。Meta展示了Muse Glimmer在OpenCode中完成長流程編程任務的案例。用戶只提供了一條自然語言指令給模型,讓它找到家庭網絡中的Home Assistant智能家居系統,併為連接的影音接收器開發控制面板。
Muse Glimmer首先制定任務計劃,包括查找Home Assistant、識別影音接收器、設計界面、編寫代碼並測試功能。隨後,該模型調用多個網絡工具,找到Home Assistant在局域網中的IP地址。當模型發現缺少訪問權限時,它沒有繼續嘗試繞過認證,而是向用戶索取連接方式和長期訪問令牌。獲得授權後,模型通過Home Assistant API識別出連接的影音接收器,並讀取設備支持的電源、音量、音源、聲音模式和分區控制等功能。最後,Muse Glimmer從零編寫HTML、CSS和JavaScript,生成一套響應式網頁控制面板,並測試頁面功能和不同尺寸下的顯示效果。
最終頁面可以控制接收器開關、音量、音源、聲音。▲Muse Glimmer在OpenCode中開發影音接收器控制面板(圖源:Meta) 三、22項測試拿下12項第一,Agent任務表現更突出 Meta將Muse Glimmer與參數規模相近的Gemma 4 31B和Qwen 3.6 27B進行了比較。在不含安全測試的22項Agent、編程、多模態和通用能力基準中,Muse Glimmer取得12項SOTA。其中,Muse Glimmer在檢驗大模型多工具串聯調度能力的MCP Atlas和檢驗深度檢索問答能力的DeepSearch QA中分別獲得75.5分和74.
6分,均超過另外兩款模型;在編程測試SWE-Bench Pro中獲得51.2分,略高於Qwen 3.6的50.2分;在數學測試AIME 2026中則以94.7分位列第一。不過,Muse Glimmer並未全面領先。Qwen 3.6在部分桌面操作、編程和多模態測試中表現更好,Gemma 4則在兩項安全測試中取得更低的違規率和攻擊成功率。▲Muse Glimmer與Gemma 4、Qwen 3.6基準測試對比(圖源:Meta) 四、模型從超過55GB壓縮至不到20GB,解碼速度提升3.
1倍 Meta稱,Muse Glimmer的技術重點在於,在300億參數規模下平衡Agent能力、運行速度和個人設備的內存限制。該模型採用知識蒸餾路線,以更大的Muse Spark作為教師模型。預訓練階段,Meta使用Muse Spark的輸出進行logit蒸餾,並採用與教師模型相近的數據組合。中期訓練階段,Meta加入更長上下文、更多Agent任務和更豐富的推理軌跡;後訓練階段則結合監督微調、在線蒸餾和強化學習,覆蓋通用、推理、編程及Agent等領域。按照完整精度計算,Muse Glimmer需要超過55GB內存,超出多數消費級顯卡的容量。
Meta採用量化技術,將模型權重壓縮至約4比特精度,使語言模型體積降至20GB以下。壓縮後的模型可以與負責圖片理解的感知編碼器、保存工作狀態的KV緩存,以及用於推測解碼的小型模型共同運行在24GB或32GB內存環境中。因此,Meta所說的“消費級設備可運行”仍存在一定門檻,並不意味著所有普通電腦都可以部署該模型。▲壓縮後的模型可以與KV緩存和小型模型共同運行在24GB或32GB內存環境中(圖源:Meta) 為縮短模型執行長推理及多步驟工具調用時的等待時間,Meta還提供了一個基於DFlash的輕量級草稿模型。
它會一次提出多組候選token,再由Muse Glimmer並行驗證,在保持最終輸出質量的同時提高生成速度。Meta測試顯示,DFlash推測解碼使Muse Glimmer在RTX 5090上的解碼速度提升3.1倍,在M5 Max和M4 Max上分別提升1.8倍和1.5倍。▲DFlash推測解碼在不同硬件上的加速效果(圖源:Meta) Muse Glimmer權重已經上傳至Hugging Face。Meta稱,Ollama、LM Studio和Unsloth將提供支持,llama.cpp、ExecuTorch和MLX等本地及端側框架的優化集成也將陸續上線。
開發者還可以通過vLLM和SGLang部署模型,或利用PyTorch的TorchTitan功能進行定製訓練。AMD、Arm、戴爾、英特爾和英偉達正在參與Muse Glimmer在不同設備上的性能優化。五、扎克伯克長文詳解Meta超級智能願景,將為數十億人提供免費Agent 扎克伯格在長文中提出,Meta將向數十億用戶和小企業提供免費或低價的個人Agent,推出連該公司自身也無法讀取用戶數據的完全私密模式,並繼續開放部分模型權重。Meta將引入獨立董事會審查發佈標準,並考慮在訓練期間向政府提供模型中間檢查點用於模型治理。扎克伯格稱,將加快芯片、能源和數據中心建設,並支持繼續限制先進芯片對華出口。
為了將這套個人超級智能路線落地,Meta計劃從產品定價、隱私保護、模型開放和基礎設施建設等方面採取具體措施。第一,Meta將提供免費或低價的個人Agent。按照扎克伯格的設想,每個人都可以擁有一個瞭解自身目標和偏好的Agent,用於處理健康、職業、財務、學習和家庭管理等任務,並通過手機、電腦和AI眼鏡使用。需要更多計算資源的用戶可以付費購買額外算力,Meta還考慮採用動態競價機制分配有限的計算資源,但尚未公佈具體推出時間和收費方式。第二,Meta計劃推出完全私密的個人Agent模式。在這一模式下,即使Meta也無法讀取用戶信息或將其提供給其他機構。
本地運行的Muse Glimmer與這一方向相符,可以減少個人文件及任務數據上傳至雲端的需要。不過,Meta尚未確認未來面向普通消費者的個人Agent是否會直接採用Muse Glimmer。第三,Meta將繼續開放部分模型權重。除Muse Glimmer外,該公司還將開放最新基礎模型Muse Spark 1.2。扎克伯格呼籲美國減少對開源AI模型的限制,並批評部分廠商通過封閉模型控制技術和用戶。他認為,美國不應增加可能拖慢模型發佈的統一審查流程,即使延遲一個月,也可能削弱美國AI公司的競爭優勢。第四,Meta將繼續建設支撐個人超級智能的芯片、能源和數據中心基礎設施。
扎克伯格認為,美國及其盟友雖然在芯片設計方面具有優勢,但電力供應和數據中心建設速度仍是短板。與支持開放模型的立場不同,他同時支持繼續限制先進芯片出口,認為這一政策現階段可以減緩競爭對手訓練前沿模型的速度。在模型治理方面,Meta計劃由獨立董事會批准模型發佈的安全標準,並審查每次發佈是否符合要求。扎克伯格稱,超級智能如何部署不應由他或任何一名管理者獨自決定。針對網絡安全等潛在風險,他提出,前沿AI實驗室可以在模型訓練期間向政府提供中間檢查點和技術人員,幫助政府提前評估模型能力並加固關鍵基礎設施。
結語:Meta把個人超級智能路線落到本地Agent Muse Glimmer將300億參數Agent模型壓縮至消費級硬件可以承載的範圍,是Meta推進本地AI的一項實際進展。現有實測顯示,該模型已經能夠在斷網狀態下操作桌面應用、調用工具和完成編程任務,24GB或32GB的內存要求也使其進入部分個人電腦的部署範圍。這款模型與扎克伯格長文提出的個人超級智能路線形成呼應:Meta希望通過免費服務、開放模型和完全私密模式,讓個人Agent覆蓋更多用戶。本地運行可以減少對雲端算力和網絡連接的依賴,也為處理文件、日程等個人數據提供更具隱私性的方案。
現階段,Muse Glimmer在運行延遲、token消耗和工具接口方面仍有優化空間。隨著模型進一步壓縮、消費級硬件性能提升及本地工具生態完善,Agent競爭將從雲端模型能力延伸至個人設備上的任務執行效率和數據隱私。來源:Meta、X
Related
相關文章

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷
Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。
端側AI大洗牌:vivo藍心登頂手機大模型榜首,3B小參數跑分逼近雲端巨頭
SuperCLUE發佈手機端側大模型測評,vivo藍心BlueLM3.5 Nano 3B以89.86分居綜合第一。該3B小模型得分逼近谷歌Gemini3.6 Flash、豆包Seed2.1 Pro、千問Qwen3.8 Max等雲端大模型,展現端側性能突破。
Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態
8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

諾亦騰機器人發佈 HiPHI,開源 617.5 小時高精度人體運動數據
作者:潞源 責編:潞源 評論: 8 月 23 日消息,諾亦騰機器人在 2026 世界機器人大會期間發佈 HiPHI,這是一套面向人形機器人學習、數字人,以及計算機圖形學領域研究人員和工程師的高精度光學動作捕捉數據集。據報道,該數據集總長 617.