Meta 發佈多模態推理模型 Muse Spark 1.1,強化 AI 智能體任務能力

重點摘要
Meta 推出多模態推理模型 Muse Spark 1.1,重點提升 AI 智能體在規劃、協作與執行任務的能力。該模型支援最高 100 萬 token 上下文,可將任務拆分給多個子智能體並行處理,並強化工具呼叫、程式碼開發與應用操作。目前 Muse Spark 1.1 已上線 Meta AI App 與 meta.ai 的 Thinking 模式,並開放 API 預覽版供開發者使用。
Meta 於 7 月 9 日正式推出專為 AI 智能體設計的多模態推理模型 Muse Spark 1.1 版本,這款新模型在規劃、協同與執行能力上進行了顯著強化,特別針對工具調用、程式碼開發以及應用操作等智能體任務場景做出最佳化,展現出 Meta 在 AI 代理技術上的最新突破。Muse Spark 1.1 的一大亮點在於其強化的多智能體協作機制。系統內部由一個主智能體負責收集資訊、制定整體計劃,接著將複雜任務拆解成多個子任務,並分配給多個子智能體以並行方式執行。這種分工模式能有效縮短大型專案的處理時間,使 AI 在面對複雜工作流程時也能保持高效率。
除了協作能力的提升,Muse Spark 1.1 還支援最高 100 萬 token 的上下文長度。這意味著模型可以在長時間的工作流程中持續保留關鍵資訊,並能隨時調用較早階段的內容,對於需要長期記憶與連續推理的任務而言,這項特性極具實用價值。在應用操作方面,Muse Spark 1.1 展現出跨應用執行長流程任務的能力。模型能夠根據當前場景自主判斷應該採取何種操作方式——是直接點擊使用者介面、編寫腳本進行自動化處理,還是將多個操作步驟一次完成。這種靈活性有助於減少人工干預,並顯著提升整體執行效率。針對程式碼開發領域,Muse Spark 1.1 提供了多項實用功能。
它可以診斷並修復複雜的程式錯誤、開發新功能,甚至執行大規模的程式碼遷移任務。模型還能在開發過程中提前規劃步驟、拆分子任務,並在長時間的開發工作中保留重要的上下文資訊,讓開發者能更順暢地完成專案。Meta 也透露,公司內部的開發人員和研究人員已經在日常工作中廣泛使用 Muse Spark 1.1,將其應用於軟體開發輔助與模型評測等場景,顯示這款模型在實際生產環境中已具備一定的可靠性。安全性方面,Meta 強調 Muse Spark 1.1 已依照內部安全框架《Advanced AI Scaling Framework》完成部署前的評估。
在化學與生物安全、網路安全以及失控風險等前沿風險領域,評估結果均維持在安全範圍內。此外,新版本也提升了對提示詞注入、越獄攻擊等攻擊方式的抵抗能力,同時降低了模型產生幻覺與迎合使用者傾向的問題。根據 Meta 內部 AI 安全治理框架的評估結果,Muse Spark 1.1 在智能體能力、程式碼開發與通用推理方面的表現相較前代有明顯進步,而在信心校準、風險識別與欺騙傾向等指標上也有顯著改善。不過,在部分電腦操作、長上下文以及程式碼開發測試中,其表現仍落後於 GPT-5.5 與 Claude Opus 4.8,顯示出與當前頂尖模型之間仍存在一定差距。目前 Muse Spark 1.
1 已正式上線至 Meta AI App 與 meta.ai 的 Thinking 模式,使用者可以透過這些平台體驗其推理能力。同時,Meta 也向一般開發者開放 Meta Model API 預覽版,開發者能夠透過該 API 調用 Muse Spark 1.1,並將其整合到自己的應用程式中,進一步拓展 AI 智能體的應用場景。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。