IT之家生成式AI

Meta 發佈多模態推理模型 Muse Spark 1.1,強化 AI 智能體任務能力

2026年7月12日 23:12
Meta 發佈多模態推理模型 Muse Spark 1.1,強化 AI 智能體任務能力

重點摘要

Meta 推出多模態推理模型 Muse Spark 1.1,重點提升 AI 智能體在規劃、協作與執行任務的能力。該模型支援最高 100 萬 token 上下文,可將任務拆分給多個子智能體並行處理,並強化工具呼叫、程式碼開發與應用操作。目前 Muse Spark 1.1 已上線 Meta AI App 與 meta.ai 的 Thinking 模式,並開放 API 預覽版供開發者使用。

站內 AI 整理稿

Meta 於 7 月 9 日正式推出專為 AI 智能體設計的多模態推理模型 Muse Spark 1.1 版本,這款新模型在規劃、協同與執行能力上進行了顯著強化,特別針對工具調用、程式碼開發以及應用操作等智能體任務場景做出最佳化,展現出 Meta 在 AI 代理技術上的最新突破。Muse Spark 1.1 的一大亮點在於其強化的多智能體協作機制。系統內部由一個主智能體負責收集資訊、制定整體計劃,接著將複雜任務拆解成多個子任務,並分配給多個子智能體以並行方式執行。這種分工模式能有效縮短大型專案的處理時間,使 AI 在面對複雜工作流程時也能保持高效率。

除了協作能力的提升,Muse Spark 1.1 還支援最高 100 萬 token 的上下文長度。這意味著模型可以在長時間的工作流程中持續保留關鍵資訊,並能隨時調用較早階段的內容,對於需要長期記憶與連續推理的任務而言,這項特性極具實用價值。在應用操作方面,Muse Spark 1.1 展現出跨應用執行長流程任務的能力。模型能夠根據當前場景自主判斷應該採取何種操作方式——是直接點擊使用者介面、編寫腳本進行自動化處理,還是將多個操作步驟一次完成。這種靈活性有助於減少人工干預,並顯著提升整體執行效率。針對程式碼開發領域,Muse Spark 1.1 提供了多項實用功能。

它可以診斷並修復複雜的程式錯誤、開發新功能,甚至執行大規模的程式碼遷移任務。模型還能在開發過程中提前規劃步驟、拆分子任務,並在長時間的開發工作中保留重要的上下文資訊,讓開發者能更順暢地完成專案。Meta 也透露,公司內部的開發人員和研究人員已經在日常工作中廣泛使用 Muse Spark 1.1,將其應用於軟體開發輔助與模型評測等場景,顯示這款模型在實際生產環境中已具備一定的可靠性。安全性方面,Meta 強調 Muse Spark 1.1 已依照內部安全框架《Advanced AI Scaling Framework》完成部署前的評估。

在化學與生物安全、網路安全以及失控風險等前沿風險領域,評估結果均維持在安全範圍內。此外,新版本也提升了對提示詞注入、越獄攻擊等攻擊方式的抵抗能力,同時降低了模型產生幻覺與迎合使用者傾向的問題。根據 Meta 內部 AI 安全治理框架的評估結果,Muse Spark 1.1 在智能體能力、程式碼開發與通用推理方面的表現相較前代有明顯進步,而在信心校準、風險識別與欺騙傾向等指標上也有顯著改善。不過,在部分電腦操作、長上下文以及程式碼開發測試中,其表現仍落後於 GPT-5.5 與 Claude Opus 4.8,顯示出與當前頂尖模型之間仍存在一定差距。目前 Muse Spark 1.

1 已正式上線至 Meta AI App 與 meta.ai 的 Thinking 模式,使用者可以透過這些平台體驗其推理能力。同時,Meta 也向一般開發者開放 Meta Model API 預覽版,開發者能夠透過該 API 調用 Muse Spark 1.1,並將其整合到自己的應用程式中,進一步拓展 AI 智能體的應用場景。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

49 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前