何夕2077模型更新

Meta發佈Muse Spark 1.1推理模型

2026年7月10日 00:00

重點摘要

ProductsAI ResearchResourcesAboutTry Meta AIIntroducing Muse Spark 1.1July 9, 2026•10 minute readToday, we’re excited to introduce Muse Spark 1.

站內 AI 整理稿

Meta 旗下人工智慧團隊 Meta Superintelligence Labs 於 7 月 9 日正式發表最新推理模型 Muse Spark 1.1,這是去年推出的 Muse Spark 的重大升級版本。作為專為自主代理任務設計的多模態推理模型,Muse Spark 1.1 在工具呼叫、電腦操作、程式編寫與多模態理解等面向均取得顯著突破,同時也將模型在性能與效率之間的平衡推向新境界。這款模型即日起在 Meta AI 應用程式與官方網站 meta.ai 上以「Thinking」模式開放使用,開發者則可透過首次公開預覽的 Meta Model API 存取其完整能力。Muse Spark 1.

1 的問世,與本週稍早發表的影像生成模型 Muse Image 相互呼應,共同推進 Meta 對於「個人超級智能」的願景。該公司表示,這一系列模型旨在協助使用者追求目標、實現創造力、深化人際關係,並將最重視的價值化為具體行動。Muse Spark 1.1 正是這套願景中的核心引擎,特別擅長需要跨多個外部應用與服務進行規劃與協調的個人化代理任務。在代理任務表現上,Muse Spark 1.1 能夠以零樣本方式直接泛化至全新的原生工具、MCP 伺服器以及自訂技能,無需額外微調。相較於前一代,這款模型處理複雜專案的速度大幅提升,關鍵在於其訓練過程中引入了多代理系統的協作架構,能有效優化端到端的延遲。

當作為主要代理時,Muse Spark 1.1 會先收集脈絡、制定計畫,再將執行工作平行委派給多個子代理;而作為子代理時,它能精確遵守自身任務範圍、理解可用工具,並在需要時主動將問題回報給主代理。Muse Spark 1.1 擁有 100 萬 token 的脈絡窗口,並能主動管理這龐大的上下文。它會記住已完成的動作、從較早的工作階段中檢索資訊,並以壓縮方式保留後續任務所需的關鍵步驟,避免長流程中資訊遺失。這種能力使其在電腦操作場景中格外突出,尤其是在需要跨多個應用程式處理即時變動資訊的工作流程中,模型能夠在長時間的操作會話中維持脈絡,適應不斷變化的需求,並以最少的人工介入導覽陌生介面。

更特別的是,Muse Spark 1.1 並非每一步都仰賴逐一點擊的推理方式,而是懂得判斷何時應該自動化、何時直接操作介面。團隊在訓練時讓模型學會在自動化較快時編寫腳本,在直接互動更單純時使用點擊,並且能在單一步驟中生成批量動作。以實際應用為例,在籌辦晚宴派對的過程中,若出現新情況需要調整訂單,Muse Spark 1.1 能夠自動察覺變化並做出必要更新,無需使用者介入。程式碼處理能力是此次升級的另一大亮點。Muse Spark 1.1 在涉及大型複雜程式碼庫的真實世界任務中表現大幅躍進,能夠診斷並修復複雜錯誤、在企業級系統中實作新功能,以及執行大規模程式碼遷移。

在建立網頁應用與端到端問答系統等使用案例中,相較前一代模型展現明顯優勢。模型也經過特別訓練,能流暢適應各種不同的評測框架,並可靠處理多輪互動的複雜動態,支援規劃模式、目標條件設定、子代理委派與上下文壓縮等熱門代理程式設計配置。在 Meta 內部的主要編碼評測基準 Meta Internal Coding Bench 上,Muse Spark 1.1 較前代 Muse Spark 有顯著進步,與市場上頂尖的替代方案並駕齊驅。

不僅開發者與研究人員已開始在日常工作中使用這款模型來加速開發與提升效率,部分研究團隊甚至將其整合至工作流程中,自動執行模型開發與評估任務,例如讓模型針對不同推理強度自我評測一組 DeepSWE 任務,並根據結果產出分析儀表板。多模態方面,Muse Spark 1.1 在感知、多模態推理與工具使用上同樣出色。它能與真實環境互動並產出接地輸出,尤其擅長將視覺內容轉換為程式碼成品、生成極高描述性的圖片與影片字幕,以及執行多模態代理工作流程。當感知與行動需要同時進行時,這項能力格外珍貴。

例如,模型可以透過智慧型手機拍攝的影片,自動提取有用的照片、判斷產品資訊,並操作使用者的瀏覽器在 Facebook Marketplace 上完成商品刊登。安全性方面,Meta 依照先進 AI 擴展框架在部署前進行了全面評估,涵蓋化學與生物威脅、網路安全以及失控風險等前沿風險類別。結果顯示,Muse Spark 1.1 在所有類別中均維持在安全邊際之內,並展現出對直接越獄攻擊與間接攻擊(如不可信任資料、提示注入、開發者提示攻擊)的高度抵抗力,同時具備更佳的對抗魯棒性、較低的幻覺率以及減少的諂媚傾向。完整的評估報告已隨模型一同公開。

開發者首次可透過全新 Meta Model API(公開預覽階段)開始使用 Muse Spark 1.1 進行開發。早期合作夥伴給予高度評價,Replit 執行長 Amjad Masad 指出,Muse Spark 1.1 集百萬 token 脈絡、完整多模態支援、內建搜尋引用、強大推理、頂尖編碼能力(尤其是前端與設計)、結構化輸出與平行工具呼叫於一身,是完整的代理基礎模型。Cline 執行長 Saoud Rizwan 則認為 Meta 正為嚴肅的代理程式設計鋪路,在價格點上讓大規模真實編碼工作負載得以實現。

Box 的 AI 產品副總裁 Yashodha Bhavnani 指出,在企業工作評估集上,Muse Spark 1.1 的智慧程度與現有頂尖模型相當,加上其在專業服務、公共部門與工業營運等領域的結構化程序工作流程優勢,極具吸引力。OpenClaw Foundation 的 Dave Morin 則簡潔表示這款模型快速、強大且充滿樂趣。Meta 表示,Muse Spark 1.1 的推出展現了其研究團隊的強大動能,目前還有能力更強大的模型正在訓練中,未來將持續分享最新進展。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

3 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

3 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

3 小時前