何夕2077生成式AI

Meta編碼模型提速

2026年7月12日 00:00

重點摘要

Ad Skip to content Meta's Muse Spark 1.1 outperforms GLM-5.2 in coding and costs slightly less Matthias Bastian View the LinkedIn Profile of Matthias Bastian Jul 11, 2026 Meta's new Muse Spark 1.

站內 AI 整理稿

Meta 最新推出的編碼模型 Muse Spark 1.1 在效能與成本之間取得令人矚目的平衡,不僅在編碼能力上小幅領先競爭對手 GLM-5.2,同時也維持更低的價格。根據獨立分析機構 Artificial Analysis 的數據,這款模型在智慧指數(Intelligence Index)上獲得 51 分,與 GLM-5.2、GPT-5.4 以及 GPT-5.6 Luna 並列。值得注意的是,Muse Spark 1.1 在短短三個月內就提升了 8 分,主要進步來自編碼任務與基於代理的知識工作領域。在編碼指數(Coding Index)方面,Muse Spark 1.1 拿下 71.

3 分,領先 GLM-5.2 的 68.8 分,並緊追 GPT-5.6 Luna 的 71.4 分。目前編碼指數排行榜的頂尖位置由 GPT-5.6 Sol(77.4 分)與 Terra(76.7 分)佔據,緊接在後的是 Claude Fable 5(76.5 分)。當然,基準測試分數並不一定完全反映真實世界的使用表現,但這樣的成績仍顯示 Meta 在編碼模型領域的快速進展。除了效能提升,Muse Spark 1.1 的定價策略也相當有競爭力。每項任務的估計成本約為 0.26 美元,相比之下 GLM-5.2 為 0.37 美元,GPT-5.4 則高達 0.89 美元。

此外,Muse Spark 1.1 在輸出時僅使用 9400 萬個 token,而 GLM-5.2 需要 1.41 億個 token,顯示其在運算資源上的效率更佳。這樣的價格與效能組合,讓 Muse Spark 1.1 在性價比圖表中落在較為划算的區間。另一個重要改進是幻覺率的顯著下降。Muse Spark 1.1 的幻覺率從先前的 73% 大幅降至 38%。這意味著模型在面對不確定的問題時,更傾向於拒絕回答,而不是給出錯誤的資訊。這項變化對於需要高度可靠性的開發者與企業用戶來說,是相當正面的訊號。Meta 也將 Muse Spark 1.

1 的上下文窗口擴大到一百萬個 token,是前一代版本的四倍。更大的上下文窗口能讓模型處理更長的程式碼段落、文件或對話記錄,進一步提升在複雜專案中的適用性。目前這款模型僅透過 Meta 自家的 API 提供,尚未在其他平台上線。整體來看,Muse Spark 1.1 的推出顯示 Meta 在大型語言模型領域持續投入,尤其在編碼能力與成本控制上取得具體成果。雖然與頂尖模型如 GPT-5.6 Sol 或 Claude Fable 5 仍有差距,但 Muse Spark 1.1 在中等價位帶中提供了相當有競爭力的選擇。

對於開發者而言,這可能是一個值得評估的工具,特別是在需要大量編碼任務且預算有限的場景下。Artificial Analysis 的數據也指出,Muse Spark 1.1 在智慧指數上與多款高階模型並列,但價格卻顯著更低。這意味著企業可以在不犧牲太多效能的前提下,降低运营成本。隨著模型持續迭代,Meta 是否有機會在下一版本中挑戰頂尖位置,將是市場關注的焦點。值得注意的是,Muse Spark 1.1 的進步僅花了三個月,從原本的分數躍升 8 分,主要集中在編碼與代理式知識工作。這反映出 Meta 在模型訓練與優化上的策略方向,未來可能還會在其他領域見到類似幅度的提升。

目前該模型僅透過 Meta API 提供,意味著用戶需要直接與 Meta 合作才能使用,尚未開放第三方平台或公開下載。綜合來看,Muse Spark 1.1 的亮點包括:編碼能力超越 GLM-5.2、價格更低、幻覺率大幅降低、上下文窗口擴大到一百萬 tokens。這些特點使它成為當前市場上值得關注的編碼模型之一。對於正在尋找高效能且經濟實惠的 AI 編碼助手的團隊,Muse Spark 1.1 提供了一個新的選項。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

39 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前