Meta編碼模型提速
重點摘要
Ad Skip to content Meta's Muse Spark 1.1 outperforms GLM-5.2 in coding and costs slightly less Matthias Bastian View the LinkedIn Profile of Matthias Bastian Jul 11, 2026 Meta's new Muse Spark 1.
Meta 最新推出的編碼模型 Muse Spark 1.1 在效能與成本之間取得令人矚目的平衡,不僅在編碼能力上小幅領先競爭對手 GLM-5.2,同時也維持更低的價格。根據獨立分析機構 Artificial Analysis 的數據,這款模型在智慧指數(Intelligence Index)上獲得 51 分,與 GLM-5.2、GPT-5.4 以及 GPT-5.6 Luna 並列。值得注意的是,Muse Spark 1.1 在短短三個月內就提升了 8 分,主要進步來自編碼任務與基於代理的知識工作領域。在編碼指數(Coding Index)方面,Muse Spark 1.1 拿下 71.
3 分,領先 GLM-5.2 的 68.8 分,並緊追 GPT-5.6 Luna 的 71.4 分。目前編碼指數排行榜的頂尖位置由 GPT-5.6 Sol(77.4 分)與 Terra(76.7 分)佔據,緊接在後的是 Claude Fable 5(76.5 分)。當然,基準測試分數並不一定完全反映真實世界的使用表現,但這樣的成績仍顯示 Meta 在編碼模型領域的快速進展。除了效能提升,Muse Spark 1.1 的定價策略也相當有競爭力。每項任務的估計成本約為 0.26 美元,相比之下 GLM-5.2 為 0.37 美元,GPT-5.4 則高達 0.89 美元。
此外,Muse Spark 1.1 在輸出時僅使用 9400 萬個 token,而 GLM-5.2 需要 1.41 億個 token,顯示其在運算資源上的效率更佳。這樣的價格與效能組合,讓 Muse Spark 1.1 在性價比圖表中落在較為划算的區間。另一個重要改進是幻覺率的顯著下降。Muse Spark 1.1 的幻覺率從先前的 73% 大幅降至 38%。這意味著模型在面對不確定的問題時,更傾向於拒絕回答,而不是給出錯誤的資訊。這項變化對於需要高度可靠性的開發者與企業用戶來說,是相當正面的訊號。Meta 也將 Muse Spark 1.
1 的上下文窗口擴大到一百萬個 token,是前一代版本的四倍。更大的上下文窗口能讓模型處理更長的程式碼段落、文件或對話記錄,進一步提升在複雜專案中的適用性。目前這款模型僅透過 Meta 自家的 API 提供,尚未在其他平台上線。整體來看,Muse Spark 1.1 的推出顯示 Meta 在大型語言模型領域持續投入,尤其在編碼能力與成本控制上取得具體成果。雖然與頂尖模型如 GPT-5.6 Sol 或 Claude Fable 5 仍有差距,但 Muse Spark 1.1 在中等價位帶中提供了相當有競爭力的選擇。
對於開發者而言,這可能是一個值得評估的工具,特別是在需要大量編碼任務且預算有限的場景下。Artificial Analysis 的數據也指出,Muse Spark 1.1 在智慧指數上與多款高階模型並列,但價格卻顯著更低。這意味著企業可以在不犧牲太多效能的前提下,降低运营成本。隨著模型持續迭代,Meta 是否有機會在下一版本中挑戰頂尖位置,將是市場關注的焦點。值得注意的是,Muse Spark 1.1 的進步僅花了三個月,從原本的分數躍升 8 分,主要集中在編碼與代理式知識工作。這反映出 Meta 在模型訓練與優化上的策略方向,未來可能還會在其他領域見到類似幅度的提升。
目前該模型僅透過 Meta API 提供,意味著用戶需要直接與 Meta 合作才能使用,尚未開放第三方平台或公開下載。綜合來看,Muse Spark 1.1 的亮點包括:編碼能力超越 GLM-5.2、價格更低、幻覺率大幅降低、上下文窗口擴大到一百萬 tokens。這些特點使它成為當前市場上值得關注的編碼模型之一。對於正在尋找高效能且經濟實惠的 AI 編碼助手的團隊,Muse Spark 1.1 提供了一個新的選項。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。