智東西生成式AI

Meta全新自研圖像模型來了!不用反覆調提示詞,首次引入Agent自動改圖

2026年7月9日 04:15

重點摘要

Meta正式發布首款由超級智能實驗室研發的多模態生成模型Muse Image,該模型具備Agent能力,能自主搜索資訊、調用程式碼並自我優化圖片生成結果,有別於傳統AI繪圖工具。Muse Image已接入Instagram、WhatsApp等平台,但可調用他人公開帳號照片生成圖片,引發肖像權與隱私爭議。

站內 AI 整理稿

Meta 正式發表首款由超級智能實驗室(Meta Superintelligence Labs,MSL)研發的多模態生成模型 Muse Image,同步亮相仍在測試階段的影片生成模型 Muse Video。這是 Meta 首次將 Agent(智能體)能力導入圖像生成領域,讓 AI 不再只是被動回應提示詞,而是能像智慧助理般自主搜尋資訊、呼叫程式碼工具,並在生成過程中不斷自我修正與優化結果。根據 Meta 公布的範例,Muse Image 能產出戴墨鏡人物吃漢堡、人物與動物同桌、以及風景與人物融合的複雜場景。Muse Video 則展示了人物在廚房倒水的流暢片段。

這些作品顯示 Meta 正在努力將生成式 AI 從單輪輸出的工具,升級為具備規劃與推理能力的創作夥伴。Meta 超級智能實驗室負責人 Alexandr Wang 透露,Muse Image 內部開發代號為「Mango」,屬於 Muse 系列 AI 模型的一部分。它可與 Muse Spark 大型語言模型協同作業,在生成圖像前先完成推理、搜尋與規劃。例如,當用戶要求生成包含複雜圖表或二維碼的圖片時,Muse Image 會自動編寫並執行程式碼,產出精確的視覺元素後再融入最終圖像。若遇到涉及即時事件或專業知識的問題,模型也能主動搜尋網路資料,利用視覺參考提升真實性。

Meta 認為,這種搜尋能力能有效減少知識密集型任務中的錯誤,特別是在新聞事件、現實地點與事實資訊相關的場景。更關鍵的是,Muse Image 具備自我優化機制:生成圖片後,它會檢查輸出內容——局部細節錯誤時直接修改當前圖片;整體方向不符則重新生成;若問題來自事實資訊不足,便再次呼叫搜尋工具。Meta 強調,這種自我修正並非人工設計,而是在強化學習訓練過程中自然浮現,因為持續優化結果能獲得更高獎勵。Muse Image 的另一大突破,是將推理機制引入視覺生成。過去一年,大型語言模型的推理模型透過增加測試階段計算量來提升效能,Meta 現在把同樣概念應用到圖像生成。

模型在生成過程中會投入更多計算資源,進行更充分的推理、呼叫更多工具,並增加自我優化步驟。測試結果顯示,隨著推理強度提升,Muse Image 在人類偏好評測中的 Elo 評分持續成長,在 Arena 的單張圖像編輯、文字轉圖像與多張圖像編輯項目皆名列第二,僅次於 GPT Image 2。換句話說,模型「思考」時間越長,最終圖片品質越高。Meta 也比較了兩種提升生成品質的方法:一是 Best-of-N,即一次產生多張圖片再選出最佳者;二是增加模型推理時間。結果發現,Best-of-N 初期效果提升迅速,但很快遭遇瓶頸;反之,將計算資源投入推理、工具呼叫與自我優化,能帶來更持續的性能成長。

Muse Image 已正式整合至 Meta AI 應用、Instagram Stories 以及即時通訊軟體 WhatsApp,後續也將登陸 Facebook 與 Messenger。在 Instagram 中,用戶可使用 30 種新的 AI Stories 特效,或透過提示詞與 AI 濾鏡改變照片風格。此外,用戶還能上傳家具圖片,讓 AI 模擬擺放效果,或直接在照片上標記修改區域,由模型完成編輯。不過,Muse Image 上線後也引發隱私爭議。根據 The Verge 報導,該模型允許用戶在 Instagram 提示詞中「@」其他公開帳號,並利用該帳號的公開照片產生新的 AI 圖片。

這項設計被部分用戶認為未經明確授權,可能帶來肖像權侵犯、身份濫用與深度偽造風險。Meta 表示,用戶可透過設定控制自己的內容是否被用於 AI 生成,但被使用的用戶不會收到通知,且已產生的 AI 圖片也不會被刪除。這項政策讓外界憂心隱私保護機制不足。使用者對 Muse Image 的評價兩極。有人認為它非常適合 Instagram 等社交場景,圖片編輯與生成效果出色;也有用戶實際測試後給予好評,例如輸入「1988 年喬丹扣籃,要求黏土動畫加拆解工程分析圖」,模型無需額外調整就能輸出完整成品。但另一些用戶則指出,Muse Image 在專業領域如內耳解剖圖的生成上精準度不足,功能並未如宣傳中強大。

整體而言,Muse Image 不僅是 Meta 在多模態生成領域的新產品,更展現了 AI 從被動回應轉向主動規劃的發展方向。當模型開始處理真實用戶身份與社交內容,技術能力之外,數據邊界、用戶授權與內容安全也將成為下一階段 AI 競爭的核心課題。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

35 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前