量子位AI Agent

全球首個Agentic擴散模型來了:邊行動邊糾錯,128K上下文追平自迴歸

2026年7月28日 12:28
全球首個Agentic擴散模型來了:邊行動邊糾錯,128K上下文追平自迴歸

重點摘要

全球首個具備代理性(Agentic)能力的擴散模型近日正式亮相,這項突破打破了傳統擴散模型僅能進行靜態生成的框架,讓模型在執行任務的過程中能夠動態感知環境變化,並即時修正自己的輸出結果。這項技術的發表,代表擴散模型正式從「一次生成、無法回頭」的單向流程,進化為「邊行動、邊糾錯」的可交互生成模式,為生成式AI在複雜任務中的應用打開全新可能性。

站內 AI 整理稿

全球首個具備代理性(Agentic)能力的擴散模型近日正式亮相,這項突破打破了傳統擴散模型僅能進行靜態生成的框架,讓模型在執行任務的過程中能夠動態感知環境變化,並即時修正自己的輸出結果。這項技術的發表,代表擴散模型正式從「一次生成、無法回頭」的單向流程,進化為「邊行動、邊糾錯」的可交互生成模式,為生成式AI在複雜任務中的應用打開全新可能性。過去,擴散模型主要應用於圖像、音訊與部分文字生成場景,其核心運作方式是從雜訊開始逐步還原出目標內容,生成過程中幾乎無法根據中途結果進行調整。一旦生成方向出現偏差,往往只能重新啟動整個流程,造成時間與算力的浪費。

相較之下,自迴歸模型(如GPT系列)雖然能夠逐步生成並根據上下文動態調整,但長期以來在處理極長序列時仍面臨記憶瓶頸與效率問題。新發表的Agentic擴散模型則在架構設計上徹底改變了這一局面。研究團隊賦予模型「即時感知」與「反饋修正」的能力,讓模型在生成的每一步都能評估當前狀態,並與目標結果進行比對。若發現偏離預期,模型不會等待全部生成完成後再修正,而是直接在當下調整下一步的生成方向。這種設計大幅提升了生成過程的適應性與可控性,尤其適合需要多輪決策或長序列輸出的應用場景。在上下文處理能力上,這款模型支援多達128K token的上下文長度,直接追平當前頂尖自迴歸模型的表現。

過去業界普遍認為,擴散模型在長文本或長序列任務上難以與自迴歸模型匹敵,因為擴散模型的運算特性使其在處理長上下文時容易出現資訊遺失或連貫性下降。然而,這項新成果證明,擴散模型無需犧牲序列長度即可維持自身優勢,128K的上下文長度讓它在長篇文案生成、多輪對話、複雜推理等任務中展現出與自迴歸模型同樣穩定的連貫性。值得關注的是,這款模型不僅在長度上追平,更在「邊行動邊糾錯」的機制下,進一步提升了輸出品質。

以長文本生成為例,傳統擴散模型可能在生成到中段時累積錯誤,導致後半段內容偏離主題;而新模型能在生成過程中持續檢核邏輯一致性,一旦發現前後矛盾或語意偏離,便會即時介入修正,確保最終輸出從頭到尾維持高品質。這種動態校準的能力,在多輪決策場景中同樣關鍵,例如自動化任務規劃或智慧客服系統,模型需要根據使用者不斷變化的需求即時調整策略。研究團隊指出,這項進展將擴散模型的應用邊界從單向、被動的生成任務,大幅擴展到可交互、可修正的智能體系統。

過去,要在智能體(Agent)領域實現動態決策與自我修正,幾乎完全依賴自迴歸模型或強化學習架構;如今,擴散模型也能夠承擔這類角色,並且在部分場景中展現出更佳的平行計算效率與生成多樣性。這意味著,未來在自動化推理、機器人任務規劃、多步驟工作流程等領域,擴散模型將有機會與自迴歸模型並行發展,甚至在某些特定任務上取得優勢。從技術路線來看,這款模型並未完全拋棄既有的擴散架構,而是在其基礎上加入了代理性控制模組,讓模型能夠在迭代生成過程中引入外部回饋訊號。這種設計具有較高的模組化特性,未來可與其他模型或外部工具進行整合,例如搭配檢索增強生成(RAG)系統,進一步提升資訊準確性與時效性。

同時,128K的上下文長度也讓模型能夠容納更完整的背景知識與歷史對話,減少因記憶不足而造成的資訊遺漏。對於業界而言,這項成果的意義不僅在於技術指標的突破,更在於為擴散模型的發展方向提供了新的路徑圖。過去幾年間,自迴歸模型在語言生成領域幾乎佔據主導地位,擴散模型則主要活躍於影像與多媒體創作。如今,隨著代理性能力與長上下文支援的加入,擴散模型開始具備與自迴歸模型正面競爭的潛力,特別是在需要高度可控性與即時修正的應用中,擴散模型的先天優勢——如平行生成效率與較低的推理延遲——將更加凸顯。當然,這項技術仍處於早期階段,實際部署時還需面對計算資源消耗、模型穩定性以及與現有應用框架的整合等挑戰。

研究團隊表示,後續將持續優化模型在更長上下文下的表現,並探索其在多智能體協作、自動化編程等進階場景中的應用。可以預見,隨著Agentic擴散模型的概念逐步落地,生成式AI的技術版圖將迎來新一輪的重新洗牌,而「邊行動邊糾錯」的設計哲學,也有望成為未來生成模型的重要標準之一。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

4 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

9 小時前