從完成任務到自主發現,Agent後訓練尋找下一個Scaling Law

2026年9月12日 08:40
站內 AI 整理稿

當大模型開始調用工具、執行復雜任務,衡量其能力的標準也在發生變化:不僅要看能否給出正確答案,更要看能否在真實環境中持續行動、檢查結果,並根據反饋調整策略。從模型能力到任務價值,這一轉變需要怎樣的訓練方法與基礎設施?智能體能否在工作中積累經驗、不斷進化,進而打開新的能力增長空間?9月12日上午2026 Inclusion·外灘大會上,以“Agent Post-Training:智能本質與下一個 Scaling Law”為主題的見解論壇正式舉行。論壇圍繞智能體後訓練的算法、環境、基礎設施及自我進化等議題展開交流,邀請到模型研發與Agent領域的研究者、產業實踐者,共同探討智能體能力發展的關鍵問題。

嘉賓們的分享呈現出一條逐步深入的探索路徑:讓Agent能夠完成複雜任務,進一步讓它從任務中積累經驗、發現新知識,並將這些成果用於下一輪能力提升。圍繞這一過程,環境如何構建、信息如何管理、成果如何驗證,成為貫穿多場演講的重要問題。謝鈺溱:從數量、環境與進化,探索Agent的Scaling Law在題為《通往agent時代的範式跨越》的開場分享中,CAMEL AI 創始成員謝鈺溱介紹,探索Agent的Scaling Law一直是CAMEL AI的重要方向。她將這一問題拆解為三個相互關聯的維度:智能體的數量、智能體所處的環境,以及智能體自身的進化。

CAMEL AI 創始成員謝鈺溱在數量維度,研究重點並非簡單增加參與任務的Agent,而是解決多智能體之間如何通信、達成共識,以及在沒有中心化控制的情況下實現自組織等問題。從少量智能體的協作分工,到大規模智能體群體行為的模擬,數量的擴展也對協作機制提出了新的要求。在環境維度,謝鈺溱提出,環境之於Agent,如同數據之於模型。智能體需要通過與不同環境交互,學習相應的能力,而這類訓練條件往往需要專門構建。隨著任務從簡單推理走向跨設備操作、長流程工作乃至機器學習研發,環境的複雜度不斷提高,結果驗證與防止獎勵機制被利用,也變得更加重要。

這進一步引出了進化問題:當Agent已經能夠獨立完成越來越複雜的任務,它能否在工作的過程中發現自身不足、積累經驗,甚至提出人類尚未想到的新思路?謝鈺溱認為,利用當前模型加速研發、推動下一代模型訓練,是這一方向的重要實踐,智能體的進化也可能成為探索下一個Scaling Law的關鍵。周俊:讓模型走出實驗室,在真實任務中生長專業能力在《Agent後訓練的產業化全景:讓模型走出實驗室》演講中,螞蟻百靈大模型負責人周俊指出,大模型的真實任務並不限於編程,還包括醫療、金融、法律等領域的大量專業工作。螞蟻百靈3.0(Ling-3.

0)希望構建的,是一套能夠在可控成本下持續發展專業能力、服務真實任務的基礎模型體系。螞蟻百靈大模型負責人周俊圍繞真實任務,周俊提出高質效、可專業化與可信執行三個關鍵詞。高質效需要綜合考察任務質量、成本、等待時間與成功率;可專業化意味著模型不僅要掌握行業知識,還要理解專業語境、使用專業工具,並遵循工作流程;可信執行則要求模型能夠及時發現問題、限制錯誤影響,在證據不足、風險過高或權限不夠時主動請求人工接手。“一個好的agent,他不是知道下一步應該做什麼,他更加重要的是知道下一步哪些不能擅自去做。”周俊強調,現階段的目標並非假設模型不會犯錯,而是建立能夠識別風險、明確邊界的執行體系。

在醫療領域,團隊關注模型能否識別缺失信息、開展循證檢索,並審慎表達判斷中的不確定性。在金融投研領域,模型則需要完成資料檢索、多文檔分析、計算建模與報告生成,同時說明數據來源、統一統計口徑、區分事實與假設,使輸出能夠追溯和複核。專業化的重點,因此從補充知識進一步延伸到了理解和執行專業工作流。周俊同時指出,場景不會自動轉化為模型能力。真正重要的是從實際使用中沉澱可覆盤的失敗案例、更符合專業要求的評測體系,以及可交互的訓練環境,再將這些積累用於改進模型。真實場景既是檢驗能力的考場,也是推動能力發展的訓練場。

胡健:以輕量化強化學習框架,加快研究想法的驗證隨著Agent訓練日益複雜,研究者如何快速驗證新算法,也成為後訓練體系中的重要問題。英偉達研究員胡健在演講中,介紹了面向研究的強化學習框架Molt,其設計重點是降低框架理解與修改的成本,縮短從提出想法到完成實驗的距離。英偉達研究員胡健胡健表示,研究者經常需要調整優勢估計、損失函數、數據過濾及訓練流程。面向大規模生產訓練的框架雖然功能豐富,但複雜的實現也可能增加實驗改造的難度。Molt採用基於PyTorch原生能力的設計,核心代碼約9000行,希望在保持訓練能力的同時,讓研究人員更容易修改算法、開展迭代。這種簡潔性也服務於Agent參與研發的趨勢。

胡健指出,代碼規模過大時,編程智能體難以完整理解訓練框架,容易在實現研究想法時出錯。更精簡的代碼與清晰的接口,有助於降低人和Agent共同參與研究的門檻。在智能體訓練支持方面,Molt既提供傳統的環境交互接口,也支持接入外部Agent運行框架,跟蹤交互軌跡並用於訓練。針對長任務中的上下文壓縮,框架能夠處理前綴變化、拆分訓練樣本,減輕研究者在長軌跡管理方面的工程負擔。此外,框架採用流式採樣與調度方式,在收集交互數據的同時持續向訓練端提供樣本,提高GPU和環境資源的利用率。胡健介紹,框架已支持多種主流模型及大參數規模訓練。

其核心取捨是:在保證性能與擴展能力的基礎上,儘可能降低複雜度,讓基礎設施更直接地服務於研究效率。顧奇:長程Agent的關鍵,是環境、信息管理與訓練的協同美團LongCat主任研究員、通用Agent團隊負責人顧奇在《Long horizon agent: Env, harness & algorithm》演講中,將討論進一步推進到長程任務。他指出,隨著模型能夠覆蓋更大的工作量,用戶對Agent的期待正在從短時間完成一個操作,轉向持續、自主地推進複雜工作。美團LongCat主任研究員、通用Agent團隊負責人顧奇顧奇將長程任務分為兩類。

一類是循環迭代型任務,圍繞明確目標反覆嘗試,依據可驗證的反饋優化結果。這類任務的關鍵,在於工具與工作流能否穩定運行,以及每輪探索得到的信息能否被有效保存、更新和利用。另一類是系統性任務,包含多層級子任務與複雜依賴關係,需要在較長時間內處理信息流轉、外部事件及環境變化,往往直到整體完成後才能獲得完整反饋。對於後一類任務,單純延長運行時間並不足夠。任務耗時長、反饋稀疏,意味著訓練不能一直等到全部執行結束才更新模型,還需要探索任務分段、過程指導和中途更新等機制。圍繞Harness,即支撐Agent運行的外部框架,顧奇將其拆解為交互界面、信息管理機制和推理腳手架三個部分。

他認為,隨著模型能力增強,預先規定推理步驟的腳手架可能逐漸減少,但環境交互與信息管理仍會長期存在,並隨模型能力演化。模型團隊因此需要將Harness與訓練目標共同設計,明確哪些能力需要輔助,哪些能力應由模型自身掌握。在環境建設方面,顧奇指出,任務難度不能只用工具數量衡量,工具之間的依賴關係、推理的深度與廣度,以及交互中的噪聲同樣重要。團隊通過評測驗證任務難度的拆解方法,再將人工構建環節逐步自動化,以擴展訓練環境,並與算法、基礎設施聯合優化。顧奇認為,未來需要進一步培養模型在陌生環境中主動獲取知識、積累經驗和適應任務的能力,並通過環境與後訓練的持續擴展,探索智能發展的更多可能。

孫彥:規模化長視頻生成,需要把規劃與校驗前置在《面向規模化長視頻生成的Agent Harness》演講中,新加坡國立大學博士生孫彥將討論落到一個具體場景:當AI視頻從數秒延伸至十幾分鍾,乃至嘗試突破小時級長度,如何兼顧生成效率、角色一致性和敘事連貫性?新加坡國立大學博士生孫彥孫彥指出,多片段並行生成時,各片段並不天然共享完整上下文。人物身份、空間關係、事件發生後的角色狀態,以及跨場景的情節銜接,都需要系統性管理。僅依靠模型連續生成回答,或在上下文過長時進行壓縮,難以穩定保存長視頻製作所需的關鍵信息。

為此,團隊探索將影視製作經驗轉化為可執行流程,把用戶需求、故事設定、劇本和製作方案逐層整理成可保存、可檢查、可更新的結構化信息。系統先在文本層面完善故事與畫面編排,再規劃素材及生成方式,讓後續多模態生成建立在更明確的約束之上。其中,劇本與製作方案被分開處理:前者定義觀眾應當看到什麼,後者決定如何實現這些畫面。這樣的設計可以適配不同視頻模型、素材生成工具及3D製作方式。在執行層面,團隊依據素材和片段之間的依賴關係構建生成依賴圖,安排並行製作,並在各階段進行校驗。發現視覺問題後,系統再追溯相關節點,修改前置條件或重新生成對應素材,完成局部返修與合片。

返修也需要區分問題的重要程度,優先處理影響整體銜接和觀看體驗的關鍵錯誤。孫彥表示,隨著生成規模擴大,前期規劃和文本層面的校驗成為影響質量與效率的重要環節。後續探索將進一步根據任務難度動態分配檢查輪次,並把返修中發現的問題儘量前移到素材和製作方案階段,使長視頻生產更加可控。陳勇超:從復現已有知識,走向自主提出和驗證新想法清華大學人工智能學院助理教授、超衍智能創始人陳勇超在《從靜態復刻到自主發現:自進化大模型定義下一代超級智能》演講中,將自進化的目標指向模型在未知領域中的探索與創新能力。

清華大學人工智能學院助理教授、超衍智能創始人陳勇超陳勇超認為,衡量模型不能只看其已經掌握哪些能力,還應關注它進入陌生環境後,能否通過交互發現新的知識。在團隊的研究觀察中,榜單表現更強的模型並不總能提出更有新意的研究想法;過度強調求穩,也可能讓模型更傾向於已有路徑上的漸進改進。因此,在具有試錯空間的科研場景中,需要鼓勵模型提出多樣化假設,再通過實驗和驗證篩選有價值的方向。培養這類能力,首先面臨研究過程數據稀缺的問題。論文通常呈現最終結果,難以完整記錄研究者如何提出問題、嘗試方案、經歷失敗並調整思路。

陳勇超介紹,團隊組織構建了約100個跨領域研究項目,用於評估模型研究能力和積累研究軌跡,但人工建設的速度仍難以滿足大規模訓練需求。針對這一瓶頸,團隊探索讓AI參與數據與研究軌跡的生成,再用於模型後訓練,形成數據與能力相互促進的迭代過程。據他介紹,團隊的科研系統已被用於提出研究想法、配置實驗環境、執行實驗和撰寫論文,並在AI與數學等領域開展探索;相關研究軌跡也被用於提升模型的研究能力。與此同時,陳勇超強調,自主科研仍有多個問題需要解決。首先是如何進一步提高思維多樣性,讓模型既敢於探索不同方向,又能夠評價這些方向的可行性。

其次是成果驗證:隨著AI並行生成研究結果的能力增強,專業人員能否及時判斷結果的正確性與價值,可能成為比生成本身更突出的瓶頸。陳思衡:以前沿研究牽引數據迭代,推動模型遞歸自演進上海交通大學人工智能學院副教授、美國卡內基梅隆大學博士陳思衡,在《AI科學家:以前沿研究牽引遞歸自演進》演講中,將遞歸自演進(RSI)概括為一個問題:上一代AI系統能否迭代出更強的下一代系統,並在這一過程中逐步減少人類參與?上海交通大學人工智能學院副教授、美國卡內基梅隆大學博士陳思衡在他看來,實現有效迭代需要兼顧四個條件:能夠較快獲得驗證反饋,任務難度足以持續牽引能力提升,任務足夠多樣以支持泛化,以及數據與探索能夠規模化。

前沿科學研究涵蓋多個學科,持續產生高難度問題,並具有驗證與證偽機制,因此被團隊選作探索這一方向的重要場景。陳思衡介紹,團隊此前圍繞科研智能體、機器學習任務及仿真環境中的模型訓練開展了多項工作,其中一項重點是通過上下文與記憶調度,讓智能體在長時間、反覆迭代的研究過程中持續作出有效決策。但從進一步提升能力的角度看,系統、模型、基礎設施和數據都可以成為自演進的對象。對於資源有限的研究組織,高價值專業場景中的數據迭代,是一條值得投入的路徑。這一路徑的難點在於,越接近前沿的專業問題,能夠參與出題、解題和評估的人越少。

團隊因而搭建包含知識庫、代碼庫、數據庫和計算工具的科研環境,讓智能體在其中探索,再將研究過程提煉為可用於訓練的數據。由此形成“智能體—環境—數據—模型”的循環:更好的研究軌跡用於訓練更強的模型,新模型再支持下一輪探索。陳思衡展示了團隊基於35B模型開展後訓練的結果。據其介紹,模型在Frontier Science評測上的得分從基礎模型的1.7分,提高至5月版本的31.7分,並在7月版本中達到46.2分。團隊還在機器學習、論文復現和生物信息學等任務中進行了評估,並觀察到部分能力向搜索、代碼等更通用任務遷移的現象。

對於當前進展,陳思衡也明確指出,現有體系仍將人類知識和規則預先沉澱在數據管線之中,屬於較為有限的自動化與自演進。如何進一步減少對人工設計的依賴,提高遞歸迭代的效率,仍是後續研究需要推進的問題。諸葛鳴晨:從哥德爾機到自我改進智能,RSI走向實踐在《The Story of RSI: From Gödel Machines to Self-Improving Intelligence》演講中,KAUST博士、Recursive創始成員諸葛鳴晨,回顧了遞歸自我改進的研究脈絡,並介紹了從編程智能體走向自我改進系統的探索。

KAUST博士、Recursive創始成員諸葛鳴晨諸葛鳴晨指出,RSI並非新近出現的概念,早期研究已經嘗試讓系統改進自身的學習與搜索方式,並考慮一次修改對長期收益的影響。哥德爾機則從形式化的角度探討系統何時應當修改自身。與強調數學證明的理論路線相比,當前的一些實踐更多借助實驗、評測和經驗反饋判斷改進是否有效。隨著模型的編程與推理能力增強,這一長期研究方向開始具備更多落地條件。在他看來,自我改進的重要價值是擴大單位時間內的探索規模。人類研究者的工作時間與精力有限,而Agent可以並行嘗試更多方案,持續執行研究流程,為科學發現與技術改進提供新的可能。

圍繞這一目標,諸葛鳴晨介紹了自己從MetaGPT等工作延伸出的思考:Agent系統需要具備動態擴展與調整組織方式的能力。工具調用、模型推理等操作可以被表示為節點,智能體及多智能體協作可以被表示為由節點和連接組成的圖。這樣,系統優化便可以進一步落實到操作、信息流和協作結構的調整上。他同時強調了評價機制的作用。對於長程任務,如何提供有效反饋、幫助執行中的Agent發現問題,是系統持續改進的重要條件。讓Agent參與評價其他Agent的工作,正是團隊在Agent-as-a-Judge等研究中的探索方向。從輔助研發邁向更自主的研究循環,還需要補足研究方向選擇、實驗決策與成果評估等環節。

諸葛鳴晨認為,研究者的判斷與經驗有望進一步被建模,但目前不少長程工作仍依賴人類介入。他也呼籲,在推進自我改進能力的同時關注安全問題,使技術發展與風險研究同步展開。圓桌討論:我們離“真正的智能”還有多遠?圓桌環節,復旦大學副教授桂韜與陳思衡、顧奇、胡健、諸葛鳴晨、陳勇超等六位嘉賓,圍繞RSI路徑、強化學習、環境建設、自主科研及智能定義等問題展開交流。如何看待RSI,各自選擇突破哪一環?面對關於“相信RSI到什麼程度、正在解決什麼問題”的提問,多位嘉賓表達了對這一方向的期待,但側重點各有不同。桂韜認為,模型能力繼續提升,需要能夠提供新知識的環境,也需要判斷探索結果好壞的評價機制。

陳思衡則將重點放在模型與環境的協同演進,以及前沿研究數據的積累上:當系統能力不斷增強,繼續依賴人類逐步指導可能不再足夠,需要讓它自主探索。顧奇關注兩條路徑:一是讓任務與環境持續適配模型的發展階段,二是讓模型更自主地將原始信息轉化為可學習的知識。胡健表示,AI已經深度參與團隊的強化學習研究,目前仍有人類介入,自動化程度將隨模型與系統能力提升而變化。諸葛鳴晨期待編程與智能能力進一步用於科學探索,擴大有限時間內能夠開展的研究規模。陳勇超則區分了工程執行、研究改進和科學突破,認為當前系統在後兩者上仍有明顯瓶頸,研究型模型需要推動未知知識的發現,創造新的價值。

從AgentGym到持續強化學習,SFT與RL如何分工?桂韜介紹了AgentGym研究線:通過構建可實時交互的任務環境,以完成情況、效率等外部反饋支持模型自由探索,研究其能否在較少依賴人工示範的情況下,獲得工具使用等能力,並向不同任務泛化。圍繞減少監督微調(SFT)的追問,他解釋,SFT的重要作用是幫助模型獲得初步的環境探索能力;當模型已經具備這一基礎,後續提升可以更多依靠強化學習(RL)中的自主嘗試與環境反饋。尤其當人類難以繼續提供更好的示範軌跡時,高質量環境和反饋信號就更加關鍵。桂韜表示,團隊正將更多注意力投入持續強化學習。

他認為,RL仍有較大的探索空間,但這並不意味著可以忽略初始能力建設,而是需要根據模型所處階段調整訓練方式。為什麼訓練框架要做減法,強化學習的瓶頸又在哪裡?針對“行業不斷擴大規模,為何反而精簡框架”的問題,胡健回應,面向研究的基礎設施需要便於理解和修改,尤其當Agent開始參與強化學習研究時,複雜框架會增加自動實現想法的難度。精簡框架也有助於研究訓推一致性等問題,為長期穩定訓練提供支持。不同團隊承擔的工程規模與任務不同,因此框架設計不存在統一取捨。面對強化學習還有多大空間這一問題,桂韜將重點放在獎勵信號的可靠性上。

長程任務可能產生極長的執行軌跡,僅憑最終結果正確與否,難以判斷模型是否真正完成了預期工作,還是利用了環境漏洞或其他捷徑。因此,環境與獎勵系統需要隨模型共同改進,才能持續提供有效訓練信號。胡健補充,如何可靠地擴展環境與訓練數據,以及讓大規模強化學習穩定運行,仍是開放研究中的重要挑戰。未來的訓練環境與Agent基礎設施會是什麼樣?陳勇超認為,環境將更加接近真實科研:既需要GPU、CPU等計算資源,也需要專業工具、仿真軟件,乃至自動化實驗平臺。相應地,任務會更長、驗證成本更高。諸葛鳴晨強調,還需要把分散的任務串聯成完整的自我改進循環,不能僅依靠單點能力的驗證。

從工程角度,胡健指出,大量環境如何併發運行並穩定連接訓練系統,是擴展過程中的現實難題。顧奇提出,可以先由研究者拆解問題、完成初始設計,再讓自動化管線持續從真實數據和任務中吸收信息,豐富和改進環境。陳思衡重申,環境應兼顧驗證效率、任務難度、多樣性與規模化,並逐步建立連接外部世界的接口;從數字環境走向物理環境時,反饋速度下降也需要被納入設計。桂韜則補充了兩個衡量角度:環境的信息密度,以及任務對應的人類有效工作時長。相比單純拉長文本,更豐富的信息關聯和更復雜的工作過程,才可能為訓練帶來新的挑戰。參數變大,為什麼不一定更會使用工具?

圍繞模型的“逆縮放”現象,陳勇超回顧了團隊在部分任務中的觀察:較大的模型有時更傾向於直接用文本回答,而非編寫代碼或調用工具,導致任務表現未隨規模增長而改善。他認為,這可能與訓練數據分佈、工具使用樣本不足,以及獎勵設計中的工具調用成本有關。這一現象說明,參數規模並不能自動解決行動策略的選擇問題,模型還需要學會判斷何時應當藉助外部工具。如何把一次實驗的經驗,變成下一輪的能力?陳思衡指出,如果Agent只是反覆執行任務,卻未能將經驗有效保留和內化,就不能據此認為系統發生了能力提升。他提出分層積累經驗的思路:知識可以進入模型參數、LoRA權重,也可以保存在Harness、Skill或外部存儲中。

不同形式適合不同用途,系統需要根據重要性、訪問頻率和使用方式進行選擇。真正困難的是判斷哪些信息值得保留、是否正確、存在怎樣的不確定性,以及未來是否可能有用。經驗的篩

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

7 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前