讓AI Agent學會“及時停手”:華盛頓大學團隊提出上下文工程方法CONVOLVE

重點摘要
華盛頓大學團隊提出上下文工程方法CONVOLVE,讓AI Agent學會在任務不可行或無法完成時及時停止行動。研究發現多數Agent難以判斷何時該棄答,而CONVOLVE能顯著提升棄答能力,且小模型總結的規則可遷移至大模型。
讓AI Agent學會“及時停手”:華盛頓大學團隊提出上下文工程方法CONVOLVE賬號已註銷·2026年07月06日 10:23無需更新模型參數 如果任務本身不可行,或在當前環境中無法完成時,Agent 該在什麼時候“停手”?我們希望,Agent 能在多輪交互中及時調用搜索、網頁瀏覽和終端工具,從而完成複雜任務。但在現實情況下,用戶的請求不一定清晰,目標也不一定能實現。很多 Agent 並不知道什麼時候該停下來,常常在任務已經不可行時仍繼續搜索、點擊和調用工具。
針對這個問題,華盛頓大學團隊提出了Agentic Abstention 框架,專門研究 Agent 何時該停止行動,並設計了一種上下文工程方法 CONVOLVE(Context Evolution)來提升 Agent 的棄答能力。28733 結果顯示,大多 Agent 很難做到及時棄答,也往往不能在證據已經足夠時立即停止執行。更大的模型、更強的推理雖然能在一定程度減少過度棄答,但未必能提升整體棄答表現。模型能力、推理方式和 Agent 框架都會影響棄答效果。不過,CONVOLVE 可以顯著改進棄答能力,且具有很強的遷移性:小模型總結的規則,同樣能幫助大模型提升表現。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。