讓AI Agent學會“及時停手”:華盛頓大學團隊提出上下文工程方法CONVOLVE

2026年7月6日 10:34
讓AI Agent學會“及時停手”:華盛頓大學團隊提出上下文工程方法CONVOLVE

重點摘要

華盛頓大學團隊提出上下文工程方法CONVOLVE,讓AI Agent學會在任務不可行或無法完成時及時停止行動。研究發現多數Agent難以判斷何時該棄答,而CONVOLVE能顯著提升棄答能力,且小模型總結的規則可遷移至大模型。

站內 AI 整理稿

讓AI Agent學會“及時停手”:華盛頓大學團隊提出上下文工程方法CONVOLVE賬號已註銷·2026年07月06日 10:23無需更新模型參數 如果任務本身不可行,或在當前環境中無法完成時,Agent 該在什麼時候“停手”?我們希望,Agent 能在多輪交互中及時調用搜索、網頁瀏覽和終端工具,從而完成複雜任務。但在現實情況下,用戶的請求不一定清晰,目標也不一定能實現。很多 Agent 並不知道什麼時候該停下來,常常在任務已經不可行時仍繼續搜索、點擊和調用工具。

針對這個問題,華盛頓大學團隊提出了Agentic Abstention 框架,專門研究 Agent 何時該停止行動,並設計了一種上下文工程方法 CONVOLVE(Context Evolution)來提升 Agent 的棄答能力。28733 結果顯示,大多 Agent 很難做到及時棄答,也往往不能在證據已經足夠時立即停止執行。更大的模型、更強的推理雖然能在一定程度減少過度棄答,但未必能提升整體棄答表現。模型能力、推理方式和 Agent 框架都會影響棄答效果。不過,CONVOLVE 可以顯著改進棄答能力,且具有很強的遷移性:小模型總結的規則,同樣能幫助大模型提升表現。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前