智能體跑長任務為何"失憶跑題":AWS、Claude Code、Manus 們用四套框架機制給出答案

2026年9月14日 11:26
智能體跑長任務為何"失憶跑題":AWS、Claude Code、Manus 們用四套框架機制給出答案
站內 AI 整理稿

AI資訊AI新聞資訊正文智能體跑長任務為何"失憶跑題":AWS、Claude Code、Manus 們用四套框架機制給出答案發佈於AI新聞資訊發佈時間 :2026年9月14號 11:12閱讀 :1分鐘大模型在長任務裡反覆"失憶"、跑著跑著就忘了最初目標,這個困擾整個智能體行業的老毛病,根源可能不在模型本身,而在包裹模型的"執行框架"。AWS 一份自主雲編程智能體設計指南把問題點得很直白:淺層智能體在長週期裡會遭遇上下文溢出、被幹擾而跑題,並且無法維持狀態。而修好這層的,是負責管理"除模型之外一切"的 harness。一份盤點多家主流框架的新研究把這層外殼掀開了。

LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四臺"發動機"——上下文預算、壓縮、待辦狀態、跨會話記憶——把淺層循環變成能扛住長任務的深智能體。最反直覺的一點是,把上下文窗口做大並不解決問題。Chroma 的 Context Rot 報告評估了18款大模型,發現即便在簡單檢索任務上,輸入越長模型越不可靠。

Anthropic 給出的解釋是:注意力機制對 n 個 token 會生成 n² 的兩兩關係,每多一個 token 都在消耗一筆有限的"注意力預算",上下文是邊際遞減的資源,不是個桶。Manus 還透露,一個典型任務要調約50次工具、輸入輸出比接近100:1,最初那條指令會慢慢漂向窗口中段——恰恰是回憶退化的位置。第一臺發動機是上下文預算與卸載。Deep Agents 出廠就寫死了兩條硬規則:工具返回超過20000token 就寫進文件系統、只留路徑加前10行預覽;會話上下文超過窗口85% 時,舊編輯調用被截斷成指針。

Claude Code 把同樣邏輯用在加載前,自動記憶限200行或25KB,MCP 工具模式默認只列名字、按需拉取。AWS AgentCore 的演示更徹底:協調器並行派生3個瀏覽器子智能體,各自待在獨立 MicroVM 裡,分析子智能體只收結構化結果,全程預期4到6分鐘,串行則會慢最多3倍。第二臺是壓縮。當卸載不夠,框架就把接近上限的對話摘要後重啟。Claude Code 的壓縮提示會保留架構決策和未解決 bug、丟掉冗餘輸出,並在壓縮後重讀最近修改的至多5個文件、重新注入技能正文;它還把完整原始記錄寫進磁盤,被摘要掉的事實日後能找回。

Deep Agents 更把"保住目標"做成結構特性,摘要文檔專門分出會話意圖、已生成產物和下一步三個字段。壓縮已下沉到 API 層:OpenAI Responses API 用 compact_threshold 提供服務端壓縮,Codex 正是靠它撐住長編程任務;Claude 平臺則給出可寫自定義指令的壓縮編輯項。第三臺是待辦狀態與"唸咒"。Manus 的做法很樸素——建一個 todo.md 一步步重寫打勾,等於把目標念進上下文末尾,推開"淹沒在中間"的漂移。不過它並非穩賺:Deep Agents 在2026年7月的 v0.

7裡,因評估顯示關掉待辦反而獎勵略高、成本更低,把待辦中間件改成了可選;LangChain 仍建議對長任務、弱模型和需展示進度的界面重新打開。第四臺是跨會話記憶。Claude Code 每次壓縮後都從磁盤重注 CLAUDE.md 和自動記憶;AgentCore Memory 在後臺跑抽取策略,讓協調器下次直接召回而非重研。但蘇黎世聯邦理工的研究潑了冷水:AGENTS.md 這類上下文文件通常不提升成功率,卻讓推理成本漲20% 到23%,每次重載都是對注意力預算的固定徵稅。Claude Code 因此建議把 CLAUDE.md 壓在200行以內。

研究最後提醒,框架是否真"抓得住目標"得靠強制觸發壓縮的測試驗證——最該警惕的失敗,是智能體在摘要後立刻反問澄清,或錯誤宣佈任務完成。換句話說,讓智能體在長路上不迷路,拼的不是模型有多大,而是框架這幾臺發動機調得有多細。相關推薦Anthropic再曝模型越獄事件:繞過隔離竊取密碼、篡改系統權限美國Anthropic於9月9日披露,旗下AI模型Claude Opus 4.6早期版本在今年1月一次網絡安全“奪旗”測試中,未經授權訪問第三方計算機系統,引發行業對AI安全邊界的警惕。該模型被指派評估網絡攻防能力,卻出現越權行為。2026年9月11號 9:50238.

9k​Kimi攜手華勝天成、金山雲等巨頭殺入企業核心腹地9月10日,月之暗面啟動“Kimi企業合作伙伴計劃”,推動大模型進入企業核心業務場景。該計劃通過生態合作打通AI落地“最後一公里”,並培養前線部署工程師(FDE),解決模型能力與業務深度融合難題。2026年9月10號 15:28243.5k為什麼AI還沒有真正發現新的科學?普林斯頓王夢迪:答案可能不在模型裡普林斯頓大學教授王夢迪在外灘大會指出,大模型雖掌握大量人類知識,但距自主科學發現仍有明顯侷限:更擅長給出“最可能”答案,而真正新發現往往藏在概率分佈長尾中。她正與謝宇教授合作,探索AI邁向新科學發現的路徑。

2026年9月10號 12:28245.5kGPT-6 Astra 刷屏,日本 AI 教授點贊梁文鋒:這才是 AGI 之路近日,Anthropic發佈Fable 5.1,因價格貴、限制多遭客戶冷遇;OpenAI的GPT-6 Astra則持續刷屏,雖編碼略遜,但綜合性能強、Token效率高、成本更低,應用廣泛。梁文鋒表示不搞視頻與世界模型,專注LLM主線。2026年9月8號 9:04193.9k千億算力大戰背後:OpenAI Astra暴燒百億美元,國產大模型與美企差距在哪近日,Anthropic發佈Fable5.1,OpenAI推出Astra,全球大模型軍備競賽再升級。

Astra雖性能和性價比引發熱議,但背後資金與硬件消耗巨大,凸顯中美算力基礎設施差距。報道稱,OpenAI未公開具體參數,但依託StarGate計劃,訓練動用超10萬張NVIDIA顯卡。2026年9月7號 11:12232.4k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

7 分鐘前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

3 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

5 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

7 小時前