阿里雲 Qoder 開源 Better Harness,面向編程 Agent 的分析與持續改進工具

重點摘要
首頁 > 智能時代>人工智能 阿里雲 Qoder 開源 Better Harness,面向編程 Agent 的分析與持續改進工具 2026/7/29 9:56:31 來源:IT之家 作者:故淵 責編:故淵 評論: 感謝IT之家網友 Domado 的線索投遞!
阿里雲旗下智能體編程平臺Qoder,於昨日(7月28日)正式在GitHub上將一款名為Better Harness的工具開源。這款工具專為程式設計代理(Coding Agent)的工作流程設計,旨在提供系統性的分析與持續改進能力。此舉不僅彰顯了阿里雲在AI開發工具領域的技術積累,也為開源社群帶來了新的實用資源,協助開發者更深入地理解和優化Agent的實際表現。Better Harness並非一般的配置管理工具,而是一套涵蓋工程實踐、評估模型與運行實現的完整框架。
其核心目標是串聯起Harness Engineering與Loop Engineering兩種工程方法,讓開發者能夠從更宏觀的視角檢視Agent的運作。透過這套工具,使用者可以不再僅依賴於主觀判斷,而是基於系統化的證據來驅動Agent行為的迭代與改善。在功能設計上,Better Harness採用了與傳統思維截然不同的檢驗邏輯。它不會因為開發者配置了一項功能,就認定該能力已被有效啟用。相反,工具會主動驗證Agent是否真正在運行過程中運用了這些配置,並進一步判斷所運用的能力是否確實協助完成了指定的任務。
每一個被記錄的發現(Finding),都必須包含可回溯的具體證據、對使用者的實際影響、建議的修復範圍以及可操作的驗證方式,以確保問題追蹤與解決的嚴謹性。為了讓這套方法論能夠廣泛應用與持續演進,Better Harness項目設計了三層開源體系。第一層為Harness Engineering實踐層,聚焦於具體的開發環節,包括工作階段管理(Session)、命令列介面(CLI)、系統可觀測性、規則設定(Rules)、技能整合(Skills)、模型上下文協定(MCP)、記憶體管理(Memory)、鉤子機制(Hooks)以及自動化流程。這些實踐為Agent的穩定運行提供了基礎支撐。
第二層是Agent Work Loop評估模型,扮演著轉換與校驗的角色。它將第一層的工程實踐轉化為具體、可逐項核對的問題,並嚴格規範證據、評分與最終結論之間的邏輯鏈條。這樣的設計讓評估過程變得透明且可複現,避免了模糊的判斷。第三層則是可運行的工程實現,這是確保理論落地、形成閉環的關鍵。這一層賦予了前兩層實際的生命力,讓Harness Engineering的實踐與Agent Work Loop的評估模型不再僅停留於文檔或概念階段,而是能夠被套用到真實的軟體專案中,反覆執行與驗證。為了全面捕捉Agent的運作狀態,Better Harness會獨立收集三種類別的證據。
首先是工作階段證據(Session Evidence),記錄Agent在每次互動中的行為軌跡。其次是專案整體配置證據(Project Harness),反映專案層級的架構與設定。最後是客製化證據(Agent Customize),捕捉開發者針對特定Agent進行的調整。這三類證據相互補充,構成了全方位分析的基礎。根據官方公開的資訊,Better Harness在首輪內部評測中已經覆蓋了30個GitHub上的真實開源專案。這項測試驗證了工具在不同場景、不同複雜度項目中的適用性,也為後續的廣泛推廣積累了實際經驗。
此外,Better Harness目前已經適配多款主流的程式設計代理,包括Claude Code、Codex、Qoder與Cursor,開發者可以根據自身需求選擇整合。這款工具的開源,對於開發者社群與AI輔助開發領域都具有重要意義。它提供了一個客觀的評估框架,幫助開發者辨識Agent工作流程中的瓶頸與潛在問題。透過持續的分析與改進,開發團隊可以更有系統地提升Agent的任務成功率,減少無效運算與錯誤嘗試,最終提升整體的開發效率與軟體品質。總結來看,阿里雲Qoder開源Better Harness,是面向AI代理開發維運領域的一次實質性推進。
它不僅提供了一款具體的工具,更輸出了一套可複用的工程方法與評估標準。對於正在探索或已經導入程式設計代理的團隊來說,這套開源方案無疑提供了一個重要的參考基礎與實作工具。有興趣的讀者可直接前往Better Harness的GitHub倉庫查閱原始碼與詳細文檔,進一步了解其實現細節與應用方式。國際數據公司(IDC)近期報告指出,AI輔助開發工具正快速滲透企業級軟體開發流程,而開源生態的完善將是推動這一趨勢的關鍵動力。此番阿里雲的行動,或許將加速更多開發團隊擁抱數據驅動的Agent優化策略。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。