MarkTechPost AIAI Agent

KwaiKAT Team Releases KAT-Coder-V2.5: An Agentic Coding Model Trained on 100,000+ Verifiable Repository Environments

2026年7月26日 10:46

重點摘要

KwaiKAT 團隊推出 KAT-Coder-V2.5,這款編碼代理模型以超過 10 萬個可驗證的真實倉庫環境訓練,能自主進行程式碼生成、除錯與跨檔案修改。不同於傳統補全模型,它具備工具呼叫與自我修正能力,並已開源模型權重與訓練框架,推動程式碼生成從被動補全轉向主動代理。

站內 AI 整理稿

**KwaiKAT 團隊發布 KAT-Coder-V2.5:以十萬級可驗證倉庫環境訓練,推動編碼代理邁向自主智能**

KwaiKAT 團隊近日正式推出 KAT-Coder-V2.5。這是一款專為自主編碼任務設計的智能體模型,最大特色在於其訓練資料涵蓋超過 10 萬個可驗證的真實倉庫環境。這些環境模擬開發者在日常工作中會遇到的程式碼生成、除錯及跨檔案理解等多元場景,使模型能從具體的任務回饋中學習並強化決策能力。與傳統以 next-token prediction 為核心的程式碼語言模型不同,KAT-Coder-V2.5 被建構成一個能夠在複雜倉庫中自主行動的「代理」。它不僅要生成語法正確的程式碼,還需要具備工具呼叫(tool calling)、對執行結果進行迭代分析,以及根據錯誤訊息自我修正的能力。

這種設計意圖讓模型更貼近人類開發者的工作流程,而非只是做片段式的補全。訓練此類代理模型的一大挑戰是如何獲得高品質的互動學習資料。KwaiKAT 團隊的做法是建構大規模、可驗證的環境池 —— 每一個環境都對應一個具體的開發任務與對應的驗證測試。模型必須在環境中嘗試、執行、觀察結果,並調整策略直到通過驗證,從中學習到穩健的程式碼生成與除錯策略。這種「環境作為教師」的訓練範式,正是 KAT-Coder-V2.5 能力的核心來源。在標準評測方面,KAT-Coder-V2.5 在 RepositoryBench 等倉庫層級任務上展現了更穩定的表現。

尤其是在需要跨檔案理解、API 調用鏈追蹤或根據錯誤訊息進行精確修改的場景中,該模型較傳統模型更容易給出正確的最終方案。團隊指出,模型在回饋利用的穩定性上有顯著提升,不會因為一兩次執行錯誤就偏離正確方向。KAT-Coder-V2.5 的發布也標誌著程式碼生成領域正經歷從純粹的補全工具向智能編碼代理的轉型。過去幾年,程式碼語言模型大多專注於生成單一函式或完成當前行,使用者仍需手動將產出整合進專案中。而隨著代理模型的成熟,模型開始承擔更多探索、除錯與整合工作,這對提升開發效率、降低重複性勞動具有實際價值。值得一提的是,KwaiKAT 團隊此次開放了模型權重以及相關的訓練框架。

這意味著研究人員可以在自己的任務場景中複現訓練流程,或利用該模型做進一步的微調與應用開發。開源策略不僅有助於學術界驗證方法的可複現性,也可能加速產業界在軟體開發自動化上的實際部署。從技術層面來看,KAT-Coder-V2.5 的成功顯示出可驗證環境訓練在代理模型中的巨大潛力。傳統語言模型多依賴於靜態語料庫,而透過環境互動獲得的獎勵訊號,則能幫助模型學會因果推理與策略調整。這對未來開發更通用、更具適應性的程式碼代理提供了一條明確路徑。對於一般開發者而言,這類模型最終可能改變日常編碼的方式。

想像一個能理解整個專案結構、自動定位 bug 來源、並在修正後跑測試確認結果的助手,它將使得開發者能更專注於架構設計與創意解決方案,而非浪費時間在重複性的除錯循環中。當然,代理編碼仍處於早期發展階段。目前模型對於極度複雜或罕見的專案結構尚有適應瓶頸,工具呼叫的準確率與執行效率也有提升空間。但 KAT-Coder-V2.5 已證明,大規模環境訓練能夠顯著強化模型的自主探索與修正能力,是往正確方向邁進的重要一步。KwaiKAT 團隊表示,未來將繼續擴大環境多樣性與任務難度,並探索多模態資訊(如程式碼與文件、issue 的整合)對代理能力的影響。

隨著這些技術累積,以智能體為核心的編碼輔助模式可望從研究實驗室逐步走向主流開發場景。總的來說,KAT-Coder-V2.5 的發布不僅是一次模型更新,也代表了編碼 AI 從「被動補全」到「主動代理」的關鍵轉折。透過公開資料與框架,整個社群都能參與迭代,共同推動軟體開發自動化進入一個更具智慧與互動性的新階段。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

3 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

8 小時前