120萬星!開發者排隊“投簡歷”,DeepSeek一條內測帖,變成了Agent開源大摸底

重點摘要
DeepSeek的Agent Harness團隊負責人崔添翼於8月1日發文招募內測人員,吸引769位開發者提交712個開源倉庫,合計超過120萬Stars,涵蓋長任務執行、記憶管理與安全評測等Agent基礎設施方向。社區推測DeepSeek可能基於Harness打造對標Claude Code的AI Coding Agent,但官方尚未證實。這場招募意外揭露了Agent工程化的關鍵能力版圖,包括穩定執行、上下文管理與安全控制等挑戰。
DeepSeek一則內測招募貼文,意外點燃了開源Agent社群的熱情。八月一日,DeepSeek的Agent Harness團隊負責人崔添翼公開徵求內測參與者,條件是申請者須曾參與開源Agent專案的建立與維護,並提供GitHub倉庫作為代表作品。原本只是一則技術團隊的常規徵才訊息,卻在短短數日內演變成一場橫跨整個開源生態的全面盤點。 大量開發者帶著各自的專案湧入留言區,從個人Harness、Coding Agent,到記憶系統、安全工具與評測框架,幾乎涵蓋了當前Agent基礎設施探索的所有面向。根據開發者自發性的統計,截至八月三日上午十一點三十分,共計有七百六十九位報名者,扣除重複後共七百一十二個開源倉庫,累計超過一百二十萬顆星數,橫跨十八個技術賽道。原本低調的內測招募,瞬間成為一場公開的開源Agent路演,這份統計資料也被整理成公開的倉庫清單供外界參考。 從目前已公開的資訊來看,DeepSeek已經在內部使用Harness完成了DeepSeek-V4-Flash正式版的基準測試。這項動態讓社群開始推測,DeepSeek下一步可能打造一款專注於軟體工程場景的AI Coding Agent。根據社區流傳的說法,這款產品可能具備自主規劃、工具呼叫、程式碼執行等能力,並針對長週期的Agent工作流程加入記憶機制與專案倉庫感知(Repo Awareness)等功能,在定位上可能對標市面上現有的Claude Code、Codex等Coding Agent產品。 雖然這些資訊尚未獲得DeepSeek官方證實,但從先前公布的Harness基準測試成績來看,DeepSeek的測試重點本身就集中在終端操作、多工具呼叫與全端開發等長流程任務場景。若社群預測成立,Harness所扮演的角色,正是連接模型能力與真實軟體工程流程之間的執行層。而這場由七百多位開發者、七百多個開源倉庫共同參與的評論區路演,也提前揭露了AI Coding Agent走向工程化所需持續升級的關鍵能力版圖:如何讓Agent長時間穩定運作、如何管理專案上下文與記憶、如何控制工具呼叫風險,以及在真實開發環境中完成從理解需求到交付程式碼的完整閉環。 關於Harness的定位,業界一直存在一個簡潔的公式:Model加上Harness等於Agent。模型負責理解需求、推理與生成方案,Harness則負責將這些能力落實到真實環境中,包括呼叫工具、操作終端、讀寫檔案、管理上下文、處理執行過程中的錯誤,最終完成一個完整的任務閉環。將目前公開的資訊綜合來看,DeepSeek Harness的定位已經逐漸清晰:它並非單純的程式碼產生工具,而是在模型與真實軟體工程環境之間增加了一層執行系統。 這項定位在DeepSeek-V4-Flash成績單中的五組基準裡體現得尤為明顯。Terminal Bench測試終端環境操作,Cybergym測試安全攻防能力,Toolathlon測試多工具呼叫,DSBench-FullStack與DSBench-Hard則聚焦全端開發任務。這些測試的共通點在於任務鏈條長、步驟多,需要Agent持續呼叫工具並根據回饋調整策略。DeepSeek選擇的測試方向,更接近一個能夠自主執行軟體工程任務的Agent,而非單純的程式碼生成輔助工具,這也與社群流傳的對標Claude Code、Codex等產品的目標相互呼應。 除了基準測試之外,DeepSeek的生態動作也透露出類似訊號。公開資訊顯示,DeepSeek-V4-Flash已支援Responses API,並適配Codex,走向標準化的工具呼叫協議;識圖模式正在灰度測試中,用以補強程式碼Agent在理解架構圖、報錯截圖等視覺資訊上的能力。這些動作共同指向一個趨勢:未來Coding Agent的競爭,不僅取決於模型能力本身,更取決於模型之外的工程基礎設施是否完備。 七百六十九份報名記錄所反映的,正是開發者對Agent工程化的真實關切。當Agent需要獨立完成一個真實的工程任務時,首先面臨的是長任務執行能力。這是Agent從展示走向生產環境的第一道門檻,若Agent只能完成一次性呼叫,便無法覆蓋Terminal Bench或DSBench這類需要多步驟、多工具協作的複雜任務。從報名專案來看,智慧體框架與程式設計智慧體是最大的兩個方向,合計兩百四十二個,約占全部專案的三分之一。在Top 10高星專案中,deer-flow以七萬九千顆星探索長週期SuperAgent框架,CodeWhale以四萬顆星從DeepSeek原生專案發展為程式設計智慧體框架,orca則以三萬六千顆星關注多Agent編排。這些開源專案路徑各異,但都在解答同一個問題:如何讓Agent在持續執行上走得更遠。 其次是上下文與記憶管理。當任務從幾分鐘延長到幾個小時,Agent所面臨的不僅是推理能力問題,還包括如何保存狀態、理解專案歷史,並在後續任務中正確呼叫既有資訊。在報名統計中,記憶與上下文相關專案共有五十六個,累計十九萬四千顆星,即使剔除頭部專案vllm的八萬八千顆星後仍約有十萬六千顆星。開發者正在嘗試透過Git、資料庫、知識圖譜等不同技術路線來解決這個問題,但Agent記憶至今仍未有統一答案。 最後是評測與安全。研究與評測、安全治理兩個方向各有二十四個專案,是報名生態中規模較小的類別,卻決定著Agent能否真正進入生產環境。有開發者嘗試建立跨Harness的評測體系,也有開發者關注工具呼叫權限、檔案系統隔離與程式碼執行沙箱。如果長任務執行與記憶解決的是Agent能不能完成任務的問題,那麼評測與安全解決的則是Agent能不能被放心使用的問題。這三個方向對應了Agent從能用走向好用的關鍵迭代路徑:長任務執行能力決定Agent能否完成複雜工作,上下文與記憶能力決定Agent能否持續參與長期專案,而評測與安全能力則決定Agent能否被真正部署到生產環境。 DeepSeek官方尚未公布最終的篩選標準與名單,或許未來也不會公開。但從這份報名統計表來看,真正有價值的,是開發者們正從不同角度探索Agent落地應用的路徑。對於DeepSeek Harness團隊而言,內測名單的意義或許並非尋找最熱門的專案,而是找到能夠在產品迭代過程中提供有效回饋的開發者。首先,是驗證模型能力如何轉化為執行能力,這正是Harness的核心挑戰。名單中的akashic-agent作者,便是在V4 Flash高思考強度模式下運行TerminalBench 2.1,取得百分之七十點八的成績,是基於DeepSeek模型調校Agent執行時並給出實測結果的開發者。 其次,是驗證Harness能否進入真實應用場景。一個Agent基礎設施最終能否成功,不僅取決於底層技術能力,也取決於它是否真正滿足開發者與應用場景的需求。這次報名中的open-design、lobehub、career-ops等高星專案,都已累積一定的使用者基礎,並處於Agent應用生態的上層。這些開發者長期面對真實使用者與實際工作流程,能夠幫助DeepSeek了解Harness在不同場景中的使用需求。對於仍處於探索階段的Agent基礎設施而言,這類來自一線應用的回饋,往往比單純的測試數據更具參考價值。 此外,Agent產品化還需要提前發現安全風險。隨著Agent取得更強的工具呼叫與程式碼執行能力,權限控制、檔案隔離與安全邊界等問題將日益重要。報名區中有開發者曾挖掘Codex、Claude Code、Cursor等產品的漏洞,關注的正是這些Agent從展示走向產品化時必須面對的挑戰。當然,這份名單並非完整樣本,由於留言區天然混雜報名、討論與圍觀,加上提交格式不統一,部分專案仍存在身分無法確認、倉庫失效或描述缺失等問題。這份統計檔案也並非完全精確,外界在核查過程中已發現部分開源專案的分類出現錯誤,例如有遊戲相關專案被歸入安全領域,但整體而言仍具參考價值。同時,許多高星專案的報名者並非作者本人,有部分僅是提交過Pull Request的參與者,並不能完全代表這些Agent專案的全貌。 DeepSeek Harness最終會以什麼樣貌呈現,目前尚無定論。但這場由內測招募所引發的開源專案大摸底,已經揭露了Agent時代的競爭焦點。七百六十九份報名記錄、七百一十二個開源倉庫與一百二十萬顆星數背後,開發者關注的是一個根本性問題:當模型具備越來越強的推理能力之後,如何讓它穩定、長期且可靠地完成真實任務。有人在解決長任務執行,避免Agent中途失控;有人在探索記憶與上下文管理,讓Agent能理解持續演進的專案;也有人正在測試安全邊界,確保工具呼叫與程式碼執行不會成為新的風險來源。這些專案未必都會進入DeepSeek的內測名單,但它們已經提前描繪出一張未來Agent工程演進的路線圖。
Related
相關文章

物理AI不是下一個風口,而是下一輪工業革命
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

開源版Claude Science來了,零依賴、MIT協議,內置30+項科研Skills
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?
首部AIGC故事片《奇譚》,究竟是怎麼做出來的?文娛先聲2026.08.04 17:56 · 來自北京全文4045字從製作流程到商業化路徑,《奇譚》的探索證明,AI影視的發展並非簡單替代傳統影視,而是在人工創意與AI能力結合下,重新定義影視生產方式。文 | 文娛先聲,作者 | 王燁 AI影視,迎來了首部獲得官方發行許可的長片作品。近期,《奇譚:紙刃渡荒墟》(以下簡稱《奇譚》)在愛奇藝正式上線。

斷電0.01秒燒掉幾十萬:AI最隱秘的暴利賽道,中企瘋搶
AI 的運算能力正在成為這個時代最稀缺的資源,但支撐這一切運轉的,除了那些昂貴的圖形處理器(GPU),還有一套外界幾乎看不見的電力系統。每天有無數人對著人工智慧對話框輸入指令、要求生成圖片或影片,每一次請求的背後,都是成千上萬顆GPU在瞬間進入滿載狀態。這些晶片的用電模式和傳統數據中心截然不同,過去機房的電力負載相對平穩,現在AI的GPU則像一輛在怠速與全油門之間來回切換的跑車,用電量在毫秒級別內暴起暴落。

OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題
OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。

DeepSeek低價風暴打服硅谷!海外平臺爭相倒貼V4 Flash
DeepSeek V4 Flash以極低價格與大幅提升的性能引發全球開發者熱潮,海外平台如Nous Portal和Cline甚至自行加碼補貼,顯示其成本優勢驚人。該模型經後訓練優化後,多項評測分數大幅躍升,能力直逼頂尖模型,但價格僅為後者的百分之一,讓開發者能以極低成本實現AI產品原型。文章認為這象徵AI進入類似福特T型車普及的黃金時代,並預告DeepSeek Code工具可能即將推出。