DeepSeek Harness 入選項目疑似曝光,不選萬星「花瓶」,死磕 Agent 基建

2026年8月13日 10:16
站內 AI 整理稿

當下剛需的基建方向,全被 DeepSeek Harness 鎖定 作者丨高允毅 編輯丨岑 峰 昨晚,DeepSeek V4 Pro 正式發佈,性能全面逼近 Fable 5 ,價格卻只有1/57 ,再次坐實了 “智價比之王” 的美譽。如果細看官方公佈的十項基準測試的話,那些亮眼的數據,其實都表明DeepSeek想全面邁向“工業級 Agent 生產線”,比如它補齊了軟件開發和工程能力短板,在終端報錯、工具調用、長程任務都有不錯表現。另一方面,當模型的智力水平已經無限拔高,即將推出的 DeepSeek Harness,正是它補齊 Agent 落地能力的關鍵後手。

而今天網上爆出一份DeepSeek Harness內測入選項目局部名單,進一步將DeepSeek的發力方向勾勒清晰。DeepSeek 的篩選標準很有特色:不看名氣,70% 的入選項目是幾乎零熱度的個人或小團隊新作,大熱的“高星”項目反而落選。因為很多高星項目做的是通用工具,未必為原生Harness設計。而不少小眾項目,本身在做Codex、Claude Code、Pi插件,可以順勢適配DeepSeek Harness。更重要的是,DeepSeek似乎更關注這些項目能否填補上它的生態空白,比如特殊的UI、創新編排模式。要有實際的功能,不能是空架子。

在種種條件下,這些入選項目集中體現在一些賽道上:首先,整個項目的生態要圍繞Harness核心能力展開,這主要體現在MCP插件與 Coding Agent項目佔比最高,能解決工具調用與代碼落地的核心痛點。其次,項目還集中在 Agent Runtime(運行時)、編排框架、可視化 UI 與多智能體調度 等Agent適配層,直接影響環境跑起來安不安全、長任務容易跑偏、黑盒執行看不見、多模型如何協作等具體問題。相較而言,醫療、法律、金融等垂直應用項目佔比不足 4%。01都有哪些入選項目?這個局部名單中,已經列出了17個開源項目,我們選取了其中的4個項目,看看都是什麼類型的Harness工具。

▎安全操作系統openma-ai(224顆星)open-managed-agents(簡稱 OMA)是一套典型的“安全操作系統”。雖然只有224顆星,但它能解決 Agent 落地時最頭疼的問題,即代碼跑起來之後,怎麼保證安全可控。傳統的 Agent 框架大多隻負責 “讓模型怎麼想”,管不了 “代碼跑起來安不安全”。OMA利用對Claude Managed Agents 的開源復刻,正好補上了這一塊。首先,它可以通過在網絡網關層自動注入憑證,實現了密鑰與執行沙箱的全程隔離。這樣AI幹活的時候不知道密碼,就不會被Prompt 注入攻擊。

同時,OMA 把每步操作都以事件日誌形式持久化保存,相當於給任務做了“自動存檔”,這樣就不怕進程意外中斷。它還自帶沙箱和企業工具包,在GitHub、Slack 這些協作平臺可以開箱即用,讓Agent真正變成企業的“數字員工”。面對如今各種頂尖的大模型大腦,OMA 的作用正是為Agent落地“保駕護航”。從技術定位上看,OMA 瞄準的是 Agent 執行層,負責管理沙箱生命週期、分發 MCP 工具、維護 WebSocket 會話廣播,屬於典型的執行層基礎設施。https://github.

com/openma-ai/open-managed-agents▎智能路由role-model(97顆星)role-model 走的是“智能路由”的技術路線。雖然是不到百星的小項目,但它可以讓Agent的成本可控。它最擅長的是精準判斷任務難度,把活派給最合適的模型。對於DeepSeek-R1而言,無論任務多簡單它都傾向於“長思考”。當 Agent 執行自動化流水線時,如果只是讓模型去看一眼當前目錄的文件列表、或者跑個簡單的正則替換,每一步都要燒掉幾百個 Token 的推理成本,這顯然極不划算。role-model可以將任務按難度進行動態拆解。

把簡單活兒路由給毫秒級響應、極低成本的本地輕量小模型;把架構重構、找出複雜Bug的活兒再派給R1,直接解決成本難題。它還有“決策可解釋性”,它將每一次路由決策都固化為 Requests(請求)、Profiles(畫像)、Policy(策略)、Artifacts(產物)四個標準化構件,工程師可以隨時調閱“為什麼這一步派給了模型 A 而不是模型 B”。除此之外,它原生支持多廠商災備,一旦主通道遇到限流、延遲抖動,能無縫切換到備用節點,保證整條 Agent 流水線不中斷。可以說,省錢和可控性都是Agent落地時的關鍵細節。它歸屬於 Agent 適配層的流量編排與調度層面。

https://github.com/try-works/role-model▎端側版龍蝦 MateBot:(46顆星)MateBot是一個更偏向端側的效率工具,解決的是“人如何 24 小時隨時隨地管理 Agent”的痛點。眼下主流的編程 Agent 大多被綁在本地終端上,而很多長任務的工作需要開發者隨時查看AI的進度,及時干預。MateBot 的作用類似於 OpenClaw,它讓開發者通過手機端就能直接給本地 Agent 派活、實時查看執行日誌,遇到卡點或死循環時隨時可以介入中斷或修正。除了遠程控制,它還有自己的“端側記憶三件套”,有自動記憶、外部記憶、失敗記憶三套系統。

它還有本地“錯題本”,可以把Agent犯的錯誤記錄在知識庫,下次直接避開。對於要走向真實生產環境的 Harness 來說,MateBot 補齊了長週期任務中的人機協同閉環,也解決了模型跨會話反覆踩坑的問題,屬於補齊執行層工程能力。https://github.com/aresbit/MateBot▎多AI協作平臺ccteam(141顆星)很多開發者手裡同時握著好幾個編程 Agent,如何讓這些Agent好好為自己幹活,是當下工程化落地的一個關鍵問題。不少Agent之間缺少良好互通,人成了來回同步上下文的 “傳話筒”。

ccteam 相當於給這些 Agent 搭了統一指揮台,讓強推理模型當項目經理拆分任務,給各模型分配好的角色,並行推進任務。在多Agent協作中,ccteam可以讓任何一個Agent會話都能用自然語言指揮其他Agent幹活,比如“讓Codex實現這個接口並跑測試,讓Grok分析性能熱點,最後讓Claude Code交叉Review”。與此同時,開發者在 Telegram 或飛書上直接發消息就能調度所有 Agent,不用專門打開某個系統。ccteam 還組成一個集群,無論項目在哪臺機器上跑,都能統一查看和管控。它還會控制預算,錢花完了自動停工,避免 Agent 失控燒錢。

能管AI協作、控制進度和預算,這屬於Agent 適配層的多智能體編排調度層。https://github.com/firstintent/ccteam02DeepSeek Harness究竟在下一盤什麼大棋?在上述項目之外,如果將高頻出現的5個方向(多模型路由、桌面 Agent、Coding Agent、框架或 SDK、以及 UI或客戶端項目,這些都是的基礎設施層的熱門方向)拼湊起來,DeepSeek的戰略意圖已經呼之欲出:它正開始從“最強API”向“工業級Agent生產線”轉換。為什麼大模型剛進入深水區,DeepSeek就急著做基礎設施?因為 DeepSeek 的“大腦”已經足夠強了。

昨晚發佈的V4 Pro 的代碼能力直接擠進全球第一梯隊,R1 的長思考深度更是斷崖式領先。配合 Context Caching(上下文緩存)帶來的極致 Token 成本,理論上,Agent 已經具備了“又快又便宜”的落地前提。但“想得快”和“跑得穩”是另外一回事。仔細剖析這些網傳的DeepSeek Harness重點扶持項目,可以發現DeepSeek正在急切地補齊這幾個短板:▎補齊執行層安全R1擅長寫代碼,但不提供運行環境。直接在企業真實的Terminal上跑,一個幻覺引起的rm -fr刪庫跑路幻覺代碼,就能把系統搞癱瘓。

DeepSeek Harness扶持OMA 這類帶憑證隔離、沙箱機制和審計日誌的底層項目,就是要給這些可能造成破壞的“數字野馬”套上韁繩,讓企業可以安心交出業務控制權。▎補齊工程可靠性真正的軟件工程任務,動輒需要Agent循環糾錯幾個小時,在這期間,網絡稍微抖一下、大模型 API 超個時,如果沒有持久化存檔,整個任務就得從頭來。很多人會有一個嚴重的技術誤區,覺得最新的 DeepSeek V4 Pro 已經具備了 1M 的超長輸入窗口 和 384K 的超長輸出能力,信息量這麼大,是不是就不用管上下文管理了?

恰恰相反,超長輸出解決的是“一口氣能寫多少字”的空間問題,而持久化解決的是“寫到一半斷了,能否重啟接著寫”的時間問題。DeepSeek Harness 吸收 MateBot 這類具備“自動存檔”、“失敗記憶”和“錯題本”功能的組件,就是要確保 V4 Pro 在一次性吐出 384K 宏大內容的漫長過程中,擁有中途夭折後隨時續傳的工程可靠性。▎補齊商業化ROIAI越用越多,解決的問題越來越複雜,誰來控制成本?如果事事都去觸發 R1 的長思考(哪怕 DeepSeek 已經把價格打骨折),或者在多 Agent 協同中產生無效的“來回閒聊”,企業的 Token 賬單依然會原地爆炸。

DeepSeek引入role-model(按難度智能路由)和 ccteam(多智能體進度與預算控制),正是希望更好分配AI算力,把簡單的搬磚工作丟給本地小模型,把架構級的問題精準派發給R1,這是能讓Agent滿足企業成本需求、大規模落地的唯一途徑。總結而言:過去,DeepSeek 靠 V4 Pro 和 R1 證明了自己是頂級的“發動機製造商”;而現在,通過這批不起眼的“配件”,才真正打造了一套完整的“汽車底盤”。讓Agent安全、可控、用得起,這些正是DeepSeek Harness要補的課題。參考鏈接:https://x.

com/NFT_Chen/status/2087500877238337930上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛