DeepSeek Harness,“殺死”Agent黑箱

光子星球2026.08.15 08:25 · 來自北京全文4485字00:00 / 11:48Model+Harness=Agent文 | 光子星球近期,DeepSeek持續上演反轉。8月12日,沒有發佈會,沒有預告,DeepSeek悄悄更新API文檔,編號為“0813”的DeepSeek-V4-Pro正式版模型深夜靜默上線。高關注度和期待之外,是現實體驗與官方跑分之間的落差,還有一經上線便預告漲價的質疑。8月13日,距離新模型發佈不到24小時,DeepSeek官網首頁發佈的橫幅和開放平臺公告突然被撤下。API文檔中模型名稱沒變,開發者仍可正常調用,但官方保持沉默。
事後,有開發者發現DeepSeek在Hugging Face後臺代碼倉庫瘋狂搶修,疑似因為前端接口、後端推理棧與權重配置出現了嚴重錯位,導致體驗“翻車”。同天晚上,DeepSeek重新發布公告確認V4 Pro正式版上線,同時開源DeepSeek Harness開發者預覽版,一切又回到了主場。DeepSeek曾給出過一個公式:Model+Harness=Agent。這意味著,對可執行任務的Agent來說,只有模型是不完整的。Harness的可控、可觀測、可回溯的特性,補上了模型所缺失的另一半。模型是大腦,負責思考、推理和理解意圖。但純語言模型只能輸出文本,無法直接操作文件、修改數據庫和瀏覽網頁。
Harness是“身體”和“神經系統”,它提供了模型與外部世界交互所需的一切,包括工具調用、文件讀寫、沙箱環境、權限管理、任務編排等。沒有Harness,模型只是一臺會說話的引擎,但無法成為真正幹活兒的Agent。DeepSeek試圖通過自身打造的Harness系統,將模型性能發揮到最大化。從我們的測試結果來看,也的確如此。在DeepSeek Harness加持下,DeepSeek V4 Pro正式版的響應速度更快,且比接入Claude Code緩存命中率提升了1%。祛魅和爭奪範式“一切皆插件”是DeepSeek Harness最核心的設計理念。
簡單來說,就是從模型、工具到最核心的Agent Loop,都拆解為可獨立、組合的插件。這個理念由北大與DeepSeek聯合提出的“時空可組合性”範式支撐,該範式將Agent組件拆解為兩個維度。一是時間可組合性通過“可逆效應”機制,讓系統自動記錄並撤銷組件卸載後的副作用,加載過程即決定卸載過程,確保系統長期穩定。二是空間可組合性通過“響應式共效應”實現聲明式依賴管理,組件只需聲明需求,運行時就能自動協調依賴變化,實現動態激活與停用。兩者融合於統一的上下文、承載狀態、生命週期邊界和依賴環境。
Harness因此可實現“無特權核心”,所有組件包括Agent主循環均可替換,開發者通過配置文件即可自由組合。這一理念為構建靈活且面向未來的Agent基礎設施奠定了方向。在OpenAI、Anthropic等巨頭紛紛定義自己的Harness時,DeepSeek的思路顯得獨樹一幟。OpenAI和Anthropic的戰略是“向下整合”,即通過打造體驗極致、深度綁定自家模型的Harness,鞏固其在AI應用層的優勢;DeepSeek的戰略是“橫向鋪開”,不再滿足只做一個優秀的模型供應商,而是試圖通過開源一個模型中立、高度模塊化的Agent底層標準,成為下一代AI應用的基礎設施。
網傳的DeepSeek Harness內測入選項目名單同樣釋放了強烈的信號,入選項目高度集中在能夯實Agent能力的基礎設施領域。其項目主要圍繞MCP插件、代碼智能體、運行時、編排框架、可視化UI與多智能體調度等方向,直指Agent在真實世界落地的核心難題。DeepSeek的一系列操作,可視為一場精心設計的“祛魅”運動。DeepSeek開源Harness,並大力扶持各類基建插件,本質上是在做一件事:將“如何構建一個強大的Agent”的一整套方法論和源代碼,公之於眾。
在此之前,OpenAI和Anthropic的Harness更像一個“黑箱”,其內部優化是核心機密,如何打造Agent產品被視為一種“特權”。DeepSeek通過開源和Cordis插件理論,主動拆解了這個黑箱,並證明Agent的強大不在於某一個神秘的內核,而在於一套可組合、可替換的工程組件。當Harness被充分祛魅,成為一個透明、可被隨時替換的組件後,整個價值鏈上,唯一不可被標準化、仍會持續進化的,就只剩下最底層的“模型”本身了。如果把DeepSeek的模型、開源、Harness、漲價四個動作連在一起看,就會發現DeepSeek的目標非常明確。
先建立生態,再定標準,然後用最強的模型性能,完成商業價值的最終變現。Harness和開源就像是免費修建的高速公路,前期用來吸引車流,而當車流足夠多時,順勢提高燃油的價格,便成為了最高效的商業兌現方式。砍掉prompt,場景一次跑通昨天的文章裡,我們測評了DeepSeek-V4-Pro-0813的七項複雜任務,唯獨指環王那題沒有跑完整。當時為了趕時間,只給了《指環王》第一章的3句開頭。
DeepSeek-V4-Pro正式版實測:山不在高,有“梁”則靈恰好DeepSeek Harness也出來了,我們就在DeepSeek自家的Harness裡跑這次完整的測試,看看自家的工具配自家的模型,能擦出怎樣的火花。安裝的過程就不贅述了,推薦大家用npm(Node.js的默認包管理器,安裝並管理項目所需的各種第三方庫,可以簡單理解為一個開放的應用市場)安裝,也方便升級和安裝其他插件,可以直接運行npx @deepseek-ai/dsh web啟動,如果卡住不動的話,可以先運行一遍npm install -g @deepseek-ai/dsh,然後再運行剛才的命令就可以順利啟動了。
初次打開和大部分Agent一樣,只不過在DeepSeek Harness這裡暫時還是極簡的畫風。裝好環境之後正式開始今天的測試,《指環王》這個基準測的不是“會不會畫一隻鵜鶘”,而是“讀懂一段文學→理解一個世界→把世界程序化搭出來”的完整鏈路,是目前圈內最狠的Agent考題之一。昨天的測試為什麼不算數?因為我們當時只給了3句開頭,而Karpathy給Opus 5的是原著第一段。今天我們把原文補齊:第一章前段完整文字,從比爾博宣佈111歲生日宴會,到霍比屯議論,再到弗羅多身世往事,共計1817個詞、23段,一字不改。
第一次測試,我們按“評測就該嚴謹”的思路,把提示詞寫得滴水不漏,1817個詞的原文,加上場景要素清單(洞屋要有圓形門、宴會長桌要有食物、賓客要議論紛紛),再加上運鏡要求、燈光要求、比例要求,一共五條硬性要求。結果很打臉,第一次生成的效果非常粗糙,敘事也不完整。場景是搭出來了,但離“霍比屯的生日派對”相距很遠。效果呈現上,運鏡支離破碎,畫面像是趕工出來的半成品。穿模很嚴重,山坡上站的小人像是插了一堆棒棒糖。我們覆盤了一圈,把原因歸結為提示詞太長了,列出的場景限制了模型的發揮。第二次,我們把提示詞砍到只剩目標,讀懂原文,用Three.
js搭出霍比屯生日派對的3D世界,運鏡按原文節奏走,保存為完整可運行的HTML文件。場景要素、燈光、比例要求,全部刪掉。效果反轉了。場景竟然一次就跑通,洞屋、比爾博、弗羅多、宴會長桌、酒館前議論的霍比特人,該有的都有;角色只有輕微漂浮和穿模,屬於“能看出是霍比屯”的範疇;運鏡敘事成立,按原文節奏從俯瞰霍比屯推到比爾博,再掃過議論的人群,最後環繞宴會長桌。同一個模型,同樣的原文,一個細緻入微的提示詞換來翻車,一句直白的目標換來及格以上的結果。看來現在頂級的模型反而不需要詳盡的提示詞,只需要用直白簡潔的話告訴他目標就可以了,說多了反而效果會變差。這不是孤例,GPT-5.
6 Sol剛發佈時,社區就有人反饋,套上精心優化的提示詞和流程skill,反而會讓模型陷入死循環。這個發現值得單獨提出來,提示詞的作用正在從“寫劇本”變成“定目標”,給頂級模型寫小作文的時代可能真的過去了。DeepSeek Harness到底行不行?回到今天的正題,DeepSeek Harness配自家的V4 Pro,表現如何?響應更快了。同樣的測試,DeepSeek Harness裡的響應比前一天在Claude Code裡接入時更快。緩存命中率漲了一個點。前一天在Claude Code接入是98%,在DeepSeek Harness裡是99%。
這個提升看起來小,但在長上下文任務裡,緩存命中率每漲一個點,都是實打實地關係到成本和生成速度。再看測試本身,第一次的長提示詞翻車,發生在DeepSeek Harness環境裡;第二次反轉,也在同樣的環境。但全程沒有環境相關的報錯、卡頓、上下文丟失,兩輪測試的對比是乾淨的,變量只有提示詞本身。作為一個剛發佈的開發者預覽版,這是很加分的穩定性,而且DeepSeek Harness還會把運行過程中每一步都顯式的呈現出來,你可以看到模型是怎麼工作的,這是一個很好的創新。短期內,DeepSeek Harness所能產生的作用還很有限,作為普通用戶很難像使用WorkBuddy一樣在工作中提效。
但從長期來看,DeepSeek Harness與DeepSeek系列模型,形成了難以割裂的增強閉環。Harness作為完全開源的Agent框架,定義了“模型如何被調用、工具如何被組合、任務如何被編排”的底層標準,吸引了海量開發者和真實任務湧入。而這些真實任務的執行軌跡,通過Harness內置的可觀測體系,源源不斷地迴流,為DeepSeek模型下一輪訓練與優化提供天然數據養料。反過來,DeepSeek模型能力的每一次躍升,Harness又能第一時間通過內置適配器將其能力釋放到插件生態中。當這套飛輪轉起來,開發者的選擇就變得不再困難。
因為使用DeepSeek Harness,就會得到一個始終與最強模型同步進化,且無需二次適配的開箱即用系統。這正是DeepSeek所定義的“Agent=Model+Harness”的終極形態,一個彼此增強又不可分割的完整個體。
Related
相關文章

仇太深,奧特曼炮轟A社“反人類”
量子位·2026年08月24日 16:01“Codex名字沒起好,我也沒用明白” 《奧特曼天降正義,小嘴抹毒暗諷A社“反人類”》!!這個標題有沒有港媒內味兒了(doge),您先別笑,這還真是奧特曼在最新採訪裡的大致意思。雖然沒有點名,但話裡話外就差直接報Dario Amodei的身份證號了。

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十
本週AI大模型Arena排行榜出現新面孔,智譜AI的glm-5.3-max首次入榜即拿下綜合榜第13名。月之暗面的kimi-k3-max排名持續攀升,成功擠進綜合榜前十,位列第10名。兩款國產大模型雙雙寫下佳績,成為本週關注焦點。

DeepSeek Harness來了:AI開始製造AI了?
DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。
具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元
AI資訊AI新閒資訊正文具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元 發布於AI新閒資訊時間 :Aug 24, 2026閱讀 :1分鐘小鵬機器人業務完成首輪超9億美元融資,投後估值突破63億美元(約合430億元人民幣),創下中國具身智能行業單輪私募股權融資紀錄。本輪融資由IDG資本領投,高榕創投參投,並獲騰訊和阿里巴巴作為戰略投資者共同參與,小鵬集團仍保持控股地位。四家投資方均將該輪視為其在具身智能領域迄今披露的最大規模單筆投資之一。IDG資本指出,小鵬人形機器人代表當前國內產業領先水平,已具備與海外頭部企業全球競爭的技術實力。本輪融資將推動小鵬機器人業務市場化估值體系的建立,並加速其人形機器人量產進程及物理AI模型的研發迭代,助力高階通用人形機器人邁向全球商業化應用新階段。此舉亦折射出具身智能賽道正吸引頂級財務與戰略資本加速佈局,產業從技術驗證向規模化落地轉變的趨勢日益明晰。相關推薦中國開源模型出海:法律 AI 獨角獸 Harvey 基於 Kimi K3 推出 Tenet美國法律AI獨角獸Harvey宣佈基於月之暗面開放權重模型Kimi K3,通過後訓練開發出法律專用模型Harvey Tenet,標誌中國開放權重模型首次進入美國頭部垂直AI公司訓練體系。Harvey此前主要依賴OpenAI、Anthropic等閉源模型,服務超2400家機構、20多萬名律師,估值110億美元,年化收入約3.5億美元。Aug 24, 2026115.2k韓國修法為 AI 開綠燈:經監管審查後可使用限定個人數據韓國國會通過《個人信息保護法》修正案,允許AI開發商經個人信息保護委員會審查後,在限定範圍內使用個人數據,突破原先“轉作AI開發須本人同意”的剛性約束。此舉迴應業界長期抱怨,此前豁免僅限於語音反詐、自動駕駛等少數場景且期限較短,新規為AI研發擴大數據可用空間。Aug 24, 2