DeepSeek Harness,“殺死”Agent黑箱

光子星球2026.08.15 08:25 · 來自北京全文4485字00:00 / 11:48Model+Harness=Agent文 | 光子星球近期,DeepSeek持續上演反轉。8月12日,沒有發佈會,沒有預告,DeepSeek悄悄更新API文檔,編號為“0813”的DeepSeek-V4-Pro正式版模型深夜靜默上線。高關注度和期待之外,是現實體驗與官方跑分之間的落差,還有一經上線便預告漲價的質疑。8月13日,距離新模型發佈不到24小時,DeepSeek官網首頁發佈的橫幅和開放平臺公告突然被撤下。API文檔中模型名稱沒變,開發者仍可正常調用,但官方保持沉默。
事後,有開發者發現DeepSeek在Hugging Face後臺代碼倉庫瘋狂搶修,疑似因為前端接口、後端推理棧與權重配置出現了嚴重錯位,導致體驗“翻車”。同天晚上,DeepSeek重新發布公告確認V4 Pro正式版上線,同時開源DeepSeek Harness開發者預覽版,一切又回到了主場。DeepSeek曾給出過一個公式:Model+Harness=Agent。這意味著,對可執行任務的Agent來說,只有模型是不完整的。Harness的可控、可觀測、可回溯的特性,補上了模型所缺失的另一半。模型是大腦,負責思考、推理和理解意圖。但純語言模型只能輸出文本,無法直接操作文件、修改數據庫和瀏覽網頁。
Harness是“身體”和“神經系統”,它提供了模型與外部世界交互所需的一切,包括工具調用、文件讀寫、沙箱環境、權限管理、任務編排等。沒有Harness,模型只是一臺會說話的引擎,但無法成為真正幹活兒的Agent。DeepSeek試圖通過自身打造的Harness系統,將模型性能發揮到最大化。從我們的測試結果來看,也的確如此。在DeepSeek Harness加持下,DeepSeek V4 Pro正式版的響應速度更快,且比接入Claude Code緩存命中率提升了1%。祛魅和爭奪範式“一切皆插件”是DeepSeek Harness最核心的設計理念。
簡單來說,就是從模型、工具到最核心的Agent Loop,都拆解為可獨立、組合的插件。這個理念由北大與DeepSeek聯合提出的“時空可組合性”範式支撐,該範式將Agent組件拆解為兩個維度。一是時間可組合性通過“可逆效應”機制,讓系統自動記錄並撤銷組件卸載後的副作用,加載過程即決定卸載過程,確保系統長期穩定。二是空間可組合性通過“響應式共效應”實現聲明式依賴管理,組件只需聲明需求,運行時就能自動協調依賴變化,實現動態激活與停用。兩者融合於統一的上下文、承載狀態、生命週期邊界和依賴環境。
Harness因此可實現“無特權核心”,所有組件包括Agent主循環均可替換,開發者通過配置文件即可自由組合。這一理念為構建靈活且面向未來的Agent基礎設施奠定了方向。在OpenAI、Anthropic等巨頭紛紛定義自己的Harness時,DeepSeek的思路顯得獨樹一幟。OpenAI和Anthropic的戰略是“向下整合”,即通過打造體驗極致、深度綁定自家模型的Harness,鞏固其在AI應用層的優勢;DeepSeek的戰略是“橫向鋪開”,不再滿足只做一個優秀的模型供應商,而是試圖通過開源一個模型中立、高度模塊化的Agent底層標準,成為下一代AI應用的基礎設施。
網傳的DeepSeek Harness內測入選項目名單同樣釋放了強烈的信號,入選項目高度集中在能夯實Agent能力的基礎設施領域。其項目主要圍繞MCP插件、代碼智能體、運行時、編排框架、可視化UI與多智能體調度等方向,直指Agent在真實世界落地的核心難題。DeepSeek的一系列操作,可視為一場精心設計的“祛魅”運動。DeepSeek開源Harness,並大力扶持各類基建插件,本質上是在做一件事:將“如何構建一個強大的Agent”的一整套方法論和源代碼,公之於眾。
在此之前,OpenAI和Anthropic的Harness更像一個“黑箱”,其內部優化是核心機密,如何打造Agent產品被視為一種“特權”。DeepSeek通過開源和Cordis插件理論,主動拆解了這個黑箱,並證明Agent的強大不在於某一個神秘的內核,而在於一套可組合、可替換的工程組件。當Harness被充分祛魅,成為一個透明、可被隨時替換的組件後,整個價值鏈上,唯一不可被標準化、仍會持續進化的,就只剩下最底層的“模型”本身了。如果把DeepSeek的模型、開源、Harness、漲價四個動作連在一起看,就會發現DeepSeek的目標非常明確。
先建立生態,再定標準,然後用最強的模型性能,完成商業價值的最終變現。Harness和開源就像是免費修建的高速公路,前期用來吸引車流,而當車流足夠多時,順勢提高燃油的價格,便成為了最高效的商業兌現方式。砍掉prompt,場景一次跑通昨天的文章裡,我們測評了DeepSeek-V4-Pro-0813的七項複雜任務,唯獨指環王那題沒有跑完整。當時為了趕時間,只給了《指環王》第一章的3句開頭。
DeepSeek-V4-Pro正式版實測:山不在高,有“梁”則靈恰好DeepSeek Harness也出來了,我們就在DeepSeek自家的Harness裡跑這次完整的測試,看看自家的工具配自家的模型,能擦出怎樣的火花。安裝的過程就不贅述了,推薦大家用npm(Node.js的默認包管理器,安裝並管理項目所需的各種第三方庫,可以簡單理解為一個開放的應用市場)安裝,也方便升級和安裝其他插件,可以直接運行npx @deepseek-ai/dsh web啟動,如果卡住不動的話,可以先運行一遍npm install -g @deepseek-ai/dsh,然後再運行剛才的命令就可以順利啟動了。
初次打開和大部分Agent一樣,只不過在DeepSeek Harness這裡暫時還是極簡的畫風。裝好環境之後正式開始今天的測試,《指環王》這個基準測的不是“會不會畫一隻鵜鶘”,而是“讀懂一段文學→理解一個世界→把世界程序化搭出來”的完整鏈路,是目前圈內最狠的Agent考題之一。昨天的測試為什麼不算數?因為我們當時只給了3句開頭,而Karpathy給Opus 5的是原著第一段。今天我們把原文補齊:第一章前段完整文字,從比爾博宣佈111歲生日宴會,到霍比屯議論,再到弗羅多身世往事,共計1817個詞、23段,一字不改。
第一次測試,我們按“評測就該嚴謹”的思路,把提示詞寫得滴水不漏,1817個詞的原文,加上場景要素清單(洞屋要有圓形門、宴會長桌要有食物、賓客要議論紛紛),再加上運鏡要求、燈光要求、比例要求,一共五條硬性要求。結果很打臉,第一次生成的效果非常粗糙,敘事也不完整。場景是搭出來了,但離“霍比屯的生日派對”相距很遠。效果呈現上,運鏡支離破碎,畫面像是趕工出來的半成品。穿模很嚴重,山坡上站的小人像是插了一堆棒棒糖。我們覆盤了一圈,把原因歸結為提示詞太長了,列出的場景限制了模型的發揮。第二次,我們把提示詞砍到只剩目標,讀懂原文,用Three.
js搭出霍比屯生日派對的3D世界,運鏡按原文節奏走,保存為完整可運行的HTML文件。場景要素、燈光、比例要求,全部刪掉。效果反轉了。場景竟然一次就跑通,洞屋、比爾博、弗羅多、宴會長桌、酒館前議論的霍比特人,該有的都有;角色只有輕微漂浮和穿模,屬於“能看出是霍比屯”的範疇;運鏡敘事成立,按原文節奏從俯瞰霍比屯推到比爾博,再掃過議論的人群,最後環繞宴會長桌。同一個模型,同樣的原文,一個細緻入微的提示詞換來翻車,一句直白的目標換來及格以上的結果。看來現在頂級的模型反而不需要詳盡的提示詞,只需要用直白簡潔的話告訴他目標就可以了,說多了反而效果會變差。這不是孤例,GPT-5.
6 Sol剛發佈時,社區就有人反饋,套上精心優化的提示詞和流程skill,反而會讓模型陷入死循環。這個發現值得單獨提出來,提示詞的作用正在從“寫劇本”變成“定目標”,給頂級模型寫小作文的時代可能真的過去了。DeepSeek Harness到底行不行?回到今天的正題,DeepSeek Harness配自家的V4 Pro,表現如何?響應更快了。同樣的測試,DeepSeek Harness裡的響應比前一天在Claude Code裡接入時更快。緩存命中率漲了一個點。前一天在Claude Code接入是98%,在DeepSeek Harness裡是99%。
這個提升看起來小,但在長上下文任務裡,緩存命中率每漲一個點,都是實打實地關係到成本和生成速度。再看測試本身,第一次的長提示詞翻車,發生在DeepSeek Harness環境裡;第二次反轉,也在同樣的環境。但全程沒有環境相關的報錯、卡頓、上下文丟失,兩輪測試的對比是乾淨的,變量只有提示詞本身。作為一個剛發佈的開發者預覽版,這是很加分的穩定性,而且DeepSeek Harness還會把運行過程中每一步都顯式的呈現出來,你可以看到模型是怎麼工作的,這是一個很好的創新。短期內,DeepSeek Harness所能產生的作用還很有限,作為普通用戶很難像使用WorkBuddy一樣在工作中提效。
但從長期來看,DeepSeek Harness與DeepSeek系列模型,形成了難以割裂的增強閉環。Harness作為完全開源的Agent框架,定義了“模型如何被調用、工具如何被組合、任務如何被編排”的底層標準,吸引了海量開發者和真實任務湧入。而這些真實任務的執行軌跡,通過Harness內置的可觀測體系,源源不斷地迴流,為DeepSeek模型下一輪訓練與優化提供天然數據養料。反過來,DeepSeek模型能力的每一次躍升,Harness又能第一時間通過內置適配器將其能力釋放到插件生態中。當這套飛輪轉起來,開發者的選擇就變得不再困難。
因為使用DeepSeek Harness,就會得到一個始終與最強模型同步進化,且無需二次適配的開箱即用系統。這正是DeepSeek所定義的“Agent=Model+Harness”的終極形態,一個彼此增強又不可分割的完整個體。
Related
相關文章
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷
Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。
Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態
8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

諾亦騰機器人發佈 HiPHI,開源 617.5 小時高精度人體運動數據
作者:潞源 責編:潞源 評論: 8 月 23 日消息,諾亦騰機器人在 2026 世界機器人大會期間發佈 HiPHI,這是一套面向人形機器人學習、數字人,以及計算機圖形學領域研究人員和工程師的高精度光學動作捕捉數據集。據報道,該數據集總長 617.