深度體驗DeepSeek Harness,我原諒它漲價了

為啥說「終於」呢?因為我已經內測了快半個月,現在也是終於能發了。。。這段時間裡,為了測試,我幾乎把我所有Vibe Coding項目,都從Codex遷移到了黑鯨(是的,logo黑化了)。深度體驗這麼久,又把官方Repo從頭到尾翻了個底朝天之後,我最大的感觸是—— 這簡直是套徹頭徹尾為「自進化」和「DIY」而生的馬鞍啊。內測群裡,有大佬直接給改成了這樣。。。這樣。還有這樣的TUI。而DSH真正能做的,遠遠不止這些。事實上,DSH的一切:模型、工具、策略、存儲、上下文管理……都是可插拔的積木。這意味著,如果你想,完全可以自己上手改造,或者針對特定場景定製運行時。目前,官方已經內置了一百多個插件。
後續社區會提供更多。Agent時代的安卓,來了。DSH「最不繞彎子」說明書 但在說底層技術相關的內容前,咱們還是先講講產品體驗本身。官方給出了兩個安裝方法: 快速體驗:在已安裝Node.js開發工具鏈的系統中,可以使用npx命令快速啟動DeepSeek Harness的Web UI。npx @deepseek-ai/dsh web 源碼安裝:獲取完整項目源碼,並按照倉庫說明完成安裝。git clone https://github.com/deepseek-ai/deepseek-harness 其實可以更簡單,直接把倉庫鏈接(見文末)丟給AI,讓它幫你全部搞定(doge)。
但暫時沒有Electron APP,啟動服務後,得通過瀏覽器Web UI用。打開後,會先讓你填模型API Key,沒有的話直接到DeepSeek開發平臺買一個。但梁聖這次可能不止收你電費錢了,17號要大漲價,尤其是緩存。。。不過,你也是可以接入其他模型的。之後就能看到「黑鯨」真容了,基本和DeepSeek網頁版長得一模一樣,只不過現在對話列表成了本地項目管理列表。使用上也和主流Agent有些區別。開啟會話前,你需要額外選擇工作目錄,以及—— Agent預設。
這是DSH比較新鮮的功能,目前官方有四類預設供你選擇—— 標準模式:功能完整的編碼Agent,涵蓋文件編輯、Shell、文件與網頁檢索、Skills、計劃模式、目標追蹤、子代理和工作流等全部能力 PTC模式:在標準模式全部能力之上,額外提供Code Mode SDK,允許模型編寫TypeScript程序來組合多步操作。極簡模式:僅保留bash和strreplaceeditor兩個工具,用於基準測試和最小化復現。創造模式:在標準模式全部能力之上,額外提供運行時檢查、插件實驗和preset創作指導,用於自定義Agent預設。此外,也支持自定義預設。
這也是DSH帶給我最深的印象——這是一個非常極客,甚至可以說是開發者天選的馬鞍。很多設計都圍繞這個第一性原理展開。比如有個叫軌跡的功能。眾所周知,隨著Agent跑得越久、工具鏈越複雜,Chat摘要就越來越黑盒,根本搞不清楚模型在背後幹啥。DSH做的這個軌跡,就是一個能隨時監控Agent的回放窗口。和Chat視圖的是潤色後的對話不同,Trajectory能直接看到原始事件級記錄,你可以隨時回放,查看會話內部到底發生了什麼。這樣,能更直觀地看到模型究竟是在哪栽了跟頭,每個環節都燒了多少錢。此外,DeepSeek還在倉庫裡內置了一堆Skill,專為開發而生。
看了一眼MD,功能大概有這些—— dsh-code-review:審PR用的。按本倉庫的規範檢查代碼裡看不出來的問題。dsh-find-simplifications:找可以簡化代碼的地方,並把簡化想法寫成Agent Note。dsh-doc-standards:寫/審文檔用的。管文檔層級、區分教程和參考、砍「文檔廢話」。dsh-prose-standard:全倉庫文字品控。Markdown、JSDoc、代碼註釋、提示詞、CLI/UI文案該不該寫、怎麼寫。…… 不過,我不是重度開發者用戶,日常確實不太用得著這些。
但多輪交互下來,我發現DSH有一個非常好用的小設計—— 即便不開計劃模式,黑鯨在遇見用戶指令不明確的情況時,也會主動拉起提問。這點和Codex很不一樣。在DSH的鞭策下,黑鯨會非常主動地開啟頭腦風暴,並且給出建議選項。說實話,太爽了,能節省巨多腦力,少吃很多根香蕉(bushi)。當然,你也可以哪個都不選,自己巴拉巴拉語音輸出一堆上下文給它。其他就和Codex沒啥區別。你可以用/,調用上下文壓縮、設置目標、計劃模式等功能,或者調用Skills。像任務清單這種功能,也是有的。比較遺憾的是,經典Agent三列表中右側欄還沒做出來,體驗上還是有些不方便。
這點Codex就非常吃香了,內置瀏覽器、文件管理、預覽…… 甚至能直接在對話中播放視頻。。。諸如此類,反正就是很多UI和交互上的小細節,跟Codex比起來肯定還是有差距,可能也得等後續更新打磨吧。對了,DSH是支持圖片作為附件上傳的。但眾所周知,V4是個瞎子啊o(╥﹏╥)o,這個功能需要額外搭配多模態模型食用。最後聊聊Token消耗。也是很神了,DSH專門在屏幕最下方搞了個統計表,你可以隨時在這裡查看Token消耗量、緩存命中率,以防一不留神給信用卡刷爆掉。緩存命中方面,也是很猛的,大多處於99%左右,有幾次直接幹到100%了。當然,也是遇到過幾次掉到60-70%的情況的。
但奈何內測的時候DeepSeek是真便宜啊!說實話,我真就沒咋關注過這個儀表盤。感謝梁叔叔。一手實測 最後就來拴上這套原生馬具後,黑鯨的表現吧。我讓V4 Flash分別用Codex和DeepSeek自己的harness跑了幾個demo,大家可以自行對比一下。左邊是DSH,右邊是Codex。模型、推理強度完全一致。首先是鵜鶘自行車。比較經典的一個測試了,說實話,沒太大差別,甚至右邊Codex的審美更好。但這個豬八戒3D白模就很離譜了。同樣是只簡單囑咐了一句任務,沒有寫複雜提示詞,右邊Codex馬鞍一把梭的產物簡直不像個生物。從《後室》逃出來的是吧。
至於原因,我個人感覺是:DSH駕馭下,模型的長程任務能力會強非常非常多。像豬八戒這個demo,就一句「生成豬八戒3D白模」,DS直接猛跑了20min。反觀Codex,幾乎就沒怎麼返工,6分鐘就跑完了,異常自信。甚至最開始還以為是要生成圖片,還管我要GPT-Image-2的API。。。擱這帶貨來了啊??這也是社區比較一致的反饋,聽有個哥們說,他最長跑了10個小時。。。我自己的體驗也差不多,基本都是一句prompt直出,很少出現直接、不繞彎子地交付半成品的情況。比如這個第一人稱射擊遊戲,我真就啥prompt沒給,下蹲、換彈、瞄準、NPC……所有功能都它自己做的。
也建議大家不用讓AI單獨生成一遍Prompt,直接語音輸入把需求講清楚就行,太過詳細反而會限制模型發揮。對了,這有個黑鯨給自己做的「思考」gif,歡迎大家拿去當表情包。所以,買了梁叔叔的API,接DSH還是Codex?結論很簡單:自家模型肯定是優先搭配自家Harness。不然也沒必要單獨做一個了。。。Agent時代的安卓 實測的部分就先到這,主要聊的還是產品設計上的細節。至於模型能力,市面上已經有太多demo了,這裡不再贅述。我更想聊的,是藏在這個對話框之下的東西。打開官方Repo,你會發現README裡反覆出現同一個詞——Cordis。啥意思?我看了一下,大概可以理解為樂高的底座板。
你玩樂高的時候,不會從零開始捏,你有一塊帶凸點的底板,然後往上插各種零件。Cordis,就是程序員寫代碼時的「那塊底板」。在設計Agent框架時,它將整體拆解為一個個獨立插件,各司其職。這樣,可以最大程度避免重複造輪子。開發者若有魔改需求,只需按規則 Vibe Coding 一個新插件,直接插到底板上即可;若對現有插件不滿,也能隨時拔下替換。說實話,這是一種相當AI-Native的設計思路。要知道,Skill只是Prompt Engineering的範疇,已經爆發出如此強大的影響力。而Cordis插件,允許用戶自定義整個Agent運行時。
這也是DSH架構文檔所說的—— 它採用了一切皆插件的架構。這個主流Agent的思路很不一樣,雖然Codex的Harness也開源了,但骨子裡還是iPhone這類閉源哲學—— Rust寫單體核心,依靠「外部掛件」做App Store擴展,MCP工具、hooks、skills,統統掛在核心外面,你不能隨意觸碰主幹。優點當然很明顯。Rust直接控制內存和併發,比插件框架的抽象層更快;一體化封裝,可控性也更高、更極致。缺點嘛,就是封閉,社區沒啥插手空間。而DSH,我覺得,就是Agent時代的安卓。它以Cordis為一等公民,打造了一套徹底開放的操作系統。
在倉庫的Doc文件夾中,甚至有手把手教你從零構建插件、接入官方Harness的完整教程。甚至還內置了一個魔改Cordis的Skill。這意味著,任何人、在任何時候遇到Bug或需要新功能,都可以直接動手實現,然後再開源出來。未來,其他用戶遇到相似問題時,也能直接安裝社區已有的DSH插件,就像《我的世界》裝模組一樣。比如前面說到困擾我很久的側邊欄功能,社區裡就有老哥做了插件。事實上,DeepSeek Harness已經預留好了Plugin Store,光是官方,現在就已經內置了100多個插件。公眾號宣發物料裡,也披露了不少社區開發者所做的插件。
有大鯨魚TUI、上古QQ風皮膚、鯨魚專屬emoji…… 這也是DeepSeek Harness團隊呼籲的事情: 我們期待與全球開發者一起,在開源、開放、可複用、可組合的基礎設施之上,共同探索智能上限。歡迎全球Harness開發者加入DSH插件生態。劍指自進化 我感覺DeepSeek可能在下一盤大棋。今年自從Anthropic那篇self-improvement博客發出來之後,大家一直在聊「自進化」,但說實話,始終沒有一個很清晰的路線圖。DeepSeek這套思路,是我目前看到的比較可落地的實現方式—— 普通用戶也能參與AI的自進化。
Cordist協議下,模型可以在不打斷任務的前提下,自己寫個插件、自己安上。再配上用戶生態,你想想:從成百上千萬個Agent實例裡,篩出魔改得比較好的插件,再融回主線…… 這不得起飛了啊!什麼?你問說了這麼多,這Cordis對用戶體驗到底有啥幫助??好問題。在社區裡問了一圈,目前看來,對普通用戶而言,暫時是沒太大幫助。。。畢竟是個吃生態的feature,也許要等後面大量高質量插件沉澱下來後,才能體現出差異。當然,如果你是極客選手,歡迎,為後人種點樹。DSH鏈接:https://github.
com/deepseek-ai/deepseek-harness 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十
本週AI大模型Arena排行榜出現新面孔,智譜AI的glm-5.3-max首次入榜即拿下綜合榜第13名。月之暗面的kimi-k3-max排名持續攀升,成功擠進綜合榜前十,位列第10名。兩款國產大模型雙雙寫下佳績,成為本週關注焦點。

DeepSeek Harness來了:AI開始製造AI了?
DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。
字節整合AI辦公產品,TRAE、釦子團隊併入豆包
其中,TRAE Work、釦子將與豆包的工作場景產品能力整合;TRAE IDE及CLI則作為豆包品牌下的編程產品線繼續發展。調整後,相關產品和運營團隊統一向豆包產品負責人趙祺彙報。(iFeng Tech)TRAE與釦子此前均隸屬於字節跳動產品研發和工程架構部,前者最初定位AI編程產品,後者則聚焦AI智能體開發平臺,並持續探索不同Agent方向。