一切皆插件,DSH在“自進化”之路上狂飆

2026年8月14日 15:58
一切皆插件,DSH在“自進化”之路上狂飆
站內 AI 整理稿

字母AI2026.08.14 15:56 · 來自北京全文4564字00:00 / 12:37DSH超高安裝門檻,但是能用6毛錢幹10美金的活。文 | 字母AI千呼萬喚始出來,DeepSeek V4 Pro正式版和傳說中的DeepSeek Harness(DSH)終於問世了。說起DSH這個產品,它曾於8月1日開始招募內測。招募採取篩選制,優先吸納具備大型項目開發、AI Agent二次開發經驗的工程師,申請人需要提交代碼託管平臺賬號和過往項目代表作品,入選者還要簽署保密協議。現在終於算是見到了DSH的廬山真面目。

經過字母AI一晚上的測試,結論是這個產品性能很好、響應速度快,關鍵是還非常省token。只能說,還得是DeepSeek,老配方老味道!再看V4 Pro正式版這邊,雖然8月13日時,由於DeepSeek修改了API文件的表述,以及在DeepSeek官網增加公告,導致8月13日上午,全網都在熱傳V4 Pro正式版已經發布。可事實上,此次發佈實則為一場烏龍,所謂的DeepSeek V4 Pro正式版不僅性能堪憂,而且價格還保持著此前的價格不變。8月13日下午,DeepSeek官方撤下了首頁關於DeepSeek V4 Pro正式版發佈的公告。

而8月13日晚間發佈的,才是真正的DeepSeek V4 Pro正式版。Agent能力大幅提升。DeepSWE從預覽版的12.8分直接飆到62.7分,漲幅接近五倍;DSBench-Hard從31.1衝到 67.2;DSBench-FullStack從41.8提升到71.1。尤其是在Agent領域影響力最大的基準Terminal Bench 2.1上,DeepSeek V4 Pro正式版性能比肩當下最強的Claude Fable 5。話又說回來了,雖然此前DeepSeek公告稱價格上調,但誰也沒想到漲價漲得這麼多。輸出方面,高峰時段價格為原價的4.

5倍,為27元/百萬token,空閒時段為原價的2.25倍,為13.5元/百萬token。以單日20萬輸出token的代碼審查場景為例,調價前單日成本約1.2元,高峰時段將升至5.4元,空閒時段升至2.7元。緩存未命中輸入方面,高峰時段為原價的3倍,為9元/百萬token,空閒時段為原價的1.5倍,為4.5元/百萬token。緩存命中輸入方面,高峰漲幅最高,達到原價的12倍,為0.3元/百萬token,空閒時段為原價的6倍,為0.15元/百萬token。無論如何,不妨先來一起看一下這個產品。

它不是下一個Codex,它是第一個DSH應了梁文鋒那句“我們不在乎C端”,DSH的安裝門檻非常高,不僅要有node.js環境,還需要用戶自己去GitHub上面用npm命令安裝。像是Codex、Workbuddy這樣的Harness,都是可以直接雙擊安裝的。之所以有安裝門檻,是因為DSH既不是桌面GUI,也不是TUI、CLI,而是走了一條几乎沒人走過的路,DSH是BS架構的Web UI,打開就是個網頁,網頁裡帶一塊Agent幹活的區域。

要理解DSH為什麼這麼“反用戶”,就得先理解支撐它的那篇論文《A Programming Paradigm for Spatiotemporal Composability》,由北京大學和DeepSeek聯合署名。DSH的思路叫做一切皆插件,任務需要什麼,就調用什麼插件,用完立馬卸載騰空間。打個比方,Claude Code是一輛車,你可以給它裝上裝甲、防滑胎甚至是武器,但它歸根結底就是一輛車。Codex同樣是一輛車,可你只能給它改改內飾和車漆。DSH只是一個底盤,你可以給它加輪子讓它變成車,但你同樣可以給它加螺旋槳讓它變成直升機。為了滿足這個核心設計理念,論文提出了兩個維度。

第一個維度叫時間可組合性。意思是,當一個組件被移除時,它對共享環境造成的所有修改,必須能被完全、安全地撤銷。論文引用了“效應”這個概念,傳統的效應指的是一個程序在跑出結果之外,還會動手改變外面的世界,比如創建了一個文件,那麼磁盤裡就會記錄這個文件的內容。DSH是把運行辦法、撤銷辦法全都記錄在了效應之中,還專門給它起了個名字,叫做可逆效應。這個很好理解,經典“效應”像是你買東西時收銀臺給你開的小票,它只記錄你買了什麼,如果你想退貨,你還得走一些程序。而DSH論文中的可逆效應,就像是你在胖東來買東西,你退貨的時候不需要走程序,直接把商品交給客服,剩下的他們(系統)會替你解決。

每一次上下文變換都自帶一個逆變換,運行時全程追蹤,組件卸載時自動回滾。第二個維度叫空間可組合性。這是一種運行時的組件組合模型。和傳統的靜態依賴注入不同,組件的依賴關係不是在代碼編寫時或啟動時固定的,而是在一個共享的運行時“空間”中動態建立、動態消解的。舉個例子,假如說你想讓DSH給你念一本書。DSH上有視覺相關的插件,它可以充當眼睛,把書的內容記錄下來,但是它沒辦法念出聲。同時DSH還有聲音相關的插件,它只會讀卻不會記。將視覺插件和聲音插件放在同一個空間內,它們就會自動關聯,視覺插件負責把記錄的文字給聲音插件,聲音插件再將其讀出來。

論文裡拿VS Code當反例,VS Code的擴展全部跑在一個共享進程裡,裝了就不能熱卸載,想停用一個帶代碼的擴展,就得重啟整個擴展宿主。按論文統計,安裝量前100的擴展裡,有87個包含可執行代碼,都得靠重啟來卸載。可是一旦重啟,進程內積累的緩存、連接、部分計算結果全部作廢,重建要花上幾秒到幾分鐘;為了維持可用性,還得養冗餘副本,以供重啟之後Vs Code調用。DSH採用了一套Cordis系統,實現了熱模塊替換,改完插件直接原地替換,緩存和活動連接都給你留著,改炸了還能事務性回滾。但DSH真正讓人驚豔的,並不在這套理論本身,而是它把理論用在了哪裡。

DSH定義了四套完全不同的執行模式:普通任務直接做;長程任務進入Goal,可以跨多個自主輪次(autonomous rounds)持續執行;一兩個任務可以丟給子Agent,默認後臺運行;大規模並行任務進入Workflow,用一段JavaScript去編排多個 Agent。小事,比如“幫我把這個文件改一下”,AI直接上手就幹,不搞流程、不折騰。大事,比如“給我寫一個完整項目”,可能得幹好幾個小時。為了防止過程中出錯,所以DSH給它定製一個“總目標”,讓它能連續幹好多輪,直到目標達成才收工。就像帶了個KPI,沒完成不許下班。

為了能更好地完成任務,DSH甚至還有一個單獨的Ralph Loop,每一輪都創建一個完全“失憶”的新Agent,不繼承上一輪對話,只通過共享的Workspace保留長期記憶,然後一輪輪迭代。DSH也是為了AI自進化設計的。插件化意味著架構解耦,任何模塊都可以獨立演化;AI注意力受限,又是大規模併發,解耦設計能最大限度發揮這種高併發優勢,還避免了把自己搞崩潰的問題。傳統軟件裡,模塊之間經常“你中有我,我中有你”。改一個地方,可能連帶弄壞十個地方。插件化就不一樣,每個功能都是一個獨立的插件,只通過一個標準接口跟系統相連。插件之間不直接認識、不互相扯皮。

正因為這樣,任何一個插件都能單獨升級、單獨替換、單獨進化,不用動其他插件。假如按照傳統模塊A幹活必須等模塊B先幹完,那大家排著隊,互相干等。但解耦之後,每個模塊都是獨立的,誰也不擋誰的路,幾十個任務可以同時撒出去跑,互不干擾。AI注意力有限沒關係,因為每個模塊是獨立的小任務,AI分頭指揮、同時推進,效率拉滿。同樣的任務,便宜120倍相同的任務,差不多的效果,Fable 5一共花了9.8美金的token,約合人民幣將近70塊錢。用DSH配上DeepSeek V4 Pro 正式版跑,只花了5毛9分錢人民幣。

此前根據Artificial Analysis的測算,DeepSeek V4 Flash正式版在相同的任務條件下,比Claude Fable 5便宜了約100倍。但V4 Flash畢竟只是個輕量模型,並不能完成複雜任務。這次隨著V4 Pro正式版以及DSH的組合,已經比Claude Fable 5便宜將近120倍了。Artificial Analysis曾預測,隨著DeepSeek V4 Pro正式版發佈,DeepSeek斬殺線將會覆蓋全球超過70%的模型。現在看來Artificial Analysis預測的非常準確。

不過我也得“唱個反調”,由於我測試的時間段屬於非高峰時間段,所以token價格相對便宜,如果換做高峰時間段,那麼V4 Pro正式版的token費用將比Fable 5便宜不到100倍。在我測試的過程中發現,DSH的緩存命中率能高到離譜,有時候甚至能高到99%。要知道,無論是高峰還是非高峰,命中緩存都比非命中緩存便宜整30倍。除了前文提到的熱替換和可逆效應以外,還有一點就是論文裡的“增量協調”(Incremental Reconciliation)。配置層是一棵由“檔案卡”(entry)組成的樹,每張檔案卡聲明一個插件,裡面的信息包括它叫什麼、跑哪份代碼、帶什麼配置。

傳統做法是,檔案一改,就把對應的整個實例連根拔起、全部重來。增量協調不是這樣。它先看改動落在檔案卡的哪一格,再做最小動作,只有代碼地址變了,才重建整個實例。如果只是隔離方式變了,那就單獨調一下隔離域。如果改的是配置本身,就交給插件自己比對,只有真動到實質內容才重載。標成停用就卸掉,取消停用再裝回來。插件底下還掛著子插件的話,就按各自的編號“按名對賬”:新增的裝進來、刪掉的卸下去、沒動的原樣留著,一層層遞歸下去。這樣一路修補下來的最終狀態,和把整個系統推倒重建再加載的最終狀態完全一致。用人話說,就是改東西的時候只動該動的,沒動的原地繼續幹活,而且最終效果跟全部推倒重來一模一樣。

在以前,把宮保雞丁變成宮保雞丁(微辣),需要將整個餐館停業,重新培訓廚子、服務員和大堂經理。然而這樣顯然是浪費算力,增量協調相當於是檢查一下宮保雞丁(微辣)的菜譜,發現好像只要撒一點辣椒進去就可以了,於是就讓所有流程保持不變,多增加了一道撒辣椒的程序。DSH在“省token”這件事上,還留了一整套後手。它的PTC模式(程序化工具調用),讓模型生成一段代碼去組合多輪工具調用,原本要五次模型往返的操作序列,一次就完成了。相當於是把五次的輸入輸出,壓縮成了一次。誠然,DeepSeek漲價了,還漲了不少錢。就算是梁文鋒也沒辦法讓DeepSeek永遠便宜,但DSH能讓“便宜”這件事在漲價之後依然成立。

模型定價是DeepSeek說了算,DSH能做的,是把每一分錢榨出最大價值,貴可以貴,但絕不白貴。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛