萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡

2026年9月1日 08:41
站內 AI 整理稿

不管哪個時代,人都會遇到同一道題:無論宏大敘事還是人生決策,面前問題太複雜,資源和時間卻不夠,必須決定先做哪個、放棄哪個。()從 1812 年黑格爾的辯證法,到馬克思、列寧,再到 1915 年毛澤東在延安寫下的《矛盾論》,一百多年裡,這套思想最終落到了一個很實際的問題上:複雜事物中矛盾很多,但真正重要的是找到決定其他矛盾的主要矛盾。今天的大模型行業也不例外,當前大模型行業面臨的主要問題有以下這些:1.模型能力的增長速度,同把這種能力轉化成可靠產出的能力之間的矛盾(模型強,但產出物沒價值)。2.算力資源受限,同能力需求無限之間的矛盾(人們總吐槽 AI 太傻)。3.

單價在快速下降,同真實賬單在上漲之間的矛盾(模型便宜了,但每個月花的更多了)。4.要做通用智能,同要交付一個能用的產品之間矛盾(簡單的不好用,好用的不簡單)。這些矛盾才構成了交錯向上發展的行業和機會。沒有人能逃避這些選項,DeepSeek 也一樣。我們對 deepseek-v4-Pro以及 Harness 做了幾輪實測:直接打接口的探針、七次編碼任務運行(其中四次是隻改一個變量的對照)、把上下文壓到 92 萬 token 的位置測試,加上把它 19.8 萬行源碼和 21.7 萬行測試過了一遍。試圖來回答以下問題:1.v4-Pro這個模型到底怎樣,比 flash、preview 版本有哪些不同?

2.好多網友反饋接入其他 Harness 會降智是怎麼回事?3.使用成本到底怎麼樣?能否量化?4.Harness 解決什麼問題?什麼人適合它?總而言之,這幾天的研究和使用下來還是很精彩的,我們甚至能透過 v4-Pro和 Harness 管中窺豹,看到一些 DeepSeek 對技術、對人性,甚至對世界的判斷和認知。01先看模型:DeepSeek V4 Pro 到底強在哪裡?Pro 很可能重做了一次非常先進的後訓練Pro和 Flash 這兩個模型其實有挺多版本,我們一次性拉出來看下:【Provs Flash 全參數對照,含字段釋義】我們會發現兩個有意思的結論:1.

Pro 對比 flash,模型本身的層面在深度、寬度、注意力、專家池以及專家內部寬度都有很大進展。2.但這五個維度都是預訓練階段就定性的,不是後訓練帶來的變量。(有一樣是相同的:每個 token 實際只激活 6 個專家,兩個模型都是 6。)還有一處彩蛋,後面會再 call back:deepseek Harness 的出廠默認模型寫的是 deepseek-v4-flash。【packages/bundle/base/cordis.patch.yml 裡 agent-default-model 】為什麼 Pro 正式版拖到 Flash 轉正之後才公佈?坊間其實預測 Pro 早就該來了。

我們都知道模型預訓練定天花板,後訓練定發揮。如果去翻舊賬會發現四月那版 v4-Pro-Preview 其實有一個缺陷:競賽型代碼題三項全場第一,但 Terminal Bench 2.0 只有 67.9。7 月 31 日 Flash 轉正,官方貼出它的 Terminal Bench 2.1 是 82.7,而同一張表裡 Pro-Preview 是 72.1。也就是說 Flash 正式版的 Terminal Bench 已經比旗艦模型 Pro的分數高不少了,我合理推測 DeepSeek 在 Flash 版本上嘗試出了更好的後訓練方法,因此 v4-Pro 被回爐重造。

【官方自測當前 v4 家族和幾款旗艦模型的評測分數】再看 v4-pro-0813 的幾項躍升裡邊,正好 Terminal Bench 2.1 從 72.1 到 87.9,DeepSWE 從 12.8 到 62.7,內部全棧測試集從 41.8 到 71.1。我自己也出了兩道題去驗這件事,因為分數漲了和活能不能幹好是兩回事。一道是同一個改動要落到五處分散的調用點上,其中一處是用字符串登記的,grep 根本搜不出來;另一道是兩個前後串聯的故障,修的順序錯了就白改。在實測中六次運行全部滿分,那個搜不出來的點它也找到了。(我們自己造的題、樣本小,不與官方或第三方的分數並列比較。

)也就是說這一版補上的是能自己把一件活幹完的能力。以前估計得在旁邊盯著,現在可以把一件有明確驗收標準的活交出去,然後走開。(而且做的更好了。)但這張官方表還有另一半,中英文媒體都沒提。媒體的敘事是“逼近 Claude Fable 5”。而在 DeepSeek 自己貼的對照表裡,Kimi K3 在多數 agentic 項上仍然領先 0813,比如 Terminal Bench 2.1 是 88.3 對 87.9,DeepSWE 67.5 對 62.7,Toolathlon 76.5 對 74.1,Agents' Last Exam 27.6 對 25.7。0813 只在三項上領先。

(這是官方自測表,K3 與 GLM 的分數來源官方未說明。)大概 deepseek 想傳遞的敘事是發生在國產開源之間,並無心和國外閉源模型較真。還有一個更有意思的數據:官方 changelog 裡 Flash-0731 和 Pro-0813 用的是同一套內部測試集、同一個 Harness,所以可以直接並排:【Flash-0731 vs Pro-0813 同口徑九項】Pro 的總參是 Flash 的 5.6 倍、激活參數 3.8 倍。但換來的是個位數的領先。最難那一項 Agents' Last Exam 分別是25.2 對 25.7,幾乎打平。

而且它自己那個框架的出廠默認模型寫的是 deepseek-v4-flash;第三方評測機構 AA 的 coding agent 榜上,DeepSeek 那一行用的也是 Flash;兩個老模型名下線前指向的同樣是 Flash。【AA 的 coding agent 榜上 DeepSeek 那行用的是 Codex+Flash】幾條獨立線索都指向同一件事:Flash 才是它認定的主力性價比檔,Pro 是上限檔。但是官方並沒有披露過 0813 這個版本重做了後訓練,只說它建立在 Preview 的結構之上、外掛了一個投機解碼模塊。

但同系列的 Flash-0731 有明文:"keeps the same model architecture and size … and was only re-post-trained"。因此 Pro模型重新做過後訓練是我們的單純推斷而已。【Flash-0731 官方明文“只重做了後訓練”】還有個值得一提的行業現象,隔一天發佈的 GLM-5.3也是同一個 744B 底座、不換架構、不重新預訓練,全部提升來自延長後訓練,也主打 agentic。兩家頭部開源模型隔一天做了同一個動作是否說明這一代旗艦升級的主戰場,已經從預訓練挪到了後訓練。

1M 上下文的真相這是本輪最獨家的一處發現,而且任何人都能自己核對。【Hugging Face 上 config.json 裡的 ropescaling 那幾行】65536 × 16 = 1,048,576,正好 1M。也就是說這 1M 不是原生訓練出來的,是在 64K 的基礎上用一種叫 YaRN 的辦法外推 16 倍得到的。像一個只在 100 米跑道上練過的人,你讓他跑 1600 米。也不是不能跑,但是很可能最後幾百米的質量直線下降。而且這在同行裡是特殊的。

三家都標 1M:【三家 1M 的三條不同路徑】我們可以看到在三個都標 1M 的開源旗艦裡,只有 DeepSeek 在配置裡明確用了外推縮放。Kimi K3 沒有這個字段,它換掉了注意力機制本身;GLM-5.2 也沒有外推參數,它把 ropetheta 拉到了 800 萬。但必須說明配置只能證明是否在推理期做位置縮放,不能直接證明訓練長度,所以準確說法是隻有它明確用了外推。另外 GLM-5.3 的權重開源延後約兩週,這一欄對照的是 5.2 的可核配置。順便一提:GLM-5.

2 的架構類名叫 GlmMoeDsaForCausalLM,它的 indexer 字段和 DeepSeek V4 同名,indexheaddim 連值都一樣是 128。而智譜在自己的官方模型卡里明寫:"GLM-5 also integrates DeepSeek Sparse Attention (DSA), largely reducing deployment cost while preserving long-context capacity."這就不是推斷了,是對方正面寫出來的。

【智譜官方模型卡承認集成 DSA,且是正面致謝式表述】那麼按通常的工程認知,外推得來的長上下文代價會出現在窗口後段,也就是說越到後期質量越差。我跑了個腳本實測了一下,把可客觀判對錯的事實埋進長文本的不同位置,看它能不能取回來。【自測五個位置的命中率與埋點深度】語料 3,857,465 個字符 = 923,858 個輸入 token。五個位置各埋兩條,10/10 全部命中,零編造,零文檔中未提及。其中 95% 那個位置,落在約 90.2 萬 token 處(真正的尾巴片段)。所以結論是外推並沒有導致窗口後段衰減。

不過最後大約 8% 我們仍然沒碰到,但足以說明跑到 1440 米還沒掉速,只是最後 160 米沒測。不過官方自己給 Claude Code 的接入建議裡,把自動壓縮窗口設在 768K,也就是 1M 的四分之三。他們的建議就是別把 1M 跑滿。【Integrate with Claude Code-768K 自動壓縮窗口建議】02V4 Pro 到底貴不貴?單價偏貴,一項任務便宜第三方評測機構 Artificial Analysis 明確把它的輸入價標為 expensive。同類中位數是每百萬 token $0.33,它是 $1.32。但它每個任務只花 $0.

25,在同批 106 個開源大模型裡第二低。【AA 每任務成本 × 智能指數,含緩存經濟學】比它強的 Kimi K3 每任務 $0.84,貴 3.4 倍;和它同分的 GLM-5.2 是 $0.32;最強的 Claude Opus 5 是 $2.34,貴 9.4 倍。就是說它起步價比別人貴,但路線短、繞得少,一趟算下來還算便宜。真正省錢的是緩存agent 幹活的方式天生就是繞彎的。讀一遍不夠就讀兩遍,改錯了再改回來。繞彎就是燒 token。所以真正算賬的時候不應該去看單價多少,應該去看完成一次任務要多少米。

我們在長上下文測試里正好量到了這個數:同一份 92 萬 token 的上下文,第一次提問花了約 ¥9.00,第二到第五次提問加起來只花了約 ¥0.28。五次提問裡被緩存命中的部分完全相同:923,776 個 token,只有 143 到 151 個 token 是新的。而我們四次編碼任務的緩存命中率在 93% 到 98% 之間。這就像熬火鍋底料。第一次熬很貴,之後每次下菜只加一點新料。但底料只要被改動一點點,就得從頭重熬。也就是說讓他多試幾遍也沒關係,反正大頭出在第一次上面。

省錢是寫在工程裡的我們在它 219 個包裡查到,215個 README 都必須回答同一個問題:我對 KV 緩存前綴穩定性有什麼影響。而且它還有個只許規劃、不許動手的 plan 模式。正常做法是把寫文件、改代碼這些工具從工具表裡摘掉,摘了模型就調不到。但是 dsh 沒摘。出廠提示詞裡明寫:The tool catalog stays the same across modes for request-cache stability … those tools remain listed only to keep the request shape stable.

【packages/bundle/base/cordis.patch.yml】它寧可承擔模型不聽話、真去調用了被禁工具的風險,也要保住請求前綴不變、保住緩存命中。因為很可能拿掉一個工具後整個緩存命中得重來。而且還有一個工程設定:工具結果超過 8,192 字符就裁、留頭 4,096 尾 1,024;超過 50,000 字節直接落盤不進上下文;連給會話起個標題都設了 64 token 的輸出上限。每一處都在算 token 真不是願景或者口號,DeepSeek 是真為你錢包著想。【工程常量三連,都出自同一個文件 packages/bundle/base/cordis.patch.

yml】8 月 17 日 0 點漲價正式生效(英文頁寫的是 16:00 UTC, Aug 16,恰等於北京時間 8-17 00:00)。【 定價頁峰谷兩檔價 + UTC 高峰時段腳註】對舊價的倍數:緩存命中漲 6 到 12 倍,未命中漲 1.5 到 3.0 倍,輸出漲 2.25 到 4.5 倍。高峰時段是 UTC 01:00–04:00 和 06:00–10:00,也就是北京時間 9 點到 12 點、14 點到 18 點。注意漲得最多的是緩存命中。而我們四次編碼任務的命中率在 93% 到 98% 之間(最高那次是 1,431,040 對 30,672)。

所以這次漲價真正肉疼的是那些把緩存用得最好的人。把前面幾章串起來看,會發現同一件事在不同層面重複出現。架構層:MoE 讓總參像 1.6T、算力像 49B。定價層:單價偏貴、每任務第二低。緩存層:92 萬 token 第一次 ¥9、後四次 ¥0.28。工程規範層:215 個包必答緩存前綴問題、plan 模式寧可不摘工具、連會話標題都限 64 token。DeepSeek 一直在做同一件事:用更少的算力和更少的上下文,買同樣的產出。而當 DeepSeek 把自己的 Harness 也開源之後,我們發現,這種對計算成本的敏感已經不只體現在模型和定價上,而是直接寫進了 Agent 的運行方式裡。

03為什麼換個 Harness,模型就像“降智”了?社交媒體和知乎上早有用戶實測:把 V4 Pro接到 Claude Code 裡明顯變差,同樣任務換 OpenCode 就正常。那位作者自己也說,分不清是模型的問題還是工具的問題。我們實際測試,打了接口,發現答案是官方路由導致的。DeepSeek 為了讓 Claude 生態的工具直接接過來,做了一層模型名翻譯。

Anthropic 那邊有三檔(Opus 旗艦、Sonnet 主力、Haiku 輕快),DeepSeek 只有兩檔,於是 claude-opus 對應到 Pro,而claude-sonnet 和 claude-haiku 一起對應到 Flash。響應裡的 model 字段就是這麼回的。【DeepSeek API Docs-Anthropic 三檔壓兩檔的映射】問題就發生在 Sonnet 這裡,這在 Anthropic 那邊是幹活主力,能力離 Opus 更近,但在這套映射裡被和 Haiku 一起歸到了 284B 的 Flash。這是可以定向做的兼容層。

我們試了非 claude 的名字:foobar-9000 和 gpt-5-turbo 都直接報 400,錯誤信息明說只支持那兩個 DeepSeek 模型名。只有 claude-* 開頭的名字才會靜默落到某個 DeepSeek 模型。所以 Claude 生態的用戶命中它是必然的並不是意外。還有一個更容易踩的坑:配置裡寫著任何非當前代的 claude 名字,都可能落到 Flash。比如claude-3-opus-20240229 名字裡有 opus,但最後落到的是 Flash。而 claude-opus-4-6 落到 Pro。

如果開發者照抄老教程、老腳本,那幾乎必然會踩到這個坑裡,你以為用的是 pro,實際是 flash 在跑。那這時候有用戶要問了,好傢伙你不會收著我 Pro 的錢,實際跑 flash 的質量吧?!我們實際打了 23 發會被映射到 Flash 的請求、把累計輸出堆到 10.3 萬 token,讓餘額跳動 ¥1.00。四套價格假設裡最接近的是按 Flash 計價(預測 ¥0.925,差 ¥0.075;次近的“按 Pro”差 ¥0.388,遠 5 倍)。所以這不是錢的問題,主要問題是我以為在用 1.6T 的旗艦,實際有一部分活是 284B 的小模型在幹,而且沒有任何提示。

如果開發者拿這樣一個環境去評測和跑任務,其實幹活的是兩個模型的混合物。因此對開發者而言,用 Claude 生態的工具接它,ANTHROPICMODEL、ANTHROPICDEFAULTOPUSMODEL、ANTHROPICDEFAULTSONNETMODEL、CLAUDECODESUBAGENTMODEL 這四個環境變量要一起顯式覆蓋。這次測試也讓我們意識到,到了 Agent 階段,只討論模型本身已經不夠了。模型接入什麼 Harness、看到什麼工具、如何管理上下文,同樣會直接影響最終表現。04DeepSeek Harness : 它到底解決了什麼問題?

8 月 13 日晚 19:19,V4-Pro正式版公告發出。76 分鐘後,DeepSeek 把自己的那套腳手架也開源了。最後一條它寫在了倉庫描述第一行:【Harness 時間線十行 + 單向開源四字段】官方分數終於可以復現了廠商報跑分,用的都是自家的腳手架,而腳手架不公開。所以我們看到的分數是這個模型配那套腳手架的成績,實際上不是這個模型的成績,因為環境拿不到也就沒法復現。

DeepSeek 自己在公告腳註裡也說明了這件事:0813 的 Code Agent 成績是用「DeepSeek Harness 極簡模式」加 max 思考檔跑的,並主動聲明“其他框架下結果可能略有不同”:它把這套配置直接放進了倉庫:【 minimal.cordis.yml 的關鍵幾段】極簡模式下模型能看到的工具只有兩個:一個持久 bash、一個字符串替換編輯器。上下文壓縮:關閉。系統提示詞:一句話。而流空閒超時是 172,800,000 毫秒48 小時。他們預期的是能跑兩天的任務。而有意思的是 Claude Code 恰好是反過來的:重系統提示詞、一大堆工具、帶自動壓縮。

兩者幾乎是對立的兩端。我們照它跑通了,兩道題同樣滿分。那官方備註的“略有不同”到底有多少?我們用同一批題跑了兩邊:【實測三配置 × 兩題矩陣】同一道多文件重構題,標準模式走了 42 步,官方極簡模式走了 65 步(多 55%)。另一道終端修故障題,20 步對 27 步,多 35%。兩道題極簡模式都做對了,但改動密集那道題的成本高了 58%,累計的緩存命中量是標準模式的 2.4 倍(它沒有上下文壓縮,65 步全累在一條鏈上)。咱比喻一下,相當於只給你一把瑞士軍刀去修車,對比給你一整套工具箱。軍刀什麼都能幹一點,所以你確實能修好,但要多擰很多下。工具少不等於省,它是用步數換了工具數。

Everything is a PluginEverything is a Plugin那到底什麼是 Plugin?我理解其實就是 OS 和 APP 的關係,蘋果造 iPhone 的時候,根本不知道十年後會有個叫「小紅書」的 App。核心沒變我只需要加強平臺環境,能力卻無限長出來,這就是插件能帶來的想象力。dsh 把這件事推到了什麼程度呢?模型適配器、工具註冊表、

Related

相關文章

量子位生成式AI

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑

MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

剛剛

奧特曼播客曝猛料:Astra操作電腦已達人類水平

OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

剛剛

奧特曼直言:四年太久,大學兩年就夠

OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

剛剛

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成

中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

剛剛
智東西生成式AI

混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減

(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。 騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

剛剛

2026年的一切,都只是Robocity的序幕

35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。

剛剛