Harness 神器 J-Space 造假案背後,思維鏈作者暴論,小模型 + 工具幹不掉頂級大模型

2026年8月20日 03:53
站內 AI 整理稿

外掛補不了模型智商,《苦澀的教訓》再次上演。作者丨高允毅 編輯丨岑 峰 這兩天在 X 上,一款蹭 DeepSeek 熱度的 Harness 工具被打假了。這是一個名為 J-Space Cognition Suite 的開源項目,它聲稱無需修改模型權重,僅靠 DeepSeek V4 Flash 加其精巧的外部 Harness,就能在 Agent 任務中追平 GLM-5.3;若換成 DeepSeek V4 Pro,甚至能直接超越Claude Fable 5。同時速度提升 2.53倍,Token 效率提升 2.21倍。如果這是真的,這無疑是 AI 工程史上的奇蹟。

這意味著J-Space能用幾十分之一的成本復刻頂級大模型的效果。然而,泡沫破裂的速度比想象中更快。GitHub 用戶 GoForceX 嚴格按照項目說明,使用 Terminal Bench 完成了獨立複測,最終結果與宣傳完全相反。加入 J-Space 後,基準測試分數不升反降,Token 消耗量明顯增加,推理速度也比原生模型更慢。當社區進一步要求公開完整原始實驗數據時,作者承認數據 "確實誇張",卻始終拿不出可復現的運行日誌,反而開始刪除質疑的 issue。

幾乎在同一時間,Open AI 思維鏈(CoT)核心發明者 Jason Wei 在 X 上發佈了一篇長文,精準戳破了 "小模型 + 萬能工具" 的幻想。他用自己學羽毛球的經歷做比,“在球場上,我就像一個 1B 參數的認知核心。教練教的每個擊球動作我都能做,但要在高速回合裡把架拍、轉體、擊球點、隨揮這些要點全部串聯起來,幾乎要耗盡全部精力。這跟那些練了上萬次、將動作化為肌肉記憶的專業選手完全不是一個級別。”Jason Wei隱喻的正是“小模型+ 工具”與“大模型內化能力”的本質區別。他強調“模型不依賴外部工具,自然且快速地完成任務,這件事至關重要”。

一旦承認高維認知應該以內生的方式處理,那麼 1B、甚至 10B 的核心顯然都是不夠的。01J-Space 神話切中的行業焦慮J-Space之所以能在 48 小時內引發全行業狂歡,在於它精準地切中了當前 AI 產業的兩大行業焦慮:大模型太貴,算力燒不起怎麼辦?大模型要落地,端側設備太弱怎麼跑?事實上,業內一直在尋找一種可能,小模型 + 工具也能幹掉頂級大模型。AI大牛吳恩達正是這一路線支持者之一。他曾多次在公開演講中展示數據:用版本更早、參數量更小的 GPT-3.5,搭配包含反思、工具調用、任務規劃的迭代式 Agent 工作流,在很多基準測試上的表現能夠超越當時最強的 GPT-4。

微軟 Phi-4、Mistral 等小模型,也靠著高質量數據訓練,在代碼、數學等垂直任務上,以 3B 到 14B 的體量擊敗過上一代千億參數模型。這讓很多開發者產生了一種錯覺:Scaling Law 的邊際效應正在遞減,只要工具配得好,小模型就能逆襲。今年 7 月,卡內基梅隆大學發佈的一篇論文《Better Harnesses, Smaller Models》,更是把這種討論推向了高潮。論文用詳實的測試數據提出,經過高度優化的 Harness 框架,小模型在特定任務上可以恢復大模型 90% 以上的性能,而成本卻可以忽略不計。

在 “Scaling 撞牆論” 此起彼伏、端側 NPU 剛剛普及的當下,這場圍繞 "小模型 + 工具能否幹掉頂級大模型" 的集體討論成為 AI 行業最核心的路線之爭之一。畢竟,行業急需一個能把“高智能”和“低成本”同時落實的工程解法。02 小模型+工具三大硬傷:速度、深度、可靠性Jason Wei 用他多年的技術直覺,直接點破了 "小模型 + 萬能工具" 幻想的三個軟肋。最直觀的差距是速度。你問一個常識問題,肯定希望 AI 立刻給出答案,而不是等它先去搜三五個網頁、再花十幾秒整理歸納。大模型把知識內化在數萬億參數的連接中,端到端直接輸出,延遲最低。

而小模型 + 工具的路徑,註定要經歷“判斷是否調用工具→構造查詢指令→等待工具返回→篩選有效信息→整合最終答案” 的完整鏈路。每多一步,延遲就增加一截。如果是多步推理任務,工具調用還要反覆進行,耗時更是指數級上升。J-Space 宣稱的 “速度提升 2.53 倍” 本身就違背基本邏輯,Harness 本質上是在模型外面加了一層控制邏輯,每一輪推理都要多做判斷、多走流程。它怎麼可能反而比原生模型更快?社區複測的結果驗證了這個常識:加裝 J-Space 後,Token 消耗更多,推理速度更慢。因為所謂的 "外部控制" 本身就需要消耗計算資源和 Token 預算。

比速度更本質的差距,是思維的深度與歸納能力。很多人以為,大模型知道的東西網上都有,讓小模型去搜就行了。但 Jason Wei 舉了一個例子:如果你問 "大家對香巴拉音樂節的普遍看法是什麼",小模型可能只翻熱帖下面的前三條評論,而大模型卻能像一個真正的業內專家,在看完幾萬條各種各樣的評價後,給你提煉出一個客觀、綜合的總體印象。這就是大模型預訓練的真正價值,它可以在海量數據中,把海量的知識消化成了自己的見識和常識。這種對世界的洞察力,也是我們要追求的終極智能之一。J-Space 這類 Harness 工具,恰恰在這個層面最無力。

它可以優化搜索路徑、規範調用格式,但它沒法憑空賦予小模型更高維的抽象歸納能力。第三重差距,還在於處理複雜長任務的可靠性上。Jason Wei 提到,在複雜的長週期任務中,每一步的微小誤差,會像滾雪球一樣越滾越大。到最後,整個任務會徹底跑偏甚至崩潰。大模型因為有全局的語義理解和自我糾錯能力,能感知路線是否偏移,並對局部偏差進行修正。但小模型本身元認知能力就弱,再加上它每幹一個活兒都要層層轉接外部工具,這種“現學現賣”的模式,出錯的概率更高。J-Space 複測中出現的 “性能小幅下降”,就是典型表現。複雜的外部 Harness 不僅沒幫上忙,反而把本就不強的小模型繞得更混亂。

說到底,工具只是放大器,不是發動機。在限定 Benchmark、限定提示詞、人工篩選樣本的條件下,小模型+工具能跑出漂亮的數字,但在真正的開放任務、長任務、模糊約束、多工具協作的真實場景呢?內化的本能,永遠比臨場查手冊更快、更穩、更準。03從工程派到規模論,Jason Wei 的認知轉變很有趣的一件事是,Jason Wei 當初也是“大模型規模論”的懷疑者,而今天,他堅定站在 "大模型不可替代" 這一邊。他的認知轉變之路,幾乎就是過去五年大模型行業發展的縮影。2021年時,Jason Wei 在 Google Brain 還是一個典型的工程派。

他和團隊發現,只要在提示詞中給出邏輯推導的示例,讓大模型學會“把思考過程一步步寫出來”,模型的推理能力就會大幅提升,這就是後來改變行業的“思維鏈(Chain-of-Thought)”。那段時間,他沉迷於通過精巧的 Prompt 設計、指令微調來挖掘模型潛能,試圖用輕量化的工程手段撬動更大的智能產出。但隨著研究深入,兩個關鍵發現徹底改變了他的看法。第一個發現是湧現能力。

在他那篇里程碑式的論文《Emergent Abilities of Large Language Models》裡,他將“湧現能力”定義為“An ability is emergent if it is not present in smaller models but is present in larger models.”(即小模型不具備而大模型具備的能力),這個定義已成為模型擴展定律研究的經典基石。他用數據證明了,很多高級能力,比如三位數加法、多步推理,在小模型上無論你怎麼調提示詞、怎麼加外掛,正確率都幾乎是零。但一旦參數規模跨過某個臨界點,大約 100B 量級,許多高階能力開始湧現。

這意味著,小模型沒有高階智商。第二個發現是思維鏈只在大模型上有效。在思維鏈論文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中,很多人只記得思維鏈能提升推理能力,卻忽略了論文裡一個關鍵結論:在小模型上使用思維鏈,不僅不會提升性能,反而會因為引出錯誤的中間推理步驟而導致成績下降。因為邏輯推理本身,就是規模的產物。這兩個發現徹底堵死了 "小模型靠精巧 Prompt或者Harness 實現高階推理" 的幻想。

在 OpenAI 期間,他作為核心成員參與了 o1 系列等前沿推理項目的研發,對大模型內生能力的價值有了更深的理解。他在一篇博客裡寫道:“想讓大模型超越人類老師,就必須用強化學習,去逼出它內生的高階思考能力。”04DSPy 框架之父的數學呼應Jason Wei 的觀點也得到了另一位技術大牛的呼應。DSPy 框架的作者,MIT 助理教授Omar Khattab在 Jason 發推後不久,從學術和系統層面的視角,再次佐證了“內化優於外掛”這一核心判斷。他用底層數學邏輯,精準指出了兩者的計算差異。他認為大模型使用的是注意力機制。它將所有上下文完整保留在顯存中,每次以“全知視角”重新審視所有信息。

這對應的正是 Jason 說的大模型的“內化能力”而小模型+工具本質上是一種壓縮與遞歸。它必須把複雜的外部世界塞進工具的輸入輸出裡,在這種一輪一輪強行“信息脫水”和往下傳遞的過程中,大量高維信息丟失了。Omar 指出,“雖然我們在工程上可以用各種‘外掛’來模擬出智能的表象,但在數學層面上,靠一輪輪壓縮的‘遞歸’,永遠無法完美模擬‘注意力機制’對全局的掌控力。”不僅如此,Omar 團隊還在其重磅論文《Machine Studying》中,重新定義了什麼是 AI 的“專業能力”。他們認為,判斷一個系統專不專業,不該看它閉卷考試拿了多少分,要看它用多少推理計算量,能換來多高的準確率。

對於新手型 Agent 來說,它必須靠瘋狂搜索、反覆試錯,消耗大量 Token 才能勉強答對;而專家型 Agent 搜索次數少、命中率高,在低計算預算下就能有很好的表現。05《苦澀的教訓》的迴響這場爭論走到最後,終究繞不開 AI 領域那個經典之作,來自強化學習教父、人工智能先驅 Rich Sutton 的《苦澀的教訓》“人類在 AI 領域的所有精巧工程設計,最終都會被絕對的算力和數據規模碾得粉碎。”從這個視角來看,小模型加工具本質上就是一種精巧工程,試圖用人類擅長的工程鏈路去彌補模型本身容量的不足,而大模型則是純粹規模定律的勝利。回顧 AI 發展史,這樣的故事已經上演過無數次。

七十年代專家系統盛行,人們相信把人類專家的知識寫成規則就能造出智能,最終走向失敗;九十年代到 2010 年代,自然語言處理依賴精心設計的特徵工程與統計模型,語言學家們一點點打磨系統性能,直到深度學習出現,端到端的大規模訓練直接重構了整個領域;2010 年代末知識圖譜再度興起,人們以為結構化的實體關係能讓 AI 真正 “理解” 世界,結果預訓練大模型證明,從海量數據中自發學到的隱式知識,遠比人工構建的結構化知識更強大。每一次,人們都試圖用巧思走捷徑;每一次,最終勝出的都是更簡單、更吃算力的方法。既然苦澀的教訓一再應驗,為什麼人們還是一次次地投入 "工程派" 的懷抱?因為太貴了。

萬億參數模型的訓練成本是天文數字,不是每家公司都能承擔得起,而且每個日常場景也並不都需要頂級智能。比如開發者 Matthew Auburn 曾公開表示,“對於小模型,Harness 就是一切”。他認為在商業場景裡,90% 的任務只需要 60 分的智能 + 100 分的執行。性價比才是王道,頂級智能反而是浪費。也有開發者提出了更折中的未來方向:行業最終會走向一種中間狀態,核心認知能力會被拆分為多個十億級的專家模型協同工作,就像混合專家(MoE)架構的延伸。這些專家模塊更靈活、可替換、可審計,而不是現在這樣用一個粗放的 Harness 試圖包打天下。

事實上 Omar Khattab 本人就是 Harness 優化的重要推動者,他的 DSPy 框架、Meta-Harness 研究,本質都是在提升工具鏈的自動化水平,他不認為 Harness 能替代模型本身的能力,卻從未否認 Harness 的工程價值。參考鏈接:https://x.com/maxforai/status/2089734195002445912?s=46https://x.com/_jasonwei/status/2089429555371024577?s=46https://x.

com/lateinteraction/status/1909011076605518124上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

大廠這波Agent混戰,殺死10多個AI名品

大型科技企業在人工智慧領域的競爭,正從單純的模型較勁,快速轉向更貼近實際應用的Agent(智慧體)戰場。過去一段時間,各大廠接連端出以「工作」、「效率」為核心的智慧體產品,試圖搶占使用者桌面與瀏覽器的主控權。然而這波快速推進的卡位戰,也伴隨著殘酷的淘汰,多達十餘款曾經備受關注的AI工具,在短短時間內從市場上消失,成為大廠戰略調整下的犧牲品。 這波混戰的起點,其實是AI應用從「能對話」走向「能做事」的轉折。

剛剛
IT之家生成式AI

澳大利亞唱片業協會“重拳出擊”,純 AI 生成歌曲禁入官方排行榜

作者:清源 責編:清源 評論: 8 月 25 日消息,據美聯社報道,隨著生成式 AI 快速發展並開始威脅音樂人的生計,當地時間 25 日(今天),澳大利亞唱片業協會(ARIA)決定禁止完全由 AI 生成的歌曲進入官方排行榜。新規出臺前,一首由澳大利亞製作人利用 AI 生成人聲和鼓點重新制作了麥當娜的名曲《Like a Prayer》,並連續 16 周躋身澳大利亞前 20 名,也讓生成式 AI 在音樂行業中的地位成為爭論焦點。

剛剛
量子位生成式AI

開源國產8B模型,比肩閉源Image 2了!

商湯科技正式開源SenseNova U1.5 Lite,這是一款僅8B參數的國產生圖模型,主打4K直出與更完整、準確、穩定的表現。該模型能一次處理多張圖片與複雜指令,例如將九張食物照合成精美食譜卡片,並支援精準的局部圖像編輯,同時保留原圖其他區域的結構與空間關係。其亮點包括超長指令遵循、高品質視覺生成、可靠的原生編輯,以及優異的中英文文字與複雜佈局處理能力。

剛剛