代碼榜逐漸飽和,下一個前沿是AI科研,但大模型卡在了最關鍵一步

2026年8月6日 18:29
代碼榜逐漸飽和,下一個前沿是AI科研,但大模型卡在了最關鍵一步

重點摘要

代碼能力評測逐漸飽和,AI for Research 被視為下一個前沿,但大模型在關鍵的「方法發現」能力上仍卡關。當前自進化 AI 混合了執行、工程優化與方法發現三種能力,而真正推動機器學習進步的,是能提出全新機制的方法發現。

站內 AI 整理稿

代碼榜逐漸飽和,下一個前沿是AI科研,但大模型卡在了最關鍵一步

過去一年,AI領域中最受關注的趨勢之一,莫過於「Auto-Research」、「自進化AI」與「遞歸自我改進」等概念的崛起。這些技術讓模型不再只是被動回應指令,而是能夠主動進入程式碼倉庫、調用外部工具、修改訓練程序,並根據實驗結果持續迭代。部分系統甚至已經具備更新記憶、累積技能、清理資料的能力,並參與下一代模型所需的工程流程。隨著模型在傳統程式碼評測上的表現快速提升,這類評測的空間也逐漸趨於飽和,業界開始將目光轉向「AI for Research」,視其為下一條重要的能力前沿。

然而,當AI能夠執行越來越多的研究動作時,一個更根本的問題也隨之浮現:它究竟只是在更高效地執行那些人類已經定義好的工作,還是已經能夠像頂尖人類研究者一樣,發現真正能推動機器學習發展的新方法?這個問題的答案,將決定AI在科研領域的定位與價值。當前關於「自進化」的討論,往往混合了三種截然不同的能力層次。第一種是「執行能力」,也就是將人類給出的需求轉化為具體的程式碼與實驗流程。這類能力最接近傳統的自動化,模型只需按照指示完成任務,不需要太多原創性。第二種是「工程優化」,即在固定目標下進行參數調整、組件替換,或從大量候選方案中篩選出最高分的結果。

這類能力雖然需要一定的判斷力,但本質上仍是在已知框架內尋找最佳解。真正困難的,是第三種能力——「方法發現」。這指的是模型能夠識別現有方法的根本侷限,提出此前不存在的新機制,並證明該機制能夠跨資料集、任務類型與規模持續成立。回顧機器學習的發展歷史,卷積神經網路、殘差連接、注意力機制、歸一化技術、擴散模型與PPO等重大突破,其價值並非來自某一次固定評測上的分數提升,而是因為它們從根本上改變了模型處理問題的方式。目前,大多數號稱「自進化」的系統,其實仍停留在前兩種能力層次。它們可以在給定的任務上不斷優化,甚至超越人類工程師的效率,但當面對需要原創性思考的科研問題時,往往無法跳脫既有的思維框架。

這也解釋了為何儘管AI在程式碼生成、數據分析等領域表現驚人,但在真正推動學術前沿的「方法發現」上,進展依然有限。業界普遍認為,要讓AI具備第三種能力,需要的不只是更大的模型或更多的訓練數據,而是從根本上改變模型的學習與推理方式。目前的深度學習模型擅長從大量樣本中歸納模式,但對於需要抽象思考、假設驗證與跨領域聯想的科研工作,這種能力還遠遠不夠。換句話說,AI在科研領域的瓶頸,並非來自計算資源或數據量的不足,而是來自於「如何讓機器真正理解問題的本質」。這個挑戰也反映在評測標準的演變上。

過去,程式碼評測如HumanEval或SWE-bench,主要衡量模型能否正確生成程式碼或修復錯誤,這屬於執行能力與工程優化的範疇。但若要評估模型在科研上的潛力,就需要更複雜的評測框架,例如要求模型提出新的演算法、設計實驗來驗證假設,甚至撰寫完整的學術論文。目前已有團隊開始嘗試建立這類評測,但尚未形成業界共識。值得注意的是,部分頂尖實驗室已經開始探索如何讓AI參與更開放的科研流程。例如,讓模型自動閱讀大量論文、提出假設、設計實驗,並根據結果修正理論。這些嘗試雖然仍處於早期階段,但已展現出一定的潛力。然而,這些系統目前仍高度依賴人類研究者的引導,無法獨立完成從問題定義到結論驗證的完整閉環。

從另一個角度來看,AI在科研上的應用,也可能反過來推動模型本身的進化。如果模型能夠透過科研過程發現新的訓練方法或架構,那麼它就能夠實現真正的「遞歸自我改進」,而不只是優化現有參數。這正是許多研究者夢寐以求的場景,但也是目前最難突破的關卡。總體而言,AI在科研領域的發展,正面臨一個關鍵的轉折點。程式碼評測的飽和,意味著模型在執行與優化層面已經接近天花板,但「方法發現」這條路才剛剛開始。未來幾年,能否讓AI從「高效執行者」進化為「真正的發現者」,將決定這個領域的下一個重大突破何時到來。而這一步,或許比許多人想像的還要困難。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

15 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前