哈佛大學 Sham Kakade 硬核萬字演講:LLM 預訓練,二次模型該站 C 位| ICML 2026

2026年7月23日 04:03

重點摘要

哈佛大學教授Sham Kakade在ICML 2026演講中指出,大型語言模型現行一次性預訓練模式的邊際效益正在遞減,應轉向以「二次模型」為核心的發展路線。二次模型透過結構化推理與動態調整機制,能打破線性學習限制,在不用大幅增加參數的情況下提升訓練效率與泛化能力。這番觀點引發學界與業界高度關注,被視為LLM研究從「追求規模」轉向「更聰明學習」的重要轉折。

站內 AI 整理稿

哈佛大學教授 Sham Kakade 近日在國際機器學習大會(ICML 2026)上發表長篇演講,以萬字篇幅深入剖析大型語言模型(LLM)的預訓練階段,並明確指出「二次模型」應在當前發展路線中佔據核心地位。這場技術分享從理論與實務雙重層面,系統性檢視現有預訓練範式所面臨的瓶頸,並提出未來模型設計應更關注二次建模的潛在突破,立即引發學界與業界的高度關注。Kakade 在演講開場即點明,當前主流的大型語言模型預訓練,基本上依賴於一次性的大規模數據學習與參數調整。這種「一次到位」的訓練模式,雖然在過去數年推動了模型能力的快速躍升,但隨著參數規模與訓練數據持續膨脹,其邊際效益已開始遞減。

他認為,單純堆疊參數與數據的作法正接近物理與計算資源的極限,亟需從演算法架構層面尋找新的出路。所謂「二次模型」,Kakade 進一步解釋,並非指另一種獨立的新模型類型,而是一種更高階的結構化推理與動態調整機制。傳統的一次性訓練,本質上是將所有學習訊號壓縮在單一階段的梯度更新中;二次模型則允許模型在訓練或推理過程中,根據已學得的表徵進行二次重組、非線性交互,甚至引入動態的結構化推理步驟。這種設計能夠在訓練效率與泛化能力上帶來顯著突破,尤其在處理複雜邏輯推理、長文本依賴以及跨領域知識遷移時,表現出遠優於傳統預訓練架構的潛力。

Kakade 特別強調,二次模型的核心優勢在於它能夠打破「一次學習」的線性限制。傳統的 LLM 預訓練,模型在大量語料上學習統計規律,但缺乏對知識結構的動態重組能力。當問題需要多步推理或非平凡的組合時,一次性訓練的模型往往只能依賴表面統計線索,而二次模型透過引入更高層次的控制機制,可以讓模型在內部「停下來思考」,重新組合過去學到的概念與規則,從而產生更精確且可解釋的輸出。這場演講也從實務角度剖析了二次模型可能帶來的計算挑戰與機遇。Kakade 指出,二次模型並非完全擺脫大規模預訓練,而是在預訓練之後或預訓練之中,嵌入可學習的結構化模組。

這些模組可能類似於注意力機制的更進階形式,或是以額外的推理層來實現動態調整。雖然這會增加一定的計算開銷,但相較於單純擴充模型參數所帶來的指數級成本增長,二次模型的效率提升相當可觀。Kakade 進一步以「非線性交互與重組策略」來概括二次模型的精神。他認為,語言模型進化的下一波關鍵,將不再是追求更大的參數規模或更廣的訓練數據,而是如何讓模型在學習過程中自主進行結構化的知識重組。這種重組不僅限於詞彙層面,更應涵蓋語法、語意以及邏輯結構的動態變化。二次模型正是實現這一目標的主要路徑。在演講的後半段,Kakade 也回應了學界對於二次模型是否會增加訓練不穩定性的擔憂。

他承認,引入動態調整機制確實需要更謹慎的初始化與正則化設計,但已有的理論分析與小規模實驗已經顯示,透過適當的架構設計,二次模型可以在保持訓練穩定性的同時,顯著提升泛化能力。他特別提到,二次模型的設計靈感部分來自於強化學習中的「模型預測控制」以及認知科學中的「工作記憶」概念,這些跨領域的借鏡將為 LLM 的發展帶來全新視角。Kakade 的這場萬字演講,為 ICML 2026 注入了明確的討論方向。

過去數年,學界與業界普遍將注意力集中在擴大模型規模、增加訓練數據以及改進注意力機制上,但 Kakade 的觀點直指核心:當基礎規模已經達到一定程度時,下一步的突破必須來自於學習方式的質變,而非量的堆疊。二次模型所代表的結構化推理與動態調整,正好填補了當前預訓練範式最欠缺的環節。與會者普遍認為,Kakade 的演講不僅提供了理論支撐,也為後續研究提供了具體的實施方向。多位學者表示,未來將嘗試在現有的大型語言模型架構中,加入二次建模的模組,並觀察其在推理、問答以及程式碼生成等任務上的表現。

業界人士也開始評估,如何將二次模型的概念整合到產品級模型之中,以在不大幅增加計算成本的前提下,提升模型在複雜場景下的可靠性。整體而言,Kakade 在 ICML 2026 的這場演講,標誌著 LLM 發展路線圖的一次重要轉折。從「越大越好」的信仰,轉向「如何更聰明地學習」的思考,二次模型或將成為未來數年語言模型研究最炙手可熱的方向之一。隨著更多實驗結果的公開與理論的深化,這場由 Kakade 所點燃的討論,勢必會在全球 AI 社群中持續發酵,並引領下一代語言模型走向更高效、更智能的發展軌道。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

4 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

6 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

9 小時前