智譜唐傑:萬億參數是行業早期的探索

2026年8月19日 13:48
站內 AI 整理稿

智譜聯合創始人、首席科學家唐傑今日在社群平台X上發表長文,針對當前大型語言模型領域備受關注的「規模法則」(Scaling Law)提出個人見解。他明確指出,業界過去幾年競相追逐的「萬億參數規模」,其實僅是模型發展早期階段的探索方向,並非持續提升模型能力的唯一路徑。這項觀點立即引發技術社群的討論,也為當前大模型軍備競賽提供另一種思考角度。在貼文中,唐傑同時解釋了智譜為何沒有繼續擴大其GLM-5.3模型的參數規模。他透露,智譜在這一輪訓練中,策略性地將重心轉移至長程任務環境與強化學習。這項調整並非否認參數增加的價值,而是基於實際訓練經驗與模型瓶頸分析後做出的務實判斷。

智譜團隊認為,單純追求參數量級的增長,已經無法有效解決模型在複雜推理、長期記憶與自主學習等關鍵能力上遭遇的瓶頸。唐傑進一步說明,強化學習與長程任務場景的設計,能夠讓模型在更貼近真實應用的環境中反覆迭代。透過這種方式,模型不僅能提升決策的品質,也能在任務完成度上取得顯著進步。他舉例,許多實際應用場景中,模型需要處理長篇文件、多輪對話或連續決策,這些任務對記憶與推理的要求遠高於傳統的單一問題回答。而傳統的參數擴增,在這些領域的邊際效益已經明顯遞減。智譜的這項策略調整,反映出公司對於模型發展路線的務實態度。

不同於部分競爭對手持續堆疊參數、追求更大規模的模型,智譜選擇將資源投入在訓練方法與任務設計的創新上。這也呼應了業界對「規模法則」邊界的一次重新審視。過去幾年,從GPT系列到其他開源模型,參數規模從數十億一路攀升至數千億甚至上兆,但近期包括Google、Meta等機構的研究也開始討論,單純增加參數是否能持續帶來性能提升。唐傑在貼文中並未否定參數增長在特定領域的價值,但他強調,模型能力的突破不能只依賴於硬體算力與參數量的線性成長。他認為,未來的發展方向應該更注重訓練資料的質量、任務多樣性以及學習演算法的效率。

尤其是強化學習,能夠讓模型在與環境互動的過程中自主調整行為,從而獲得超越靜態數據集的泛化能力。智譜的GLM系列模型在中國AI領域具有相當影響力,尤其是GLM-130B等版本曾引發廣泛關注。如今GLM-5.3的訓練策略調整,顯示該公司正在嘗試一條不同於主流的路徑。唐傑表示,長程任務環境的設計,讓模型必須在數千甚至數萬個token的上下文中保持連貫性,這對注意力機制與記憶管理提出了更高要求。而強化學習則讓模型能從錯誤中學習,逐步優化決策策略。業界分析人士指出,智譜的轉向並非孤例。隨著大模型訓練成本持續上升,許多研究團隊開始反思「越大越好」的迷思。

事實上,參數規模的增長雖然帶來了語言理解能力的躍升,但在推理、規劃、長期記憶等認知層面的進步卻相對有限。唐傑的觀點,正是對這股反思潮流的具體回應。值得注意的是,唐傑在貼文中也隱約暗示,智譜未來可能不會再以參數規模作為模型宣傳的主要賣點,而是轉向強調模型的實用性、穩定性與任務完成效率。這項策略,對於企業客戶與開發者而言,或許更具吸引力。畢竟,許多商業應用場景中,模型的反應速度、成本控制與可靠性,往往比絕對的參數數量更為關鍵。從整體生態來看,唐傑的發言也為中國大模型產業提供了一個新的討論方向。過去一段時間,國內外多家公司紛紛發布萬億級參數的模型,市場競爭激烈。

但隨著邊際效益遞減,如何讓模型在真正複雜的任務中表現出色,已成為下一階段的核心課題。智譜選擇強化學習與長程任務作為突破口,顯示其對技術本質的深入理解。唐傑最後總結,深度學習的發展從來不是單一因素的勝利。參數規模、數據質量、演算法設計、訓練策略,每一環都不可或缺。而當前階段,業界需要更清醒地認識到,萬億參數只是起點,不是終點。真正有價值的突破,來自於對模型能力邊界的系統性探索。智譜的GLM-5.3訓練方向調整,正是這一理念的具體實踐。未來,隨著更多團隊加入這條路徑,或許能催生出更高效、更智能的下一代大語言模型。

Related

相關文章

鈦媒體模型更新

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告

AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

剛剛

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷

Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。

剛剛

Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕

月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。

16 分鐘前4700
雷峰網模型更新

光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態

8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

5 小時前