何夕2077模型更新

DeepSeek創始人剖析大模型前景

2026年7月24日 00:00

重點摘要

DeepSeek創始人剖析大模型前景。 繼前沿模型遇到天花板後,領頭人重新規劃。創始人規劃了全新的���AGI路線框架。可去大模型路線熱點討論社區探究其想法。梁文鋒指明大模型的未來在於持續學習。堅定的長遠規劃 \( ̄▽ ̄)/ 引起行業讚歎。

站內 AI 整理稿

【專題報導】DeepSeek創始人梁文鋒剖析大模型前景:已觸技術天花板,持續學習是通往AGI關鍵

近日,國內AI獨角獸DeepSeek創始人梁文鋒針對大模型發展發表了一系列前沿觀點,引發業界高度關注。他在一場內部技術研討會上直言,當前主流的前沿大模型已逐漸觸及技術天花板,單純依靠擴大參數規模與訓練數據的「暴力美學」難以持續,行業必須重新審視並規劃新的發展方向。梁文鋒同時提出一套自成一體的AGI(通用人工智能)路線框架,主張未來大模型的核心競爭力應體現在真正的持續學習能力上,而非僅是堆疊算力與參數。梁文鋒的發言迅速在AI社群擴散,不少從業者湧入大模型路線討論社區,試圖深入解讀他所描述的具體構想。

自ChatGPT引爆生成式AI浪潮以來,全球學術界與產業界長期聚焦於模型規模擴張,但訓練成本飆升、數據資源枯竭、預訓練收益遞減等現實瓶頸日益凸顯。梁文鋒的論斷正好切中了當前行業的集體焦慮,為困在「算力軍備競賽」中的開發者們提供了一條全新的突圍思路。在梁文鋒的論述中,大模型的進化不應止步於靜態的預訓練階段,而必須引入動態的知識更新與自我迭代機制。他形容當前主流模型像是一本印好的百科全書,雖然內容豐富卻無法即時修訂;而未來的AGI模型應更像一個能持續學習的個體,在與環境互動中不斷修正與補充知識,從而真正逼近通用智能的目標。

這套框架強調「動態」代替「靜態」,要求從模型架構、訓練模式到部署流程進行系統性重構。具體而言,梁文鋒提出的AGI路線框架中,最核心的支柱是「持續學習能力」。他認為,人類智能之所以靈活,在於能夠終身積累並遷移知識,而當前的深度學習模型在面對新任務時往往需要重新訓練或微調,極大限制了通用性。為此,DeepSeek已在內部進行前瞻布局,嘗試設計能夠在有限資源下實現增量更新的神經網絡結構,並探索記憶重放、動態擴展網絡等技術路線,以使模型在部署後仍能自主進化。梁文鋒特別強調,業界應摒棄急功近利的短期策略,轉而投入長期的系統性規劃。

他批評部分企業過度追求榜單分數與融資故事,忽視底層基礎研究,導致大量資源浪費在沒有長遠價值的「刷榜」競爭中。在他看來,AGI是一場馬拉松而非百米衝刺,真正的突破需要紮實的理論積累與耐得住寂寞的工程深耕,這種立足基礎的務實態度在浮躁的AI圈顯得尤為可貴。梁文鋒的觀點贏得行業普遍讚嘆。多位受訪的研究人員表示,他的判斷與自己長年觀察的感受高度一致——當算力與數據的紅利逐漸消退,大模型的邊際收益正在快速衰減,如果仍然固守原有範式,行業很可能陷入內捲僵局。而持續學習所強調的「在線適應」與「知識自演化」,恰恰可能為解鎖下一階段的大模型能力提供關鍵鑰匙,也為從弱人工智能邁向通用智能指出一條可探索的路徑。

事實上,持續學習在機器學習領域並非全新概念,但一直因災難性遺忘、計算開銷過大等技術障礙難以落地。梁文鋒的框架並非簡單複述學術定義,而是結合大模型場景提出了具體的工程化解決思路。他主張從模型架構層面設計「成長型」網絡,使參數能夠動態分配與壓縮,同時利用對抗性遺忘機制保持已學知識的穩定,這些設想若得以實現,將徹底改變當前大模型「訓練即終身」的固化模式。隨著討論深入,越來越多業界人士開始反思:過去兩年行業是否過度沉迷於參數量的軍備競賽,而忽略了模型能力的可持續進化?梁文鋒的出現恰似一記清醒鐘,提醒人們AGI的本質並非靜態的「巨型知識庫」,而是具備自主學習、適應與創造的動態智能體。

不少開發者社群已經自發組織論文研讀與開源項目,嘗試驗證持續學習在大規模語言模型上的可行性,一場由DeepSeek創始人點燃的技術路線之爭正在醞釀發酵。在算力供應日趨緊張、高質量訓練數據幾近枯竭的當下,梁文鋒所提倡的持續學習路線無疑具有現實必要性。如果能夠讓大模型在部署後數據積累中自主迭代,不僅能大幅降低重訓成本,更能讓模型快速適應環境變化,實現真正的「常學常新」。這種思路與當前備受關注的「邊緣智能」、「隱私保護學習」等趨勢不謀而合,為AI落地的可持續性提供了新的想像空間。當然,從理論構想到工業化落地仍面臨諸多挑戰。如何在不遺忘舊知識的前提下高效吸收新信息?如何設計衡量模型成長進度的評估體系?

動態模型的部署與監控又該如何標準化?這些都是梁文鋒框架需要回應的難題。但正如他所言,正因為有困難,才需要業界攜手長期探索,而不是繞道走捷徑。他的演講結尾特別提到,AGI的門檻不會因為算力堆疊而自然跨過,真正的突破或許就藏在這些被當前主流忽略的「非共識」方向裡。行業觀察家指出,梁文鋒此次公開表態,不僅為DeepSeek本身貼上了「技術理想主義」的標籤,更可能影響中國AI創業圈的資源流向。如果持續學習被證明是大模型進化的可行路徑,那麼現在聚焦於參數效率、增量學習、動態架構的初創團隊將迎來價值重估。

而對於整個AI產業而言,從「堆參數」到「學如何學」的思路轉變,或許預示著一場更深層次的範式革命即將展開。在算力與數據的雙重天花板下,梁文鋒的聲音為迷霧中的AI探索者提供了寶貴的方向感。他所勾勒的持續學習藍圖雖然仍需時間驗證,但至少讓人們看到:大模型的未來不必是「更大、更貴、更封閉」的單行道,也可以是一條「更靈活、更節約、更自主」的進化之路。正如梁文鋒所言,當舊紅利耗盡之際,恰恰是回歸根本、重新定義遊戲規則的最佳時機。而通往AGI的真正鑰匙,可能正是那把名為「持續學習」的永動機。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

2 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

3 小時前