模型後訓練優化面臨資源瓶頸
人工智慧模型從實驗室走向實際應用的道路並不總是順遂,近期業界與學術圈不斷浮現出一個關鍵癥結:模型後訓練優化正面臨嚴峻的資源瓶頸。不同於初始階段的大力出奇蹟,後訓練階段所需的投入不僅是算力與數據,更涉及難以量化的策略決策與判斷標準,使得許多團隊在此環節停滯不前。這場困局的根源,很大一部分來自於優化過程中獎勵機制的模糊性。在大型語言模型或多模態模型的後訓練階段,研究人員通常需要透過強化學習或人類回饋來調整模型行為。然而,當模型能力愈來愈強,其所面對的任務也愈趨複雜,許多情境下並不存在絕對正確的答案。
這導致用來引導模型改善的獎勵訊號變得主觀且具爭議——同樣一條輸出,不同評審可能給出截然不同的評價,讓後訓練演算法難以收斂到穩定的最優解。這種判定上的不確定性,直接拖慢了研究進度,也讓許多實驗成果無法複現,進而削弱了團隊長期投入的意願。與後訓練階段的舉步維艱形成對比的是,國內在預訓練能力上的積累已經相當成熟,並獲得業界廣泛讚許。過去數年,從底層架構到超大規模訓練框架,本土團隊陸續攻克了訓練穩定性、分散式通訊效率以及數據清洗等核心難題,部分成果甚至達到國際領先水準。這使得「會訓練」不再是稀缺技能,只要資源到位,複製出一個基礎效能良好的模型並非難事。
然而,真正決定模型能否在真實場景中可靠運作的,往往正是後訓練階段那些瑣碎且容易踩坑的細節。值得留意的是,多代理工具(multi-agent tooling)正在大幅改寫實驗室傳統的分工模式。過去,後訓練優化通常由單一研究組或個別工程師負責,從數據標註、獎勵設計到模型迭代,流程線性且高度依賴個人經驗。如今,越來越多團隊導入多代理系統,讓不同專長的智能體分別負責數據篩選、回饋生成與超參數調整,彼此協作完成過去需要大量人力協調的工作。這種技術變革雖然提升了效率,卻也帶來了新的挑戰,例如代理之間的溝通成本、獎勵訊號在不同代理間的傳遞失真,以及最終結果歸屬責任的模糊化,進一步加劇了後訓練優化的複雜度。
更深層的影響或許來自團隊的組織文化。創新研究,尤其是後訓練這種需要不斷試錯、耐心打磨的領域,往往由團隊內部的隱性共識與長期押注方向所決定。有些實驗室崇尚快速迭代、短期見效的風格,傾向於選擇回饋明確、成果可立即量化的研究路線;另一些團隊則願意容忍模糊與不確定性,投入資源探索那些獎勵訊號雖然模糊但潛力巨大的方向。業界觀察指出,後訓練的進展速度與最終品質,與其說是技術問題,不如說反映了一家機構對科學耐心與風險管理態度的深層取捨。當預訓練的門檻持續降低,算力成本逐漸下降,真正拉開模型之間差距的戰場已然轉移到後訓練。
然而,獎勵判定的主觀性、多代理工具帶來的協作複雜度,以及團隊文化對長期研究的支撐力,共同構成了當前最難以突破的瓶頸。過去被視為「大力就能出奇蹟」的領域,如今連「正確的方向」都難以定義——這或許才是後訓練時代最真實的殘酷。在這樣的背景下,一些先鋒團隊開始嘗試對獎勵建模本身進行元學習,讓系統自動從歷史評價模式中歸納更一致的判斷標準;另一些實驗室則回頭檢視數據來源的多樣性與標註者的背景差異,試圖從源頭減少雜訊。這些嘗試雖然尚在早期階段,卻已經為沉悶的困局帶來一絲希望。真正重要的,或許不只是找到演算法上的突破,更是建立起能夠容忍模糊、鼓勵靜心打磨的組織環境。
因為當技術的邊際效益遞減之後,最終決勝的關鍵,將會回歸到人與團隊的長期判斷力。
Related
相關文章

阿里達摩院推出肝癌AI模型,精準識別1釐米微小腫瘤
8月24日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷AI模型DAMO LiON 8月24日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷AI模型DAMO LiON,可通過CT影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該AI模型發現了15例原本被遺漏的惡性腫瘤,絕大部分為1釐米左右的病灶,幫助患者得到及時的手術或藥物治療。

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。