以100個GRPO步驟微調350M模型,提升結構化輸出效果
一套完全公開且成本低廉的微調方法,能讓小型語言模型在結構化輸出的合規性上取得明顯進步。這套做法以 TRL 程式庫為基礎,採用群組相對策略最佳化(GRPO)對 LFM2.5-350M 模型進行微調,並在 IFStruct 基準上評估成效。整個流程僅需約 500 個樣本與 100 個訓練步驟,甚至可以在免費版的 Colab 或 Kaggle GPU 上執行完畢,相關程式碼已在 GitHub 公開。結構化輸出合規性指的是模型能否依照指定格式產生回應,例如固定的 JSON 欄位、XML 標籤、表格結構,或是工具呼叫所需的參數格式。
對許多實際應用來說,這項能力的重要性不亞於回答內容本身的正確性,因為只要格式稍有偏差,後端的解析流程就會直接失敗,後續的自動化處理也無從進行。問題在於,參數規模較小的模型往往在這方面力不從心。模型容量有限時,指令遵循的穩定性較弱,即使提示中已經寫明格式要求,輸出仍可能出現欄位缺失、括號不對稱或型別錯誤等情況。過去常見的補救方式包括反覆修改提示、在解碼階段加上約束,或是直接改用更大的模型,但這些做法各有其限制與成本。GRPO 屬於強化學習式的策略最佳化方法,其特點在於不需要額外的價值模型。它針對同一個提示產生一組候選輸出,讓這些輸出彼此比較,從中推算相對優勢,再據此更新策略。
相較於需要價值網路輔助的傳統做法,這種群組內比較的設計可以省下一個額外模型的記憶體與計算開銷,對資源有限的訓練環境特別有利。TRL 程式庫在這套流程中扮演關鍵角色。它把這類策略最佳化演算法包裝成可直接取用的訓練元件,開發者不必從零開始實作強化學習迴圈,就能把微調流程接上既有模型與資料集。對照本次案例,這正是讓整體實作得以維持在輕量規模的原因之一。此次採用的模型是 LFM2.5-350M,參數規模約 3.5 億,屬於可以在消費級硬體或免費雲端資源上操作的等級。選擇這樣的模型進行實驗,本身就說明了研究的方向:不是追求最強效能,而是驗證在極有限的資源條件下,能否把特定能力有效地補強。
評估工作則交給 IFStruct 基準。這項基準聚焦於模型在結構化輸出上的遵循程度,正好對應本次微調想解決的問題。透過單一且切題的評量指標,可以較清楚地觀察微調前後的差異,而不會讓成效被其他面向的表現所稀釋。在訓練資料方面,整個流程只使用約 500 個樣本。這個數字相對精簡,意味著不需要蒐集或標註大量資料,就能啟動一輪有意義的微調。搭配僅 100 個訓練步驟的設定,整體訓練時間也被壓縮到相當短的程度。硬體門檻同樣被壓低。這套流程可以在免費版的 Colab 或 Kaggle GPU 上執行,代表沒有自建GPU 叢集或付費雲端額度的開發者,也能實際動手複現整套實驗。
對於教學、個人專案或資源吃緊的小型團隊而言,這樣的門檻設定具有實質意義。程式碼已公開於 GitHub,讓整份方法從資料準備、訓練設定到評估流程都能被檢視與重用。開源釋出也降低了驗證成本,其他人可以在相同基礎上調整模型、資料量或訓練步數,觀察結果如何隨之變化。結果顯示,即使是輕量微調,也能把 IFStruct 基準的表現從 22 的水準明顯往上推。這個結果的意義不只是分數本身,而在於它指出了一條可行的路徑:針對特定能力進行小規模、目標明確的微調,就能帶來可觀的改善,而不必訴諸完整的大規模訓練。
換句話說,原本可能需要動用大量算力與資料才能取得的進步,如今透過約 500 個樣本與 100 個訓練步驟便有機會達成。這樣的比例關係,對於希望在有限預算內改善模型行為的開發者來說,是一個值得留意的訊號。從實務角度來看,結構化輸出合規性往往是模型能否進入正式系統的關鍵門檻。當模型能穩定產出符合規格的格式,它才適合被放進資料抽取、自動化流程、代理工具串接等場景。這次的實驗說明,小型模型在經過針對性的微調後,也有機會跨過這道門檻。同時也須留意,本次成果建立在特定基準與特定模型之上,重點在於展示方法與流程的可行性,而非宣稱所有小型模型都能獲得相同幅度的提升。
GRPO、TRL、精簡資料與短訓練步數這幾個元素的組合,構成了這套低成本方案的核心。整體而言,這項公開方法提供了一個具體範例:以相對精簡的資源,針對結構化輸出這一類明確的能力缺口進行強化。對於正在評估是否值得為小型模型投入微調的團隊來說,約 500 個樣本、100 個步驟、以及免費雲端 GPU 即可完成的流程,無疑降低了嘗試的門檻,也讓後續的複製與延伸變得更加容易。
Related
相關文章
黃仁勳:明年英偉達芯片銷量將翻倍,AI監管不該照搬社交媒體模式
NVIDIA創辦人黃仁勳預估明年該公司晶片銷售量將翻倍成長,反映市場對運算力的強勁需求。他同時認為AI監管不應直接套用社交媒體模式,以免扼殺創新,呼籲決策者深入了解技術特性。

美國電動汽車企業 Lucid 計劃在歐洲部署至少 2.5 萬輛 Robotaxi
Lucid 的合作方為歐洲共享出行平臺 Bolt。該 Robotaxi 將基於 Lucid 的即將推出的中型車平臺,採用 NVIDIA Hyperion 開發平臺和參考體系架構。

每小時“燒錢”超20萬元,羅福莉直播小米大模型訓練
小米大模型MiMo-V2.6正處於強化學習中間階段,每秒需調用數千張高階GPU運算,每小時成本高達數十萬元。業界指出強化學習階段的訓練資源消耗極為驚人,每小時「燒錢」超過20萬元已是普遍共識。

華為昇騰960超節點落地 AI算力競爭從單芯片轉向系統工程
華為正式發表昇騰960超節點運算架構,標誌AI算力競爭從單晶片轉向系統工程。該系統透過高速互聯與分布式計算最佳化,解決大規模訓練的延遲與調度問題,滿足千億參數模型需求。此舉反映華為在晶片供應受限下,以系統層級整合提升整體效率,拓展差異化競爭優勢。

英國國王查爾斯三世召開論壇,呼籲英偉達、OpenAI、谷歌等巨頭掌控好 AI 技術
查爾斯三世的預備講稿提到:“世界上珍視人性及其中不可或缺的道德價值的人們,都急切地希望得到你們的保證:我們仍能掌握自己的命運。”白金漢宮在聲明中介紹,論壇將探討如何讓這項技術“造福社會和自然界”。

臺積電 COO 米玉傑:AI 像三歲超人,在尖端芯片設計上不太實用
臺積電共同首席運營官米玉傑在臺灣大學演講時表示,AI 如同三歲版超人,能力強大卻不知破壞後果。他透露臺積電對 AI 處理研發敏感信息尤為審慎,並認為當前 AI 還無法有效助力下一代半導體技術研發。#臺積電##人工智能##AI安全#