7名博士生僅用3個月從零訓練7B大模型:代碼+數據+訓練日誌全公開

7名博士生3個月從零訓練7B大模型:代碼、數據、訓練日誌全公開,把「黑盒手藝」變成「工程日誌」 在人工智慧領域,訓練一個大語言模型長期以來被視為一項高門檻、高成本且充滿不確定性的「黑盒」工程。然而,一個由7名博士生組成的團隊,近日以實際行動打破了這道壁壘。他們僅用3個月時間,從零開始訓練出一個擁有70億參數的大模型「ZGCM-1」,並將整個過程的「配方」全數公開——包括各階段訓練數據、模型權重、訓練代碼、中間checkpoint以及詳盡的訓練日誌。這意味著任何研究者,無論資源多寡,都能沿著他們的足跡,一步步復現從數據清洗到模型收斂的完整流程,而非只看到一個最終結果。
這項工作由率先報導,消息一出,迅速在技術社群引發熱議。在過往,訓練一個7B規模的模型通常需要數百張高階GPU,以及數月的調試時間。但這7位博士生卻以相對有限的資源,完成了這項看似不可能的任務。他們不僅成功訓練出模型,更難能可貴的是,他們將整個過程的「配方」毫無保留地公開,這在商業機密與學術共享的界線日益模糊的今天,顯得格外珍貴。團隊表示,他們最初的動機很單純:希望打破大模型訓練的「黑盒」狀態。過去,許多研究團隊在訓練模型時,往往只公佈最終的模型權重和評測結果,而對於數據如何清洗、學習率如何調度、遇到損失曲線異常時如何處理等關鍵細節,卻鮮少著墨。
這導致許多資源有限的團隊,在嘗試從零訓練模型時,往往會重蹈覆轍,陷入同樣的困境。ZG團隊決定改變這一切,他們將整個過程視為一份「工程日誌」,而非僅是一個「研究成果」。在數據處理方面,ZG團隊的「配方」尤為關鍵。他們公開了各階段的數據配比,包括通用文本、程式碼、數學推理、多語種資料等。團隊強調,數據的品質遠比數量重要。他們在清洗過程中,採用了多層次的過濾機制,包括去重、去除低品質文本、過濾敏感內容,並透過「困惑度」等指標來篩選高品質的語料。這份詳細的數據處理流程,正是許多團隊在訓練時最常忽略卻又最為關鍵的環節,ZG團隊的公開,無疑為後續研究者提供了一份寶貴的「避坑指南」。
在訓練策略上,ZG團隊也展現了高度的專業性。他們詳細記錄了學習率調度、批次大小、訓練步數等超參數的選擇過程,以及如何應對訓練過程中出現的損失值震盪、梯度爆炸等常見問題。團隊特別強調,他們並非單純堆疊算力,而是透過精準的數據配比與策略調整,讓模型在有限的資源下達到最佳性能。這種「巧幹」而非「蠻幹」的思路,正是這份公開資料最核心的價值所在。在公開的評測結果中,ZGCM-1在多項通用任務上,與目前開源社群中表現優異的Qwen3-8B等同等規模模型表現相近。這意味著,ZG團隊的訓練配方,在數據配比和訓練策略上確實有可取之處,而非單純依靠運氣或算力堆疊。
更令人驚豔的是,在部分數學推理和搜索類任務上,ZGCM-1甚至能與參數量遠超自己的Qwen3-235B-A22B、GLM-5.1等模型一較高下。這項結果,證明了在特定任務上,透過精心設計的數據配比,小模型也能爆發出令人驚豔的潛力。這項工作的意義,遠不止於一個模型的誕生。它將「從零訓練大模型」從一門依賴經驗與直覺的「黑盒手藝」,變成了一份可查閱、可復現的「工程日誌」。對於資源有限的研究團隊或個人開發者而言,這份公開資料提供了一個極具參考價值的起點。他們不必再從頭摸索數據清洗、學習率調度、損失曲線異常處理等常見坑,而是可以直接站在這7位博士生的肩膀上,去嘗試自己的改進與創新。
這份「配方」的公開,也對整個AI產業生態產生了深遠的影響。它降低了進入大模型領域的技術門檻,讓更多學術機構、新創公司,甚至個人開發者,都有機會參與到基礎模型的研發中。這將有助於打破少數巨頭對大模型技術的壟斷,促進技術的多元化與民主化。未來,我們或許能看到更多基於ZGCM-1的衍生模型,或是受到其啟發而誕生的新訓練方法。當然,這份公開資料並非「完美答案」。ZG團隊也坦言,他們在訓練過程中也遇到了許多挑戰,例如如何平衡不同任務之間的數據比例,以及如何避免模型在特定任務上的過度擬合等。但他們選擇將這些挑戰與解決過程一併公開,這正是這份「工程日誌」最真實、最有價值的地方。
它告訴我們,大模型訓練並非一條筆直的道路,而是一個充滿試錯與調整的過程。從更宏觀的角度來看,ZG團隊的行動,是開放科學精神在AI領域的一次生動實踐。他們用行動證明了,即使沒有頂級的算力資源,只要擁有清晰的思路、嚴謹的態度與開放的胸襟,也能在AI領域做出令人矚目的貢獻。這份公開的「配方」,不僅是技術的傳遞,更是一種精神的鼓舞,激勵著更多研究者勇敢地踏入大模型訓練的領域。展望未來,ZG團隊表示,他們將持續優化ZGCM-1,並計畫在後續版本中,加入更多多模態數據與更先進的訓練策略。他們也希望,這份公開的資料能成為一個「催化劑」,催生出更多開源社群的力量,共同推動大模型技術的進步與普及。
對於整個AI社群而言,這份「工程日誌」的價值,將遠超一個模型本身,它代表著一種開放、協作、共創的未來方向。總而言之,這7名博士生用3個月的時間,不僅訓練出了一個性能優異的7B大模型,更為整個AI社群留下了一份寶貴的「知識遺產」。他們用實際行動證明,大模型訓練的「黑盒」並非不可打破,而打破它的鑰匙,正是開放、分享與協作。這份公開的「配方」,將成為未來無數研究者探索大模型世界時,最堅實的起點。
Related
相關文章

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同
作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

MiniMax Code CLI 正式開源,在評測中取得 76.7% 的任務通過率
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 Domado 的線索投遞!9 月 18 日消息,MiniMax 今晚宣佈,MiniMax Code CLI 的 v0.4.12 版本面向全球開發者正式開放,並且以 MIT 協議正式開放源代碼。

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關
作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。
PrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance
PrismML has released Ternary Bonsai 2 27B, a ternary-weight version of Qwen3.8 27B. The language model occupies 5.93 GB, against 53.80 GB in FP16. PrismML reports that it keeps 98.2% of the parent model’s average across 20 benchmarks.

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型
鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率
此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。