開發者要基座模型,螞蟻真給了!6大訓練關鍵節點同步開源
作者 | 楊京麗 編輯 | 李水青 8月20日報道,今日,螞蟻百靈開源Ling-3.0-tiny-base和Ling-3.0-flash-base。除最終Base模型權重外,團隊還同步開放了兩款模型的預訓練和中期訓練權重,共計6個checkpoints。此前,Ling-3.0-flash於7月24日發佈,8月7日開源;輕量級模型Ling-3.0-tiny則於8月11日開源。距離Tiny開源僅9天,螞蟻百靈又進一步開放了兩款模型未經後訓練的Base版本。Ling-3.0-tiny-base總參數量為7.9B、激活參數量為1.
3B,適合代碼領域訓練、預算敏感的強化學習研究及模型行為研究等;Ling-3.0-flash-base總參數量為124B、激活參數量為5.1B,可用於代碼、複雜推理、長上下文及專業領域模型的繼續訓練。此次開放覆蓋預訓練、中期訓練和WSM合併三個階段,開發者可根據自身數據、任務和研究目標,選擇不同的訓練起點。WSM(Warmup-Stable and Merge)是一種面向大模型預訓練的學習率方案,它以多個checkpoints加權合併,代替傳統的學習率衰減,使模型更適合持續預訓練和動態擴展數據。由於兩款模型採用統一訓練方案,開發者可以先在Ling-3.
0-tiny-base上低成本驗證訓練策略,再將有效方法擴展至Ling-3.0-flash-base。Ling-3.0-tiny-base開源地址: Hugging Face: https://huggingface.co/inclusionAI/Ling-3.0-tiny-base https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30T https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrain ModelScope: https://www.modelscope.
cn/models/inclusionAI/Ling-3.0-tiny-base https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30T https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-midtrain Ling-3.0-flash-base開源地址: Hugging Face: https://huggingface.co/inclusionAI/Ling-3.0-flash-base https://huggingface.
co/inclusionAI/Ling-3.0-flash-base-30T https://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrain ModelScope: https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30T https://www.modelscope.
cn/models/inclusionAI/Ling-3.0-flash-base-midtrain 一、開放6個checkpoints,可自行選擇訓練起點 8月以來,Ling-3.0-flash和Ling-3.0-tiny陸續開源。此後,有開發者在Ling-3.0-tiny的Hugging Face社區中提出,希望團隊進一步開放Base模型。他認為,Tiny的模型規模和稀疏架構對預算有限的研究者很有吸引力,適合開展強化學習rollout和麵向具體場景的後訓練;相比已經完成後訓練的模型,社區更需要一個能夠繼續塑造的Base Model。
▲開發者希望開源Base模型(圖源:Hugging Face) 於是,百靈今天開源Ling-3.0-tiny-base和Ling-3.0-flash-base。此次開放的6個checkpoints覆蓋三個階段:預訓練checkpoint已完成大規模預訓練,尚未進行中期訓練、WSM合併和後訓練;中期訓練checkpoint已完成中期訓練,尚未進行WSM合併和後訓練;最終Base checkpoint則已基於中期訓練checkpoint完成WSM合併,尚未進行後訓練。
▲本次開源的6個checkpoints(圖源:百靈大模型) 這些checkpoints可用於持續預訓練、領域監督微調、偏好優化、強化學習後訓練、模型蒸餾,以及長上下文和MoE系統研究。Ling-3.0系列在中期訓練結束後,採用WSM方法,以checkpoint加權合併替代傳統的學習率衰減。由於不再設置固定的學習率衰減階段,模型更適合持續預訓練和動態擴展數據。研究者還可以在訓練結束後,離線探索不同的學習率“衰減曲線”。Ling-3.0-tiny-base與Ling-3.0-flash-base採用統一的訓練方案。開發者可以先在Ling-3.
0-tiny-base上低成本驗證訓練策略,再將有效方法擴展到規模更大的Ling-3.0-flash-base。二、Tiny主打低成本後訓練,Flash強化代碼和長上下文 Ling-3.0-tiny-base總參數量為7.9B,激活參數1.3B。其總參數量約為前代Ling-2.5-mini-base的一半,但在多數評測中取得了更高成績,代碼能力尤為突出。▲Ling-3.
0-tiny-base評測對比(圖源:百靈大模型) 該模型適合開展代碼領域的持續預訓練、監督微調和後訓練,用於預算敏感的強化學習Rollout與後訓練研究,也可以用於高校教學、模型行為研究、MoE消融實驗,還可針對具體行業和任務驗證領域適配路線。Ling-3.0-flash-base總參數量為124B,激活參數量為5.1B,具備更充足的參數容量與稀疏激活設計。模型在代碼、複雜推理和長上下文方向表現突出。與總參數量約為其2至3倍的部分Base模型相比,其整體成績仍具競爭力。▲Ling-3.
0-flash-base評測對比(圖源:百靈大模型) 該模型可以作為大型代碼庫、專業推理和長流程Agent的訓練底座,也適合金融、醫療、科研和工業等領域的持續預訓練與後訓練。不過百靈提醒,Base Model並非已經完成指令對齊的聊天模型,不建議未經後訓練便直接將其部署為面向終端用戶的聊天服務,也不建議未經額外對齊和評估便用於安全關鍵型應用。用於生產環境前,還需要完成針對具體任務的後訓練、評估和驗證。結語:從開放模型權重,到開放訓練關鍵節點 相比只開放完成後訓練的模型,此次螞蟻百靈進一步開放了預訓練、中期訓練和WSM合併三個階段的checkpoints,為開發者提供了多個可繼續訓練的起點。
Tiny和Flash模型採用統一訓練方案,也為模型訓練提供了一條從小規模驗證到大規模擴展的路徑。未來,這些基座模型能否在代碼、專業領域及強化學習研究中衍生出更多模型,將成為此次開源價值的重要檢驗,也期待後續有更多大模型廠商開放基座模型,為開發者提供更具可塑性的訓練底座。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
