螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點

2026年8月20日 06:54
螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點
站內 AI 整理稿

作者:沁滄(實習) 責編:沁滄 評論: 8 月 21 日消息,螞蟻百靈在本月陸續開源了 Ling-3.0-tiny 和 Ling-3.0-flash 模型。官方昨日宣佈,將 Ling-3.0-tiny-base 與 Ling-3.0-flash-base 正式開源,除最終 Base checkpoint 外,還將同步開放兩個模型的預訓練和中期訓練的權重 checkpoint,共計 6 個 checkpoints。

預訓練 checkpoint:已完成大規模預訓練,尚未進行中期訓練、WSM 合併和後訓練;中期訓練 checkpoint:已完成中期訓練,尚未進行 WSM 合併和後訓練;WSM 合併 checkpoint:已基於中期訓練 checkpoint 完成 WSM 合併,尚未進行後訓練。注:Base 模型通常是指未經特定任務微調的基礎預訓練模型,在訓練過程中最初被開發和優化的,它旨在平衡性能和資源消耗。官方表示,這些 checkpoints 適合用於持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文和 MoE 系統研究。

需要特別說明的是,Base Model 並不是已經完成指令對齊的聊天模型。我們不建議未經後訓練便直接將其部署為面向終端用戶的聊天服務,也不建議未經額外對齊和評估便用於安全關鍵型應用。任何生產使用都應完成面向具體任務的後訓練、評估與驗證。在中期訓練結束後,官方將傳統學習率衰減改寫為 checkpoints 加權合併,即 WSM(Warmup-Stable and Merge)。由於沒有了學習率衰減,該 Base Model 更適合持續預訓練和動態擴展數據,且支持訓練後離線探索不同學習率“衰減曲線”。其中,Ling-3.0-tiny-base(總參數 7.9B,激活參數 1.

3B)以相比前代 50% 左右的總參數量,在大多數評測中取得更高結果;在與同等規模模型對比中,展現出更具競爭力的代碼能力。Ling-3.0-flash-base(總參數 124B,激活參數 5.1B)具備更充足的參數容量與稀疏激活設計,為研究者和開發團隊提供了一個可繼續訓練、拓展並適配真實場景的開放底座。在下表的評測中,模型在代碼、複雜推理和長上下文方向表現突出。相比總參數量約為其 2–3 倍的 base model,模型的整體表現仍具優勢。附開源鏈接如下:Ling-3.0-tinyHugging Face:https://huggingface.co/inclusionAI/Ling-3.

0-tiny-basehttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrainModelScope:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30Thttps://www.modelscope.

cn/models/inclusionAI/Ling-3.0-tiny-base-midtrainLing-3.0-flashHugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash-basehttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrainModelScope:https://www.modelscope.

cn/models/inclusionAI/Ling-3.0-flash-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30Thttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain相關閱讀:《螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署》《螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.

1B 激活參數》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:螞蟻集團,百靈,開源,模型螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.1B 激活參數螞蟻集團發佈百靈原生混合推理模型 Ling-3.0-flash:124B 總參數量,能力對標上一代旗艦 Ring-2.

6-1T螞蟻集團百靈開源萬億級思考模型 Ring-2.6-1T,支持 high 與 xhigh 兩種推理強度螞蟻集團百靈發佈萬億級旗艦思考模型 Ring-2.6-1T:限時一週免費體驗,引入 Reasoning Effort 機制螞蟻集團百靈大模型開源 Ling-2.6-flash,提供 BF16、FP8、INT4 等版本

Related

相關文章

鈦媒體模型更新

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告

AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

剛剛

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷

Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。

剛剛

Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕

月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。

19 分鐘前4700
雷峰網模型更新

光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態

8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

5 小時前