螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點

2026年8月20日 06:54
螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點
站內 AI 整理稿

作者:沁滄(實習) 責編:沁滄 評論: 8 月 21 日消息,螞蟻百靈在本月陸續開源了 Ling-3.0-tiny 和 Ling-3.0-flash 模型。官方昨日宣佈,將 Ling-3.0-tiny-base 與 Ling-3.0-flash-base 正式開源,除最終 Base checkpoint 外,還將同步開放兩個模型的預訓練和中期訓練的權重 checkpoint,共計 6 個 checkpoints。

預訓練 checkpoint:已完成大規模預訓練,尚未進行中期訓練、WSM 合併和後訓練;中期訓練 checkpoint:已完成中期訓練,尚未進行 WSM 合併和後訓練;WSM 合併 checkpoint:已基於中期訓練 checkpoint 完成 WSM 合併,尚未進行後訓練。注:Base 模型通常是指未經特定任務微調的基礎預訓練模型,在訓練過程中最初被開發和優化的,它旨在平衡性能和資源消耗。官方表示,這些 checkpoints 適合用於持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文和 MoE 系統研究。

需要特別說明的是,Base Model 並不是已經完成指令對齊的聊天模型。我們不建議未經後訓練便直接將其部署為面向終端用戶的聊天服務,也不建議未經額外對齊和評估便用於安全關鍵型應用。任何生產使用都應完成面向具體任務的後訓練、評估與驗證。在中期訓練結束後,官方將傳統學習率衰減改寫為 checkpoints 加權合併,即 WSM(Warmup-Stable and Merge)。由於沒有了學習率衰減,該 Base Model 更適合持續預訓練和動態擴展數據,且支持訓練後離線探索不同學習率“衰減曲線”。其中,Ling-3.0-tiny-base(總參數 7.9B,激活參數 1.

3B)以相比前代 50% 左右的總參數量,在大多數評測中取得更高結果;在與同等規模模型對比中,展現出更具競爭力的代碼能力。Ling-3.0-flash-base(總參數 124B,激活參數 5.1B)具備更充足的參數容量與稀疏激活設計,為研究者和開發團隊提供了一個可繼續訓練、拓展並適配真實場景的開放底座。在下表的評測中,模型在代碼、複雜推理和長上下文方向表現突出。相比總參數量約為其 2–3 倍的 base model,模型的整體表現仍具優勢。附開源鏈接如下:Ling-3.0-tinyHugging Face:https://huggingface.co/inclusionAI/Ling-3.

0-tiny-basehttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrainModelScope:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30Thttps://www.modelscope.

cn/models/inclusionAI/Ling-3.0-tiny-base-midtrainLing-3.0-flashHugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash-basehttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrainModelScope:https://www.modelscope.

cn/models/inclusionAI/Ling-3.0-flash-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30Thttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain相關閱讀:《螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署》《螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.

1B 激活參數》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:螞蟻集團,百靈,開源,模型螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.1B 激活參數螞蟻集團發佈百靈原生混合推理模型 Ling-3.0-flash:124B 總參數量,能力對標上一代旗艦 Ring-2.

6-1T螞蟻集團百靈開源萬億級思考模型 Ring-2.6-1T,支持 high 與 xhigh 兩種推理強度螞蟻集團百靈發佈萬億級旗艦思考模型 Ring-2.6-1T:限時一週免費體驗,引入 Reasoning Effort 機制螞蟻集團百靈大模型開源 Ling-2.6-flash,提供 BF16、FP8、INT4 等版本

Related

相關文章

仇太深,奧特曼炮轟A社“反人類”

量子位·2026年08月24日 16:01“Codex名字沒起好,我也沒用明白” 《奧特曼天降正義,小嘴抹毒暗諷A社“反人類”》!!這個標題有沒有港媒內味兒了(doge),您先別笑,這還真是奧特曼在最新採訪裡的大致意思。雖然沒有點名,但話裡話外就差直接報Dario Amodei的身份證號了。

剛剛
IT之家模型更新

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”

作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

剛剛
鈦媒體模型更新

DeepSeek Harness來了:AI開始製造AI了?

DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。

剛剛
鈦媒體模型更新

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告

AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

49 分鐘前