螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點

作者:沁滄(實習) 責編:沁滄 評論: 8 月 21 日消息,螞蟻百靈在本月陸續開源了 Ling-3.0-tiny 和 Ling-3.0-flash 模型。官方昨日宣佈,將 Ling-3.0-tiny-base 與 Ling-3.0-flash-base 正式開源,除最終 Base checkpoint 外,還將同步開放兩個模型的預訓練和中期訓練的權重 checkpoint,共計 6 個 checkpoints。
預訓練 checkpoint:已完成大規模預訓練,尚未進行中期訓練、WSM 合併和後訓練;中期訓練 checkpoint:已完成中期訓練,尚未進行 WSM 合併和後訓練;WSM 合併 checkpoint:已基於中期訓練 checkpoint 完成 WSM 合併,尚未進行後訓練。注:Base 模型通常是指未經特定任務微調的基礎預訓練模型,在訓練過程中最初被開發和優化的,它旨在平衡性能和資源消耗。官方表示,這些 checkpoints 適合用於持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文和 MoE 系統研究。
需要特別說明的是,Base Model 並不是已經完成指令對齊的聊天模型。我們不建議未經後訓練便直接將其部署為面向終端用戶的聊天服務,也不建議未經額外對齊和評估便用於安全關鍵型應用。任何生產使用都應完成面向具體任務的後訓練、評估與驗證。在中期訓練結束後,官方將傳統學習率衰減改寫為 checkpoints 加權合併,即 WSM(Warmup-Stable and Merge)。由於沒有了學習率衰減,該 Base Model 更適合持續預訓練和動態擴展數據,且支持訓練後離線探索不同學習率“衰減曲線”。其中,Ling-3.0-tiny-base(總參數 7.9B,激活參數 1.
3B)以相比前代 50% 左右的總參數量,在大多數評測中取得更高結果;在與同等規模模型對比中,展現出更具競爭力的代碼能力。Ling-3.0-flash-base(總參數 124B,激活參數 5.1B)具備更充足的參數容量與稀疏激活設計,為研究者和開發團隊提供了一個可繼續訓練、拓展並適配真實場景的開放底座。在下表的評測中,模型在代碼、複雜推理和長上下文方向表現突出。相比總參數量約為其 2–3 倍的 base model,模型的整體表現仍具優勢。附開源鏈接如下:Ling-3.0-tinyHugging Face:https://huggingface.co/inclusionAI/Ling-3.
0-tiny-basehttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrainModelScope:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30Thttps://www.modelscope.
cn/models/inclusionAI/Ling-3.0-tiny-base-midtrainLing-3.0-flashHugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash-basehttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrainModelScope:https://www.modelscope.
cn/models/inclusionAI/Ling-3.0-flash-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30Thttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain相關閱讀:《螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署》《螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.
1B 激活參數》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:螞蟻集團,百靈,開源,模型螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.1B 激活參數螞蟻集團發佈百靈原生混合推理模型 Ling-3.0-flash:124B 總參數量,能力對標上一代旗艦 Ring-2.
6-1T螞蟻集團百靈開源萬億級思考模型 Ring-2.6-1T,支持 high 與 xhigh 兩種推理強度螞蟻集團百靈發佈萬億級旗艦思考模型 Ring-2.6-1T:限時一週免費體驗,引入 Reasoning Effort 機制螞蟻集團百靈大模型開源 Ling-2.6-flash,提供 BF16、FP8、INT4 等版本
Related
相關文章

仇太深,奧特曼炮轟A社“反人類”
量子位·2026年08月24日 16:01“Codex名字沒起好,我也沒用明白” 《奧特曼天降正義,小嘴抹毒暗諷A社“反人類”》!!這個標題有沒有港媒內味兒了(doge),您先別笑,這還真是奧特曼在最新採訪裡的大致意思。雖然沒有點名,但話裡話外就差直接報Dario Amodei的身份證號了。

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十
本週AI大模型Arena排行榜出現新面孔,智譜AI的glm-5.3-max首次入榜即拿下綜合榜第13名。月之暗面的kimi-k3-max排名持續攀升,成功擠進綜合榜前十,位列第10名。兩款國產大模型雙雙寫下佳績,成為本週關注焦點。

DeepSeek Harness來了:AI開始製造AI了?
DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。