螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型,開放訓練過程中的關鍵節點

作者:沁滄(實習) 責編:沁滄 評論: 8 月 21 日消息,螞蟻百靈在本月陸續開源了 Ling-3.0-tiny 和 Ling-3.0-flash 模型。官方昨日宣佈,將 Ling-3.0-tiny-base 與 Ling-3.0-flash-base 正式開源,除最終 Base checkpoint 外,還將同步開放兩個模型的預訓練和中期訓練的權重 checkpoint,共計 6 個 checkpoints。
預訓練 checkpoint:已完成大規模預訓練,尚未進行中期訓練、WSM 合併和後訓練;中期訓練 checkpoint:已完成中期訓練,尚未進行 WSM 合併和後訓練;WSM 合併 checkpoint:已基於中期訓練 checkpoint 完成 WSM 合併,尚未進行後訓練。注:Base 模型通常是指未經特定任務微調的基礎預訓練模型,在訓練過程中最初被開發和優化的,它旨在平衡性能和資源消耗。官方表示,這些 checkpoints 適合用於持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文和 MoE 系統研究。
需要特別說明的是,Base Model 並不是已經完成指令對齊的聊天模型。我們不建議未經後訓練便直接將其部署為面向終端用戶的聊天服務,也不建議未經額外對齊和評估便用於安全關鍵型應用。任何生產使用都應完成面向具體任務的後訓練、評估與驗證。在中期訓練結束後,官方將傳統學習率衰減改寫為 checkpoints 加權合併,即 WSM(Warmup-Stable and Merge)。由於沒有了學習率衰減,該 Base Model 更適合持續預訓練和動態擴展數據,且支持訓練後離線探索不同學習率“衰減曲線”。其中,Ling-3.0-tiny-base(總參數 7.9B,激活參數 1.
3B)以相比前代 50% 左右的總參數量,在大多數評測中取得更高結果;在與同等規模模型對比中,展現出更具競爭力的代碼能力。Ling-3.0-flash-base(總參數 124B,激活參數 5.1B)具備更充足的參數容量與稀疏激活設計,為研究者和開發團隊提供了一個可繼續訓練、拓展並適配真實場景的開放底座。在下表的評測中,模型在代碼、複雜推理和長上下文方向表現突出。相比總參數量約為其 2–3 倍的 base model,模型的整體表現仍具優勢。附開源鏈接如下:Ling-3.0-tinyHugging Face:https://huggingface.co/inclusionAI/Ling-3.
0-tiny-basehttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrainModelScope:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30Thttps://www.modelscope.
cn/models/inclusionAI/Ling-3.0-tiny-base-midtrainLing-3.0-flashHugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash-basehttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-30Thttps://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrainModelScope:https://www.modelscope.
cn/models/inclusionAI/Ling-3.0-flash-basehttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30Thttps://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain相關閱讀:《螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署》《螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.
1B 激活參數》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:螞蟻集團,百靈,開源,模型螞蟻百靈開源 Ling-3.0-tiny 模型,支持英偉達 DGX Spark、蘋果 Mac mini 部署螞蟻集團百靈開源 Ling-3.0-flash 模型:124B 總參數、5.1B 激活參數螞蟻集團發佈百靈原生混合推理模型 Ling-3.0-flash:124B 總參數量,能力對標上一代旗艦 Ring-2.
6-1T螞蟻集團百靈開源萬億級思考模型 Ring-2.6-1T,支持 high 與 xhigh 兩種推理強度螞蟻集團百靈發佈萬億級旗艦思考模型 Ring-2.6-1T:限時一週免費體驗,引入 Reasoning Effort 機制螞蟻集團百靈大模型開源 Ling-2.6-flash,提供 BF16、FP8、INT4 等版本
Related
相關文章

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷
Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。
端側AI大洗牌:vivo藍心登頂手機大模型榜首,3B小參數跑分逼近雲端巨頭
SuperCLUE發佈手機端側大模型測評,vivo藍心BlueLM3.5 Nano 3B以89.86分居綜合第一。該3B小模型得分逼近谷歌Gemini3.6 Flash、豆包Seed2.1 Pro、千問Qwen3.8 Max等雲端大模型,展現端側性能突破。
Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態
8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

諾亦騰機器人發佈 HiPHI,開源 617.5 小時高精度人體運動數據
作者:潞源 責編:潞源 評論: 8 月 23 日消息,諾亦騰機器人在 2026 世界機器人大會期間發佈 HiPHI,這是一套面向人形機器人學習、數字人,以及計算機圖形學領域研究人員和工程師的高精度光學動作捕捉數據集。據報道,該數據集總長 617.