量子位模型更新

螞蟻百靈發佈新一代原生混合推理模型Ling-3.0-Flash

2026年7月27日 10:01
螞蟻百靈發佈新一代原生混合推理模型Ling-3.0-Flash

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 螞蟻百靈發佈新一代原生混合推理模型Ling-3.

站內 AI 整理稿

# 螞蟻百靈發佈新一代原生混合推理模型Ling-3.0-Flash,124B參數僅激活5.1B實現“小體量高智能”

2026年7月24日,螞蟻百靈正式發佈新一代原生混合推理模型Ling-3.0-Flash。該模型以總參數量124B、單次計算僅激活5.1B的超高效率設計,在基礎推理、指令遵循及長文本處理等核心指標上,對標甚至超越參數規模達其2至3倍的行業領先模型,展現出極高的“智效比”與落地性價比。據瞭解,該模型已上線OpenRouter平臺,限時免費一週,後續將正式開源,為AI Agent的規模化應用提供全新選擇。 ## 參數精簡性能反超,重新定義智效標杆

Ling-3.0-Flash最顯著的特點在於“小體量、高智能”。相比當前主流大模型動輒數百B甚至上千B的參數規模,該模型僅需激活5.1B參數即可完成推理,大幅降低了算力開銷與部署成本。然而,在標準測試與實際場景中,其在複雜推理、多輪指令跟隨以及超長文檔理解等維度的表現,均與規模遠高於自身的模型處於同一梯隊甚至實現局部超越。這種“以少勝多”的能力,得益於螞蟻百靈從底層計算架構出發的徹底重構,而非單純依賴參數堆砌。 ## 深度聚焦Agent場景,打造自主閉環交付能力

針對當前大模型落地中最受關注的Agent應用場景,Ling-3.0-Flash進行了重點打磨。模型在訓練階段擴展了超過10000個真實交互環境,並針對複雜任務的自我糾錯與長程規劃機制進行了專項優化。無論是在代碼編寫、多步驟任務拆解,還是需要跨來源整合信息的深度調研場景中,該模型均能展現出更強的自主閉環交付能力,有效解決了傳統模型在長程任務中容易“跑偏”或中途斷檔的頑疾,為智能體從“能對話”到“能辦事”的跨越提供了關鍵技術支撐。 ## 混合注意力架構:5:1交替堆疊KDA與MLA層

實現高智能與高效率平衡的核心,在於Ling-3.0-Flash底層採用的全新混合注意力架構。該模型從預訓練階段即放棄了單一注意力機制的設計思路,轉而以5:1的比例交替堆疊KDA(Kimi Delta Attention)線性注意力層與MLA層。這種設計使得模型在處理長上下文時,能夠在線性複雜度的效率優勢與Transformer級別的表達能力之間取得更優平衡,從根本上緩解了長序列推理中的計算瓶頸與記憶衰減問題。 ## KDA技術升級:引入細粒度對角門控強化關鍵記憶

作為注意力機制的重要創新,Ling-3.0-Flash將上一代的Lightning Attention升級為KDA。在Delta Rule的狀態更新中,新架構引入了細粒度對角門控,使模型能夠在處理長文檔與大型代碼庫時,以更高精度區分並記住關鍵信息,同時抑制無關噪聲。這一改進對於需要長期依賴與精確檢索的任務效果尤為顯著,也為模型在複雜Agent場景中的穩定表現奠定了堅實基礎。 ## 專家激活比例進一步壓縮,效率槓桿再放大

Ling-3.0-Flash還進一步壓縮了單次計算的專家激活比例。每個Token的專家激活比例由前代的1/32降低至僅1/64,這意味著模型在保持極高稀疏性的同時,仍然能夠調用足夠的參數容量處理複雜任務。更低的激活比例帶來了更高的“效率槓桿”——在同等算力投入下,模型可以支持更高併發、更長上下文或更快的響應速度,從而顯著提升整體系統的經濟性。 ## 分級緩存+協同架構,工程支撐Agent高效運行

為了讓AI Agent在實際部署中運行更快、更穩,螞蟻百靈為Ling-3.0-Flash匹配了全套工程與協作架構。在響應速度方面,通過引入集群級分級緩存,模型在長對話與多輪交互中有效避免了重複計算,長輸入下的首字響應延遲降低了60%至80%以上。這一提升對用戶體驗至關重要,尤其在高頻線上服務場景中,直接關係到Agent的可用性與商業回報。 ## 多智能體協作校驗,降低單點誤判風險

在任務穩定性方面,升級後的多智能體協同架構允許不同Agent分工協作、相互校驗。單一模型在面對複雜邊界情況時難免存在誤判,而通過多智能體之間的交叉驗證與任務仲裁,整體系統的魯棒性得到顯著增強。該架構為AI Agent在高風險、高要求的真實業務場景中落地提供了可靠保障,也為螞蟻百靈後續打造更強大的多智能體系統積累了關鍵技術經驗。 ## 限時免費一週後開源,推動行業普惠

據悉,Ling-3.0-Flash目前已在OpenRouter平臺上線,並提供為期一週的免費體驗。一週後,模型將正式開源。這一舉措不僅降低了開發者和企業的試用門檻,也有望借助開源社區的力量進一步驗證和優化模型能力,推動“高智效比”模型在更多行業場景中的廣泛應用。螞蟻百靈表示,未來將持續圍繞原生混合推理架構進行迭代,探索更極致的效率與智能邊界,為AI Agent生態提供更具競爭力的基礎設施。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前