IT之家AI硬體

Day-0 支持:摩爾線程完成美團 LongCat-2.0 極速適配

2026年7月6日 13:27
Day-0 支持:摩爾線程完成美團 LongCat-2.0 極速適配

重點摘要

首頁 > 智能時代>人工智能 Day-0 支持:摩爾線程完成美團 LongCat-2.0 極速適配 2026/7/6 13:27:19 來源:IT之家 作者:歸瀧 責編:歸瀧 評論: IT之家 7 月 6 日消息,今天,美團將萬億參數大模型 LongCat-2.0 正式開源。摩爾線程隨後宣佈,基於 AI 訓推一體全功能 GPU 智算卡 MTT S5000 及 MUSA 軟件棧,已完成對該模型的快速適配。▲ LongCat-2.

站內 AI 整理稿

美團於近日正式推出新一代萬億參數大模型 LongCat-2.0,專為 Agentic Coding 場景設計,並原生支援長達 1M 的超長上下文處理能力。這款模型採用先進的 MoE(混合專家)架構,總參數量達到萬億等級,但平均僅激活約 48B 參數,動態激活範圍則落在 33B 至 56B 之間,在兼顧模型規模與推理效率之間取得平衡。LongCat-2.0 的發布,代表美團在大型語言模型技術上邁出重要一步,特別是在程式碼生成與自動化程式設計領域的應用。

幾乎在同一時間點,摩爾線程即宣布已基於自主研發的 AI 訓推一體全功能 GPU 智算卡 MTT S5000,以及完整的 MUSA 軟體棧,完成了對 LongCat-2.0 的快速適配。這項適配工作涵蓋了模型加載、推理引擎初始化、關鍵運算子的深度優化、部署驗證以及精度校驗等全鏈路環節,確保 LongCat-2.0 能夠在 MTT S5000 上實現穩定且高效的推理運行。這種 Day-0 級別的支援,展現了摩爾線程在國產 GPU 生態與大型模型協同方面的技術實力。LongCat-2.0 模型的技術亮點不止於萬億參數規模。

據了解,該模型內部整合了自研的稀疏注意力機制(LSA),能夠有效降低長序列處理時的計算複雜度;同時採用 ScMoE 跨層快捷連接架構,讓不同層級的專家模型之間能夠更靈活地共享資訊,進一步提升多任務協同效率。此外,零計算專家動態激活機制則讓系統能夠根據實際任務需求,即時決定哪些專家模組應被激活或閒置,從而將硬體資源的利用效率推向新高度。在實際部署層面,摩爾線程技術團隊主要依託 SGLang-MUSA 推理引擎來完成這項適配。SGLang 是一個專注於大型語言模型高效推理的框架,摩爾線程將其移植至 MUSA 軟體生態,並針對 LongCat-2.0 的架構特點進行針對性調校。

這意味著開發者可以利用 MTT S5000 的硬體算力,搭配 MUSA 軟體棧的完整工具鏈,無需繁複的移植工作即可直接運行 LongCat-2.0 模型,大幅降低模型落地的時間成本。值得注意的是,摩爾線程的 MTT S5000 智算卡定位為 AI 訓推一體全功能 GPU,不只支援訓練工作,也擅長推理任務。此次快速適配 LongCat-2.0,進一步驗證了該產品在處理超大規模 MoE 模型時的實用性。對於美團這類需要將大模型快速整合進實際業務系統的企業來說,能夠在模型發布當天就獲得硬體層面的支援,無疑是加速應用落地的關鍵優勢。

從產業角度來看,大型語言模型的迭代速度越來越快,參數規模從百億級推向萬億級,架構也從 dense 模型轉向 MoE 等稀疏化設計。這對底層硬體的運算能力、記憶體頻寬以及軟體生態的適配效率都提出了極高要求。摩爾線程此次能夠在極短時間內完成從模型發布到硬體適配的閉環,反映出其軟體團隊對於 SGLang、MUSA 以及常見大模型架構的熟悉程度。美團 LongCat-2.0 所主打的 Agentic Coding 場景,強調模型能夠像一個智能代理一樣,自主理解程式碼需求、生成解決方案並進行迭代修正。這類應用對推理延遲與吞吐量有嚴苛要求,尤其是在處理超長上下文時,傳統的注意力機制往往會讓計算量急劇攀升。

LongCat-2.0 透過 LSA 與動態專家激活等技術,試圖在保持高品質輸出的同時控制運算成本,而摩爾線程的適配則讓這套方案能夠在國產 GPU 平台上順利運轉。對於國產計算生態而言,Day-0 支援的意義不僅是技術能力的展示,更代表著上下游生態的成熟度。過去,國產硬體往往需要等待數月甚至半年以上才能適配最新的 AI 模型,如今摩爾線程能夠在美團發布模型的同一天就宣布完成適配,顯示出其軟體棧的通用性與敏捷性正在快速提升。這也讓更多開發者與企業對於採用國產 GPU 進行 AI 推理產生信心。展望未來,隨著 LongCat-2.

0 的進一步迭代以及美團在 Agentic Coding 領域的持續深耕,類似的模型適配需求只會更多。摩爾線程若能持續維持 Day-0 級別的反應速度,並不斷最佳化 MTT S5000 在 MoE 模型上的運算表現,就有機會在日益激烈的 AI 晶片市場中站穩腳跟。而美團方面,透過與國產硬體廠商的緊密合作,也能降低對單一供應鏈的依賴,為大規模部署提供更多選擇。總體而言,摩爾線程與美團此次的合作,從技術層面看是一次成功的模型與硬體快速整合,從產業層面看則是國產 AI 生態日益成熟的縮影。

未來,類似的 Day-0 支援模式很可能會成為行業標配,而雙方在超大規模 MoE 模型上的實踐經驗,也為其他企業提供了值得參考的案例。

Related

相關文章

AIBaseAI硬體

OpenAI 首款硬件真容浮現:冰球大小無屏設計,售價 300 至 400 美元

OpenAI首款硬件產品細節曝光,為一款無螢幕的智能音箱,外型類似冰球,售價約300至400美元,由OpenAI與前蘋果設計師Jony Ive的LoveFrom公司合作開發。該設備內建電池與攝影鏡頭,可支援手持使用並將視覺資訊傳給ChatGPT,實現多模態感知。此產品推出時正值蘋果對OpenAI提起商業機密訴訟,OpenAI內部評估其設計細節有望反駁侵權指控。

20 小時前4700
雷峰網AI硬體

金剛GC3芯片重新定義視頻AI算力規則,國產RISC-V高端算力商業化提速

近日,第三屆中國計算機學會芯片大會(CCF Chip 2026)在太湖之濱無錫成功舉辦。會場中,兩院院士與頂尖工程師們的討論話題直指底層架構的“根技術”創新。一個核心追問被反覆推至臺前:當摩爾定律逼近物理極限,製程紅利日益稀薄,堆核心、拼頻率的老路越走越窄,是否該徹底換一條路走?換言之,與其在通用架構上不斷打補丁,能否從數據流動的本質出發,為特定場景原生設計一顆芯片?

1 天前
雷峰網AI硬體

把512 GiB閃存搬到xPU旁邊,HBF能打破推理內存牆?

HBM已經證明,通過堆疊和共封裝把存儲介質遷移至GPU附近,可以緩解AI計算中的數據搬運瓶頸。現在,SK海力士聯合閃迪,將類似的思路正式應用到NAND上,通過HBF將大容量閃存放到包括GPU在內的各類xPU旁,以緩解AI推理內存牆問題。近日,雙方通過OCP發佈《High Bandwidth Flash(HBF)High-Level Base Die Specification, Version 0.7.0》。

1 天前
鈦媒體AI硬體

AI的錢,被誰賺走了?

AI 浪潮推動雲端服務供應商大舉擴建資料中心,背後龐大的資本支出正沿著供應鏈層層傳導,最終流向光模塊、晶片與伺服器業者。這條資金鏈路的起點是亞馬遜 AWS、微軟 Azure、Google Cloud 等雲端廠商,他們為了滿足訓練與推論大語言模型所需的算力,持續加碼採購 GPU 伺服器與高速網路設備,帶動上游零組件需求爆發。

2 天前