MarkTechPost AI模型更新

Tencent Releases Hy3: An Open 295B Mixture-of-Experts (MoE) Model with 21B Active Parameters and 256K Context

2026年7月7日 05:59
Tencent Releases Hy3: An Open 295B Mixture-of-Experts (MoE) Model with 21B Active Parameters and 256K Context

重點摘要

Tencent’s Hy team released Hy3. Hy3 is a 295B-parameter Mixture-of-Experts (MoE) model. It activates only 21B parameters per token. The weights ship under the Apache License 2.0.

站內 AI 整理稿

騰訊旗下的 Hy 團隊正式推出新一代大型語言模型 Hy3,這是一款以混合專家(Mixture-of-Experts,MoE)架構為基礎的開源模型,總參數量達到 2950 億,但在每次推理時僅活化其中 210 億個參數,大幅降低計算成本。Hy3 的權重已依 Apache License 2.0 授權條款釋出,開發者與研究人員可自由下載、修改及商用,這項舉措顯示騰訊在開放原始碼領域持續深化布局。Hy3 的設計初衷是針對推理、代理工作流程以及長文本處理任務進行最佳化。這類應用場景通常需要模型具備強大的邏輯推導能力、多步驟決策執行力,以及對數萬字以上上下文的記憶與理解。

Hy3 的架構正好回應這些需求,透過稀疏化的專家模型組合,在維持高品質輸出的同時,也能夠控制運算資源的消耗。整個 Hy3 模型內部包含 192 個專家子網路,採用 top-8 路由機制。當輸入一個 token 時,系統只會從 192 個專家中選取最相關的 8 個專家來啟動運算。這種設計讓每次前向傳遞的計算量遠低於同規模的密集模型,因為絕大多數專家都處於休眠狀態,只有少數專家實際參與推論。這樣的稀疏計算策略正是 MoE 模型的核心優勢,也是 Hy3 能夠以 210 億活躍參數支撐 2950 億總參數量的關鍵。

除了稀疏 MoE 結構,Hy3 還引入了多 Token 預測(Multi-Token Prediction,MTP)層。傳統語言模型在解碼階段通常是一次產生一個 token,然後再以該 token 作為下一步輸入,逐步生成完整序列。MTP 技術則讓模型能夠同時預測多個連續 token,從而在解碼過程中加速運算,減少序列生成時的迭代次數。這項技術對於需要即時回應的應用尤其重要,例如對話機器人、即時翻譯或程式碼補全。Hy3 的參數活化方式經過精細設計。雖然總參數量高達 2950 億,但由於每次只啟動 8 個專家,活化的參數總和僅為 210 億。

這意味著模型在訓練階段需要儲存大量的專家權重,但在實際部署時,記憶體與算力的需求卻與一個約 210 億參數的密集模型相當。這樣的特性讓 Hy3 在伺服器端部署時,能夠以更低的硬體門檻實現接近千億級模型的表現。長文本處理能力是 Hy3 的另一項重點。透過 MoE 結構與 MTP 層的協同運作,模型能夠在極長的上下文範圍內維持對資訊的追蹤與引用。這在處理法律文件、學術論文、程式碼庫或多輪對話紀錄時特別有價值。傳統模型在上下文超過一定長度後往往會出現遺忘或混淆,而 Hy3 的專家路由機制能夠針對不同內容主題分派不同的專家群,有助於在長序列中保持專業性的回應。

授權方式方面,Apache License 2.0 是一項相當寬容的開源授權,允許使用者自由使用、修改、分發,甚至將其整合到商業產品中,只要保留原始著作權聲明即可。這項選擇讓 Hy3 能夠迅速被學術界與工業界接納,也有助於建立圍繞 Hy3 的生態系,包括社群貢獻的微調版本、推理引擎最佳化以及各領域的應用整合。從技術路線來看,Hy3 延續了近年來大規模語言模型從密集架構轉向稀疏架構的趨勢。以 GPT-4 為代表的密集模型雖然效果卓越,但訓練與推理成本極高。

MoE 模型如 Mixtral 8x7B、Qwen 系列中的 MoE 版本,以及現在的 Hy3,都在設法用更低的運算開銷達到同等甚至更好的效能。Hy3 的 192 專家數量遠高於常見的 8 專家設計,這使得模型能夠涵蓋更多專業知識領域,同時透過 top-8 路由確保單次推理的運算量不會過度膨脹。對於開發者而言,Hy3 的釋出提供了一個可直接用於研究與產品整合的強大基礎模型。由於權重已公開,團隊可以基於 Hy3 進行指令微調、強化學習對齊或針對特定任務的專家蒸餾。長上下文與代理工作流的支援也讓 Hy3 特別適合搭建自動化工具鏈,例如程式碼生成、資料分析管線或多步驟問答系統。

騰訊 Hy 團隊在官方公告中強調,Hy3 的開發過程歷經多次架構實驗與大規模訓練,最終選定 192 專家與 210 億活躍參數的組合,是為了在效能、成本與部署彈性之間取得平衡。團隊也計畫持續更新模型,並歡迎社群提供反饋,以進一步改善專家路由的準確性與 MTP 層的預測效率。整體而言,Hy3 的問世代表著中國科技巨頭在開源大模型領域的又一次重要出手。不同於完全封閉的商用模型,Hy3 採用開放授權,降低了下游開發的門檻;而 2950 億總參數與 210 億活躍參數的巧妙搭配,則展示了稀疏 MoE 架構在兼顧規模與效率上的潛力。

隨著 Hy3 的權重被廣泛下載與應用,未來或許會催生更多針對特定領域的微調版本,進一步驗證這套架構在推理、代理與長文本場景中的實際表現。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前