混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減

2026年9月1日 18:47
混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減
站內 AI 整理稿

(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

8月28日,騰訊發佈並開源了Hy4 preview,騰訊公開的Hy4 preview基準測試結果顯示,在多個編程、智能體和科研基準測試中,Hy4 preview的得分超過了DeepSeek V4 Pro 0824等模型,排名位居開源模型第一梯隊。▲BF16原版(左)和MIX-STQ10量化版(右)生成效果 MIX-STQ10量化版在多個主流評測集上和BF16原版的差距都在一兩分以內,長上下文評測集MRCR、真實工具調用Agent評測MCP‑Atlas等任務中分差不到1分,整體領先UD-IQ1M量化版本。

此外,研究人員還驗證,即使不是整套同構硬件,開發者通過手邊現有的異構設備拼接,也能跑通旗艦大模型。騰訊混元團隊基於分佈式集群推理框架prima.cpp進行了驗證,在一臺4090筆記本和一臺四卡A4000服務器上,兩端顯存合計80GB、內存合計64GB,分處兩個局域網,靠prima.cpp的異構調度把MoE層拆開分配,讓計算和權重讀取彼此重疊,最終將214GB的Hy4 preview輕量版模型協同跑到了1.02 token/s,比筆記本單機offload快了約6倍。騰訊混元稱,其通過Sherry稀疏三值量化算法和MIX-STQ10混合精度策略兩大技術,實現了壓縮模型權重且性能沒有大幅降低。

1、Sherry稀疏三值量化算法:把最激進一檔權重壓到平均1.25比特 騰訊混元自研了Sherry稀疏量化算法,以優化路由專家部分。Sherry是一種三值量化方法,每四個權重為一組,一起量化成 {-1、0、+1},並強制每組裡恰好1個為0。這樣每組有32種組合,可以用5bit索引編碼,攤到每個權重平均1.25bit,計入分塊共享的縮放係數等額外開銷,落到文件裡的實際開銷約1.31bpw。基於Sherry,騰訊混元在llama.cpp裡實現了STQ10推理內核,打通了量化、推理到評測。

其將STQ10和幾種常見低比特格式放在同一算子上比,STQ10在比特數最低的同時,速度和IQ1M基本持平,比IQ1S更快。▲各個算子速度展示 2、MIX-STQ10混合精度策略:按校準數據逐層決定每層比特壓到多低 直接把全部層統一到同一量化檔位,操作簡單,但模型各層對壓縮的耐受能力差異很大。社區主流UD‑IQ1M方案,對絕大多數路由專家層統一採用IQ1M(1.75bpw)。騰訊混元團隊在校準集上發現,與其讓這些層統一用IQ1M,不如按敏感度逐層分檔:敏感的層留IQ2XXS(2.06bpw),不敏感的層用壓縮更強的STQ10(1.31bpw)。這套逐層混合精度方案,就是MIX-STQ10。

在不增加平均比特預算的前提下,這樣逐層分檔,整體量化誤差更低。落到最終模型,MIX-STQ10的路由專家權重不光評測表現更好,還比UD-IQ1M少佔了超5GiB。結語:騰訊混元給出MoE部署新思路,不再一刀切壓縮模型 長期以來,MoE模型憑藉專家混合架構獲得更強能力,但龐大權重帶來更高顯存門檻,很多高性能開源模型只能跑在高端集群,普通開發者與中小企業難以本地部署。騰訊混元此次針對MoE模型專家層參數分佈特點做定製化壓縮,不再簡單對全模型統一降比特,按照各層敏感度差異化分配精度,將模型壓縮帶來的性能損耗見效,或能為超大MoE模型實現輕量化落地提供參考。

Related

相關文章

量子位生成式AI

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑

MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

剛剛

奧特曼播客曝猛料:Astra操作電腦已達人類水平

OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

剛剛

奧特曼直言:四年太久,大學兩年就夠

OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

剛剛

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成

中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

剛剛

2026年的一切,都只是Robocity的序幕

35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。

剛剛
鈦媒體生成式AI

燧原科技網上路演成功舉行:四代架構5款雲端AI芯片持續迭代,商業化加速落地

廣角觀察2026.09.01 17:53 · 來自北京全文877字00:00 / 02:409月1日,上海燧原科技股份有限公司首次公開發行股票並在科創板上市網上投資者交流會圓滿舉行。9月1日,上海燧原科技股份有限公司(簡稱“燧原科技”,股票代碼:688801)首次公開發行股票並在科創板上市網上投資者交流會圓滿舉行。公司高管及保薦機構中信證券就投資者關心的主營業務、經營業績、發展戰略等問題進行了認真解讀與深入溝通。

剛剛