騰訊混元發佈 1bit 與 4bit 量化版 Hy3 模型,旗艦 AI 模型可單卡本地運行

重點摘要
首頁 > 智能時代>人工智能 騰訊混元發佈 1bit 與 4bit 量化版 Hy3 模型,旗艦 AI 模型可單卡本地運行 2026/7/14 17:39:02 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 麻辣清補涼 的線索投遞! IT之家 7 月 14 日消息,今日騰訊混元發文表示,Hy3 上線並開源後,社區一直在呼籲量化版本,希望單卡跑參數量達 295B 的 Hy3。團隊針對開源社區需求,把 Hy3 的權重量化到 1bit 與 4bit 並打包成 GGUF,配合 llama.cpp 生態,讓原本只能跑在多卡集群上的模型,最少一張推理顯卡、乃至內存充足的本地機器也能跑起來。IT之家附官方詳細介紹如下:從模型上看,騰訊混元 Hy3 是一個 295B 參數的旗艦模型,展現出顯著強於同尺寸模型的智能水平,並比肩更大尺寸旗艦模型的效果,大幅提升了在各類產品和生產力任務中的實用價值,但是它的 BF16 權重接近 600 GB,要完整發揮實力,離不開多卡服務器這樣的部署環境。1bit, 4bit 以及 BF16 Hy3 模型遊戲編程示例1bit 塞進單卡,4bit 接近滿血我們首先提供了 1bit 極限量化版本 IQ1_M,把權重從 598 GB 一路壓到 85.5GiB,整整縮小了 6.7 倍。這意味著一張 96GB 的推理顯卡就能部署。對於硬件最受限、又想在本地把旗艦模型跑起來的場景,Hy3 1bit 版本是我們所推薦的。同時,我們也提供了 4bit 量化版本 Q4_K_M,體積 169.9GiB,兩張推理顯卡即可承載,如果目標是在有限資源成本內拿到更接近滿血模型的效果,推薦就選 Hy3 4bit 版本。我們還提供了 GPTQ Int4 版本,它可以直接通過 vLLM 部署對外提供服務,天然享受 vLLM 生態在高併發、低延遲上的紅利,更貼合服務端部署的需求。
首頁 > 智能時代>人工智能 騰訊混元發佈 1bit 與 4bit 量化版 Hy3 模型,旗艦 AI 模型可單卡本地運行 2026/7/14 17:39:02 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 麻辣清補涼 的線索投遞!IT之家 7 月 14 日消息,今日騰訊混元發文表示,Hy3 上線並開源後,社區一直在呼籲量化版本,希望單卡跑參數量達 295B 的 Hy3。團隊針對開源社區需求,把 Hy3 的權重量化到 1bit 與 4bit 並打包成 GGUF,配合 llama.cpp 生態,讓原本只能跑在多卡集群上的模型,最少一張推理顯卡、乃至內存充足的本地機器也能跑起來。
IT之家附官方詳細介紹如下:從模型上看,騰訊混元 Hy3 是一個 295B 參數的旗艦模型,展現出顯著強於同尺寸模型的智能水平,並比肩更大尺寸旗艦模型的效果,大幅提升了在各類產品和生產力任務中的實用價值,但是它的 BF16 權重接近 600 GB,要完整發揮實力,離不開多卡服務器這樣的部署環境。1bit, 4bit 以及 BF16 Hy3 模型遊戲編程示例1bit 塞進單卡,4bit 接近滿血我們首先提供了 1bit 極限量化版本 IQ1_M,把權重從 598 GB 一路壓到 85.5GiB,整整縮小了 6.7 倍。這意味著一張 96GB 的推理顯卡就能部署。
對於硬件最受限、又想在本地把旗艦模型跑起來的場景,Hy3 1bit 版本是我們所推薦的。同時,我們也提供了 4bit 量化版本 Q4_K_M,體積 169.9GiB,兩張推理顯卡即可承載,如果目標是在有限資源成本內拿到更接近滿血模型的效果,推薦就選 Hy3 4bit 版本。我們還提供了 GPTQ Int4 版本,它可以直接通過 vLLM 部署對外提供服務,天然享受 vLLM 生態在高併發、低延遲上的紅利,更貼合服務端部署的需求。壓下去了,能力卻沒塌判斷量化好不好,最直接的是看它和原始模型的輸出分佈有多接近。
4bit 版本在這一點上表現得相當出色,絕大多數位置上給出的首選答案以及 Top-K 概率分佈都和 BF16 模型保持一致。落到實際任務上同樣如此,無論是 Agent 能力,多語言代碼、工具調用,還是長文理解,成績都貼近滿血模型。除此之外,GPTQ Int4 模型在評測集上的掉點幅度也非常有限,整體完全在可接受範圍內。真正讓我們有些意外的是 1bit 版本。按直覺,壓到 1bit 附近模型多少會變笨,但我們的 Hy3 1bit 版本在主流任務上依然站得很穩。長文理解幾乎和原始模型持平,Agent 與代碼方向也保持得相當好,只有小幅回落。
放到日常的編碼輔助、工具調用、長文檔處理和常規問答任務上,它已經完全夠用。MTP 加速解碼要讓 Hy3 真正跑順,MTP 投機解碼必不可少。為此我們專門開發了 llama.cpp 的 patch,補齊了對 Hy3 模型結構的 MTP 的支持,並直接發佈了可用的構建與部署指引(詳見 https://huggingface.co/ AngelSlim / Hy3-GGUF ),開啟 MTP 後,接受率穩定在 60% 左右,1bit 版本的解碼速度提升約 50% ,4bit 版本提升接近 60% ,實際交互體驗依然流暢。
廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:Hy3,大模型,騰訊混元騰訊元寶接入混元 Hy3 模型,支持免費做文件騰訊發佈並開源混元 Hy3 模型,宣稱效果比肩國內外更大尺寸旗艦模型中興與騰訊達成合作,將發佈搭載混元大模型的 WorkBuddy AI 雲電腦消息稱騰訊 AI Lab 成立近十年後撤銷,相關人員調整到大模型部和產學研合作中心騰訊混元新模型 HY 3.
0 下月發佈,正在內部業務測試清華頂尖 AI 大牛龐天宇加盟騰訊,任混元大模型團隊首席研究科學家
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。