1.5TB 壓到 214GB:騰訊混元 Hy4 preview 輕量版發佈開源,異構設備可聯合推理

2026年9月1日 12:31
1.5TB 壓到 214GB:騰訊混元 Hy4 preview 輕量版發佈開源,異構設備可聯合推理
站內 AI 整理稿

近年來大型語言模型的參數量與儲存需求持續攀升,如何在維持模型效能的同時,讓模型更容易部署在各式各樣的硬體環境,已經成為 AI 產業關注的重點方向。騰訊混元大模型團隊近期發布了 Hy4 preview 的輕量版本,並同步將模型開源釋出,這款新版本以極高的模型壓縮率與跨裝置協同運算能力作為主打特色,嘗試在模型規模與實際應用之間取得新的平衡點。根據騰訊混元團隊公布的技術資訊,Hy4 preview 輕量版的原始模型規模約為 1.5TB,這個數字在目前主流的大模型中屬於相當可觀的份量。為了讓模型更容易落地,團隊採用了創新的量化技術進行最佳化,成功將模型體積大幅縮減至 214GB。

換算下來,整體壓縮比超過七倍,也就是說,原本需要耗費大量儲存空間與記憶體資源的模型,如今可以在相對有限的硬體條件下運行,這對許多企業與研究單位來說,無疑是降低進入門檻的重要步驟。在追求體積縮減的同時,模型效能是否能夠維持,往往是輕量化過程中最常被檢驗的環節。騰訊混元團隊表示,透過這次的量化技術,Hy4 preview 輕量版的效能損失控制得相當有限。換言之,模型在壓縮之後仍然保有接近原本版本的推理能力,不會因為體積大幅下降而出現明顯的性能衰退。這樣的結果也意味著,輕量化不必然要以犧牲品質作為代價,透過適當的技術手段,仍有機會在資源有限的環境中維持高水準的模型表現。

除了儲存空間上的優勢,Hy4 preview 輕量版還有一項相當受到矚目的特性,那就是支援異構設備聯合推理。所謂異構設備,指的是具備不同運算規格與能力的硬體裝置,例如不同廠牌的 GPU、CPU,甚至是效能等級有落差的邊緣裝置。過去這類裝置通常各自獨立運行模型,彼此之間的協同作業並不容易;而騰訊混元這次的設計,讓不同硬體規格的裝置可以串連起來,共同分擔模型推論過程中的運算工作。這項異構設備聯合推理的能力,對於實際部署場景具有相當大的意義。一般來說,企業內部往往不會只擁有一種硬體設備,可能同時存在高效能伺服器與一般工作站的混雜環境,若是模型只能限定在特定規格的設備上運行,部署彈性就會受到很大限制。

Hy4 preview 輕量版打破這個框架,讓各種裝置可以協同運算,藉由整合分散的運算資源,進一步提升整體推論速度。官方指出,這項技術讓模型在實際應用中的反應效率明顯提高,同時也有助於降低部署門檻與運算成本。從應用層面來看,更小的模型體積與更靈活的硬體適應性,代表著大模型有機會走入更多過去難以觸及的場景。例如在資料隱私要求較高的環境中,企業可能傾向在地端部署模型,而不想將資料送到雲端處理;但地端硬體往往不如雲端資料中心那般充裕,這時候輕量化模型就顯得格外實用。加上異構設備聯合推理的支援,即使伺服器規格參差不齊,也能藉由協同運算的方式完成任務,讓資源運用更有效率。

騰訊混元團隊這次選擇以開源方式釋出 Hy4 preview 輕量版,目前模型已經上線至開源平台,開發者與研究機構都可以自行下載使用。這一步除了展現技術成果之外,更帶有推動產業發展的意圖。透過開放原始碼與模型權重,外部開發者可以針對自己的需求進行調整、微調與最佳化,加速模型在各種垂直領域的落地。混元團隊也希望藉由社群的力量,讓大模型的應用範圍更加廣泛,同時在實際使用過程中持續收集回饋,做為後續改進的參考。值得注意的是,這次發布的 Hy4 preview 輕量版雖然在體積與協同運算方面交出亮眼成績,但整體而言仍是 preview 階段,代表產品還有持續演進的空間。

從過往經驗來看,量化技術經常會遇到效能與壓縮率之間的取捨,而騰訊混元團隊宣稱能在超過七倍壓縮的情況下仍保持有限的效能損失,這項成果背後必然涉及相當複雜的演算法設計與實驗調整。對於關心大模型部署技術的開發者來說,實際下載測試、驗證模型在自身環境中的表現,會是評估這項技術價值的關鍵步驟。回顧目前 AI 產業的發展趨勢,模型規模競賽固然是重要方向,但如何讓模型真正被廣泛使用,往往取決於部署的難易度。許多企業在導入大模型時,第一個遭遇的障礙就是硬體成本與資源限制;而像 Hy4 preview 輕量版這類產品的出現,正好提供了另一條務實路徑。當模型體積從 1.

5TB 縮小到 214GB,儲存與記憶體的壓力大幅降低,推論過程中的運算負擔也相對減輕,再加上異構設備可以聯合推理的彈性設計,使得大模型不再只是少數擁有頂級算力單位的專利。此外,開源策略也在這個案例中扮演關鍵角色。這幾年開源模型在全球快速發展,帶動了許多創新應用誕生,各國的研究者都能夠在開放生態系中互相學習、彼此改進。騰訊混元將 Hy4 preview 輕量版開源,等同於把這項技術成果交給全球社群檢視與使用,這不僅有助於提升模型的能見度,也能吸引更多開發者加入優化行列。

長遠來看,開源與輕量化的結合,可望讓大模型技術的普及速度進一步加快,尤其是在資源相對有限的新創團隊與學術單位中,這類模型往往更容易被採用。整體來說,Hy4 preview 輕量版代表了騰訊混元團隊在模型部署技術上的一次重要嘗試。從 1.5TB 到 214GB 的巨大壓縮,再到支援異構設備協同運算的架構設計,都顯示出他們並不只是追求參數規模的成長,同時也關注模型的實用性與可及性。這對於正在尋求更有效率的大模型解決方案的企業與研究機構來說,無疑提供了一個值得深入評估的新選項。未來這套技術能否在更多場景中發揮影響力,後續版本的表現是否會更加出色,都值得持續觀察。

Related

相關文章

AI寫得太快,人類審不動了,OpenClaw斷更7周,一版吞下1.6萬個PR

OpenClaw 專案因 AI 輔助生成的程式碼過快,最新版本累積高達 1.6 萬個 Pull Request,人類審核跟不上而被迫停更七週。這起事件凸顯開源社群正面臨「AI 狂寫、人類狂審」的失衡挑戰,維護者需花更多時間辨識貢獻真偽。專家建議團隊應提高審查門檻、限制 AI 改動範圍,並正視人類審核能量的有限性。

剛剛

GLM 5.3 更強卻更難用了?我們讓它和 5.2 做了同一個北京城市駕駛遊戲

官方強調 GLM 5.3 安全能力大幅提升,實測卻發現這套安全機制在自動化工具鏈中頻繁觸發拒絕,導致開發流程中斷。 作者丨吳海明 編輯丨李 娜 大家還記得《極限競速:地平線》裡那種在開放世界中自由駕駛、穿梭城市與道路的體驗嗎?地平線遊戲圖這次,我們用一個類似思路、但更貼近真實工程開發的題目來考一考 GLM 5.3:從零開發一款基於 OpenStreetMap 真實數據的「北京國貿 → 望京」區域 3D 開放世界駕駛遊戲,5.

3 小時前

MWA™霸榜全球第一後:無界動力用真實咖啡廳展現物理AI的落地之徑

從“出片”到“出海”,無界動力即將奔赴下一個考場。 作者丨郭 思 編輯丨董子博 沒有刻意的社交氛圍,一人靜坐或幾個好友相聚,手捧一杯咖啡,在音樂與咖啡的交匯中,暫時剝離工作與生活的瑣碎,獲得片刻放鬆與靈感迴響。這是平日裡我們對於休閒時刻美好畫面的印象,也是2026世界機器人大會現場最反差的一幕。

9 小時前
何夕2077研究與前沿

TimesFM-3發佈

TimesFM-3: A zero-shot foundation model for multivariate forecasting August 31, 2026Ayush Jain and Rajat Sen, Research Scientists, Google Research We introduce TimesFM-3, a state-of-the-art time series foundation model t。

12 小時前
何夕2077研究與前沿

J-Zero零數據共進化

近期一篇名為「J-Zero零數據共進化」的研究引起關注,核心概念是讓AI模型在不依賴外部標註資料的情況下,透過彼此對抗與合作持續進化。論文提出一套三方訓練框架,讓不同模型分別扮演挑戰者、求解器與評委,形成動態競爭與回饋機制,藉此突破傳統訓練資料的瓶頸。 具體運作流程中,挑戰者負責設計題目,求解器則嘗試作答,而評委會依據人類偏好對求解結果進行校準與評分。這樣的循環讓模型不是單向被動學習,而是在互相出題、解題與評判的過程中,逐步提升能力。

12 小時前
何夕2077研究與前沿

ElephantBench測長尾盲區

騰訊發布長尾知識基準ElephantBench,內含1094道分歧事實題,用以評估模型在長尾知識上的表現。測試涵蓋32個模型,其中表現最佳的模型也只有52.4%的正確率,顯示長尾知識仍是模型的一大盲區。

12 小時前