從3.3GB壓縮到440MB!騰訊混元極低bit翻譯模型如何做到幾乎零損失?

2026年8月27日 08:05
站內 AI 整理稿

AI資訊AI新閒資訊正文從3.3GB壓縮到440MB!騰訊混元極低bit翻譯模型如何做到幾乎零損失?發布於AI新閒資訊時間 :Aug 27, 2026閱讀 :1分鐘近日,騰訊混元團隊公佈了一項最新的技術成果,成功將旗下主打端側的1.8B 翻譯模型壓縮至幾百兆大小,不僅翻譯質量幾乎沒有損失,並且已經成功落地嗶哩嗶哩(B站)的直播彈幕實時翻譯中,實現了從實驗室 Demo 到高併發真實業務場景的跨越。作為基底的 Hy-MT2-1.8B 模型原本屬於騰訊混元翻譯模型族,原生支持33個語種互譯。在同等尺寸中,其整體翻譯質量在 FLORES-200通用翻譯評測上已經優於多款商業翻譯 API。然而,由於1.

8B 模型在傳統的 FP16精度下需要佔用高達3.3GB 的內存,即便降到4-bit 量化也仍需1GB 以上,無法滿足端側多任務併發的內存管理需求。為此,騰訊推出了兩檔極低比特的量化方案。第一檔是面向中高端設備的2-bit 模型。該方案採用了拉伸彈性量化(SEQ)技術,將參數量化至特定的離散數值,並結合量化感知蒸餾(QAD)手段,在將模型體積壓縮至574MB 的同時,實現了幾近無損的翻譯質量。第二檔則是面向全系設備的1.25-bit 極低比特方案。該方案基於騰訊自研的 Sherry 稀疏高效三值量化技術,該技術此前已被頂級學術會議 ACL2026選為 Oral。

其核心策略是通過細粒度稀疏機制,使每4個參數中最重要的3個用特定數值存儲,其餘置零,平均每個參數僅佔用1.25-bit。配合專為 CPU 設計的 STQ 內核,原始的3.3GB 模型被極致壓縮至440MB。為了讓極低 bit 模型擺脫對特定移動端 ARM 架構的依賴,英特爾團隊針對 x86生態進行了深度底座適配。通過對量化矩陣運算中的向量化、權重重排和 VNNI 指令融合環節進行優化,Hy-MT2的低比特量化格式在英特爾主流機型(包括最新第三代酷睿 Ultra 及酷睿處理器)上的 token 運行速率實現了顯著提升,成功將極低比特方案從移動端擴展至 PC 和邊緣設備。

在實際業務驗證方面,嗶哩嗶哩已將該極低比特模型正式接入直播彈幕實時翻譯。整套資源的下載大小約為600MB,運行時內存佔用保持在500到700MB 之間,平均單條彈幕的翻譯耗時在500到800毫秒左右,在常規彈幕頻率下能夠做到流暢的實時翻譯,並能準確駕馭各類網絡流行語。這種在設備本地獨立運行的模式,既降低了雲端服務器的調用成本與帶寬開銷,也在全流程中避免了數據上傳,切實保障了用戶的隱私安全。相關推薦騰訊大模型迎來人事大地震:姚順雨掌舵基礎模型騰訊混元多模態團隊近期深度調整:原xAI多模態理解負責人藺旭東加盟,任多模態內容生成算法負責人;原負責人胡瀚離職創業,前OpenAI研究員田永龍加入。

系列人事變動標誌著騰訊在多模態大模型研發上正進行深層次路線重構。Aug 19, 2026233.3k騰訊大模型人事調整:混元后訓練負責人徐燦轉崗微信WeLM騰訊大模型佈局調整:原混元資深研究員徐燦轉崗微信事業群,加入WeLM團隊,專注後訓練與Agent研發。徐燦曾創建WizardLM並提出Evol-Instruct,在合成數據、強化學習等領域積澱深厚。此舉正值微信AI加速落地期。Aug 14, 2026259.4k無需雲端API!手機即可本地運行,Liquid AI推出端側智能體模型LFM2.58月5日,Liquid AI發佈專為智能體工作流設計的26億參數端側模型LFM2.5-2.

6B,可完全本地運行於手機等終端,提供低成本、低延遲與隱私保護方案。其基於34萬億詞元預訓練,詞表容量128K,後訓練融合監督微調、教師特化與多領域策略。Aug 5, 20261,372.6k騰訊混元 Hy ASR3.0 預覽版發佈:從"聽清"到"聽懂",方言詞錯率壓到 3%騰訊混元發佈語音識別模型Hy ASR3.0 Preview,基於大語言模型Hy3,融合高精度識別與深度語義理解,實現從“逐字轉寫”到“理解語境”的質變。模型覆蓋十大方言片區,長音頻場景優勢突出,不依賴標準普通話,讓AI不僅能聽清字,更能真正聽懂話。Aug 5, 2026238.9k騰訊混元發佈 Hy ASR 3.

0 preview:語音識別不再逐字硬轉,而是真的聽懂了語境騰訊混元發佈語音識別模型Hy ASR3.0preview,基於大語言模型Hy3的語言理解能力,融合高精度識別與深度語義理解。它在通用識別、上下文感知、多場景魯棒性及方言覆蓋等方面全面提升,能結合語境給出更準確連貫的轉寫,實現從逐字轉寫到理解語義的進化。Aug 5, 20261,203.1k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

谷歌突然發佈“最強聽寫模型”:Agent時代的落伍產品,還是關鍵拼圖?

谷歌近日無預警推出號稱「最強聽寫模型」的新產品,消息一出立刻在科技圈與開發者社群引發兩極討論。有人認為在AI Agent(智慧體)當道的時代,語音聽寫技術已經顯得過時;也有人主張,這項產品其實是補齊人機互動關鍵缺口的重要拼圖。這款模型究竟是真突破,還是谷歌在AI競賽中的一次保守出擊,成為外界關注焦點。 所謂聽寫模型,核心功能是將人類語音精準轉換為文字,看似只是語音辨識技術的延伸,但谷歌這次強調的重點在於「最強」二字。

剛剛
IT之家模型更新

阿里發佈全新 Qoder,從 AI 編程工具升級為智能體工作臺

作者:汪淼 責編:汪淼 評論: 感謝網友 歸去如風、順勢而為、西窗、華南吳彥祖、麻辣清補涼 的線索投遞!8 月 27 日消息,阿里今日發佈了全新 Qoder,這是一個以 Coding 能力為核心底座,面向所有人打造的智能體工作臺。官方介紹稱,告訴 Qoder 你想完成什麼,它會理解上下文、制定計劃、調用工具、執行並驗證。

剛剛
鈦媒體模型更新

DeepSeek一張漲價單,繁榮了一條產業鏈?

師天浩2026.08.27 11:52 · 來自河北全文3584字00:00 / 11:45漲價,是缺貨的證詞文|師天浩觀察,作者|辰聰七天裡,DeepSeek調了兩次價。第一次發生在8月13日晚。與V4 Pro正式版上線同一份公告裡,Deepseek給出了新價格。8月17日零時起,旗艦模型V4-Pro高峰時段的輸出價從每百萬Tokens 6元漲到27元,漲幅350%;緩存命中的輸入價從0.025元漲到0.30元,是原來的12倍。

剛剛

智譜認領“牛來”模型,實測:“牛馬”友好

智譜認領「牛來」模型的消息在科技圈迅速發酵,這個略帶戲謔意味的名字,瞬間點燃了開發者與AI愛好者的討論熱情。不同於過往以英文代號或嚴肅技術命名為主的慣例,「牛來」這個接地氣的名稱,反而在社群平台上創造了極高的聲量,讓原本可能僅限於專業圈層的技術發布,意外破圈成為大眾關注的焦點。 根據的實際測試與體驗,「牛來」模型在諸多應用場景中展現出對「牛馬」群體的高度友善。這裡所謂的「牛馬」,是當前網路語境下廣大上班族、打工人的自嘲式稱呼,而這款模型在處理繁雜的文書工作、程式碼生成、數據整理等日常高壓任務時,表現得格外得心應手。

剛剛

AI自己出題自己練,兩個月狂漲11%,編碼自測反超Opus 4.8

AI 自行出題、自行批改、再針對弱點反覆練習,這種全新的自主學習模式正在讓模型能力出現驚人躍進。最新曝光的測試數據顯示,一款代號為 Fable 5.1 的模型在短短兩個月內編碼能力大幅提升 11%,其自測成績甚至一舉反超目前業界標竿 Opus 4.8,引發開發者社群熱烈討論。 據了解,Fable 5.1 目前正處於灰度測試階段,約在 37 分鐘前才剛對外開放部分用戶體驗。

剛剛