紫東太初推出GMC核心集剪枝方法,少80%Token仍滿血保真多模態能力

2026年8月12日 18:58
紫東太初推出GMC核心集剪枝方法,少80%Token仍滿血保真多模態能力
站內 AI 整理稿

免訓練、開箱即用!允中 發自 凹非寺 | 公眾號 QbitAI 隨著視覺語言模型分辨率與圖文理解能力持續升級,圖像會被編碼為數百至上萬個視覺Token。大量Token持續參與解碼計算、長期佔用KV Cache,帶來顯存開銷大、推理速度慢、部署成本高等一系列問題,視覺Token冗餘已成為多模態模型高效推理與規模化落地的核心瓶頸。當前行業通用方案為傳統Top‑K Token篩選:對每個Token獨立打分,僅保留得分最高的部分樣本。

但該方法存在明顯缺陷:高分Token高度集中在畫面顯著區域,反覆保留同質化冗餘信息,極易遺漏文字、數字、座標軸、目標空間關係等分散但關鍵的互補證據; 同時低分Token被直接刪除,攜帶細節信息永久丟失,導致模型推理失真、事實判斷偏差、視覺幻覺增多,普遍存在「壓縮必掉精度」的行業難題。△傳統Top-K Token篩選方法與GMC的對比 針對以上痛點,中國科學院自動化研究所紫東太初大模型團隊,提出核心集剪枝方法GMC(Grounded Message Coreset Pruning),實現了技術跨越式創新。

GMC徹底跳出「篩選單個最優Token」的傳統思路,基於模型真實推理邏輯,認為視覺語言模型依賴的是全體Token構成的集體消息,而非孤立圖像塊。因此壓縮不僅要確定「信息保留位置」,更要解決「保留Token的信息承載方式」。△核心集剪枝方法GMC整體框架 核心創新:雙階段架構,從根源化解Token冗餘與信息丟失矛盾 GMC整體分為互補證據自適應篩選與群體互補信息傳輸兩大核心階段,在不訓練、無額外模型依賴的前提下,實現高保真、高效率的視覺序列壓縮。1.互補證據自適應篩選 GMC同時從問題語義、視覺外觀和空間位置三個角度構建證據。

首先,利用視覺語言模型內部原生的視覺-文本注意力,識別與當前問題直接相關的區域; 其次,根據視覺特徵之間的相似性保護圖像中的不同外觀結構,避免模型只關注當前已經被問題激活的內容; 最後,通過原始圖像座標構建空間證據,保留圖表、文檔以及關係推理任務中重要的位置和幾何信息。在選擇關鍵性Token時,GMC根據其對“尚未覆蓋證據”的新增貢獻進行選擇。當某一區域已經得到充分表示後,附近相似Token的價值會隨之降低,系統會轉而選擇能夠補充文字、目標、數字或空間關係的其他區域。由此,有限的Token預算可以被分配給多種互補信息,而不是反覆集中在同一顯著位置。2.

群體互補信息傳輸 僅僅選出具有代表性的位置並不能完全解決信息丟失問題,因為未被選中的Token仍然攜帶著細節信息。GMC因此進一步提出Population Transport群體互補信息傳輸機制,將所有待刪除Token的隱藏狀態傳輸到最合適的代表Token中。該過程綜合考慮視覺特徵相似性和空間鄰近關係,將大量視覺Token聚合為少量緊湊表示。語義匹配清晰的內容可以被傳輸到相似代表,而容易混淆的局部細節則更傾向於保留在附近位置。聚合完成後,未選中的視覺Token被刪除,模型隨後在壓縮後的Token序列上繼續執行注意力計算。

與需要重新訓練模型或引入外部工具的方法不同,GMC不需要任務標籤、參數更新、輔助檢測器、OCR模型或額外模型,可以直接應用於已有視覺語言多模態大模型中。同時,GMC實現的是真實序列壓縮,而不是簡單地通過掩碼隱藏Token,因此能夠實際減少後續解碼層計算和KV Cache佔用。

方案核心優勢:零成本適配各類圖文大模型 1、全程免訓練,無額外依賴 無需模型微調、任務標籤、外部OCR / 檢測器、輔助模型,開箱即用,直接兼容Qwen、LLaVA等主流視覺語言大模型; 2、壓縮不降質,自帶去噪增益 過濾無效冗餘Token的同時完整留存推理所需視覺證據,多項基準測試中性能持平甚至優於原始完整模型; 3、抑制視覺幻覺,事實一致性更強 在POPE、HallusionBench等幻覺評測集表現突出,大幅減少壓縮後模型錯描述、信息缺失問題; 4、跨模型通用,全場景適配 可遷移至不同架構7B級多模態模型,覆蓋通用圖文問答、圖表解析、長文檔識別全業務場景。

權威實驗結果:超高壓縮率,完美解決Token冗餘痛點 團隊基於TextVQA、ChartQA、MME、POPE、MMBench、GQA等多項主流視覺理解基準,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量驗證。△GMC在Qwen2.5-VL-7B和LLaVA-1.5-7B上的性能與效率表現 1、在Qwen2.5-VL-7B上,完整模型包含1296個視覺Token。當視覺Token數量減少80.2%、僅保留256個時,GMC-H2保留了完整模型97.78%的平均能力,當進一步減少90.1%、僅保留128個視覺Token時,GMC-L16仍保持99.

11%的平均能力。2、在LLaVA-1.5-7B上,GMC-L16在分別保留128個和64個視覺Token時,平均性能達到完整模型的99.76%和99.82%,表明該方法能夠遷移到不同視覺語言模型架構。GMC方法性能與基線模型性能一致甚至略高於基線模型,表明GMC不僅可以減少計算量,甚至可以通過移除無關信息達到去噪效果,進而能夠輕微提升模型的多模態理解能力。除了常規視覺問答能力,研究團隊還在POPE、AMBER、HallusionBench和CHAIR等基準上評估了模型的視覺幻覺。

實驗結果表明,在相同Token預算下,GMC能夠更加完整地保留事實判斷所需的視覺證據,在顯著壓縮視覺序列的同時減少錯誤描述和信息遺漏。結果如下表所示: △在相同視覺Token預算下,GMC在多類視覺幻覺評測中保持更好的事實一致性 在長文檔問答場景中,面對包含15876個原始視覺Token的輸入,GMC在保持完整模型98.87%問答質量的情況下,實現了1.258倍端到端推理加速,並減少73.94%的提示KV Cache,驗證了該方法在實際部署中的效率優勢。隨著多模態大模型向高分辨率、長上下文、複雜真實場景演進,Token冗餘帶來的算力、顯存成本問題,已經成為產業規模化落地的核心阻礙。

紫東太初GMC不僅是一款全新的核心集剪枝方法,更提供高效、可信的多模態部署新範式: 視覺壓縮的核心不是減少Token數量,而是以更低的計算代價,完整支撐模型精準推理所需的全局視覺信息。未來紫東太初大模型團隊將持續迭代GMC技術體系,適配更多大模型架構與複雜業務場景,持續破解多模態模型「算力成本與推理精度」的核心矛盾,推動國產多模態大模型高效、低成本、規模化落地。論文地址:https://arxiv.org/abs/2608.02134v1 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛