別再亂調圖像塔了!浙大 IJCAI 論文揭露 VLM 非對稱性真相,給 CLIP 微調「踩剎車」

2026年8月17日 04:45
站內 AI 整理稿

A3B2自適應非對稱適配器,詮釋大模型微調的“剋制”藝術。作者丨張 璐 編輯丨幸麗娟 在視覺語言大模型(VLM)落地少樣本遷移任務時,高效參數微調(PEFT)是大家普遍採用的低成本方案。然而,業界長期存在一個慣性思維:既然是做圖像分類,給圖像編碼器多掛幾個 Adapter、多做微調,模型理應能看懂更多視覺細節。但現實卻演化出一個尷尬的矛盾:在面對未知的現實場景(域外數據/OOD)時,在圖像編碼器上微調得越激進,模型的泛化能力反而破壞得越慘烈。預訓練大模型原本擁有一雙看懂萬物的“好眼睛”,強行局部微調反而把它“改近視了”。

這一矛盾引發了研究者的反思:在 VLM 微調中微調中,我們是否一定要死板地對稱更新雙塔?浙江大學陳靜遠教授課題組與斯旺西大學的聯合團隊提出了一個全新的方案——(自適應非對稱適配器)。它放棄了對圖像分支的硬性微調,而是引入預測置信度,自動在合適的時候給視覺塔“踩剎車”,在保留預訓練強泛化力的同時實現高效適配。論文鏈接:https://arxiv.org/html/2605.13161v201顛覆直覺的發現:文本放開改,圖像看情況為了徹底搞清楚雙塔到底該怎麼調,研究團隊在 11 個主流視覺數據集上展開了嚴謹的實驗。

他們給 CLIP 的圖像塔和文本塔分別掛載基礎 Adapter,在不同任務場景下進行了交叉對比,最終總結出推翻傳統範式的三大核心洞察:▎實驗試出來的三條“微調鐵律”洞察一:文本分支的改動收益更高 。在大多數任務中,微調文本編碼器帶來的性能提升,顯著高於微調圖像編碼器。這是因為文本本身包含高度抽象的高層語義,通過微調文本端,模型能以極小的參數代價快速對齊新類別的概念。洞察二:已知場景,雙管齊下。在分佈內任務(例如基類到新類的泛化)中,由於測試集和訓練集的數據分佈一致,同時微調圖像塔和文本塔能達到最佳表現。此時圖像塔的微調有助於捕捉特定領域內的細粒度視覺特徵。洞察三:未知場景,圖像微調是“毒藥”。

一旦到了分佈外任務(OOD)(例如跨數據集遷移或域泛化),激進地微調圖像塔不僅帶不來收益,反而會嚴重破壞 CLIP 原本強大的通用視覺表達。在(b)跨數據集評估和(c)域泛化等 OOD 任務中,僅微調圖像分支(Image 柱)的準確率大幅下滑;而僅僅微調文本分支(Text 柱)反而能維持較高水準。這三條洞察扎中了工程師的痛點。如果你在實際業務(如電商商品識別、工業質檢、醫療遙感等)中做過VLM落地,一定對這種“上線崩潰”不陌生。過去為了讓 CLIP 適應自家的私有數據,大家第一反應就是抓著圖像編碼器猛調。

結果模型在測試集上準確率飛昇,一上線遇到用戶上傳的長尾圖片、異常光照或未見過的品類(典型的 OOD 域外場景),性能立馬斷崖式下跌。很多團隊只能硬著頭皮不斷人工補數據、重訓模型。論文總結的這三條洞察,直接戳破了大家在工程落地時屢屢踩坑的根源:問題往往不是出在樣本不夠多,而是出在對圖像塔的“過度侵入”上。盲目微調破壞了預訓練底座最珍貴的通用視覺表達。▎陷入“開也不是,關也不是”的死局實驗數據徹底顛覆了大家的固有認知。過去被當成“加分項”的圖像塔微調,在未知數據面前竟然變成了毀掉模型的“毒藥”!既然如此,那遇到未知場景時,把圖像塔的 Adapter 手動關掉不就行了?想法很美好,現實潑了一盆冷水。

線上實時流入的數據,從來不會自己貼著“我是已知樣本”還是“我是未知樣本”的標籤。你不可能在服務器旁邊蹲守,每來一張奇怪的圖片,就手動去幫模型按一下微調開關。不關開關,模型會被“改近視”;想關開關,又根本無法預判數據。這種“開也不是,關也不是”的進退兩難,正是過往VLM微調範式一直難以越過的天塹。也正是被逼到了這種死衚衕裡,浙大團隊才徹底拋棄了死板的人工規則,提出了一個極具顛覆性的思路:既然人類無法預判,為什麼不把決定權交給數據自己?這才有了 (Adaptive Asymmetric Adapter)的誕生。02拆解黑科技:兩張架構圖把機制講透理解這套機制其實很簡單。

拋開復雜的公式,我們直接盯緊兩張結構圖:先放大看單個模塊的內部分工,再拉遠看全局的智能剎車。▎組件內部:1個精煉官帶 N個專項專家我們先拆開 Transformer 每一層裡掛載的 Adapter 內部。如下圖,輸入特徵進入這個小網絡後,實際上走的是兩條並行通道:第一步:信息壓縮(Down Matrix)輸入特徵先經過【Down Matrix】進行降維。這就好比一個“信息精煉官”,把原本高維冗餘的數據壓縮成精煉的小包裹,順便過濾掉特定任務裡的噪聲。

第二步:專家分工(Up Expert Matrices)精煉後的包裹被同時送給上方的多個 【Up Expert Matrix】(專家 1、專家 2……)。每個專家擅長恢復不同視角的特徵,共同把低維數據重新還原回高維空間。第三步:動態調度(Dynamic Router)右側的【Dynamic Router】(動態路由器),它就像一個“調度員”。它看一眼輸入的特徵,立刻給各個專家打分,最後把各個專家的結果按權重加權彙總,輸出最終的特徵修改量 。到這裡你可能會問:為什麼用“1個 Down + 多個 Up”,而不是“多個 Down + 1個 Up”?

這是因為,讓所有專家共享同一個“信息精煉官(Down 矩陣)”,能形成統一的信息瓶頸,所有專家都在同一個認知基準上協同工作,避免了多套降維矩陣互相扯皮、梯度抵消的問題。▎全局調控:遇事不決,立刻退回原始底座搞懂了單個 Adapter 的構造,我們把視野拉遠,看全景圖。注意看上圖的右上方,兩條紅色的線最終匯聚到了一個叫 【】 的地方。這就是 自動化“踩剎車”的全過程:第一步:看置信度(右下角)圖像和文本對齊後,模型會算出分類概率分佈。系統直接挑出最高的那一個概率值,作為當前的置信度得分。如果置信度很低,說明模型對這張圖片非常困惑,極有可能是沒見過的“域外數據(OOD)”。

第二步:看修正量(右上角)圖像塔每一層 Adapter 算出來的修改意見彙總在一起,形成一個總修正向量 。第三步:觸發剎車( Lbias)Lbias這個機制就像一個“動態減震器”:遇到熟客(高置信度):不干預,圖像 Adapter 算出來的正常疊加到圖像塔上,讓模型精細擬合。遇到生客(低置信度):懲罰機制立刻被激活,強行把總修正量 壓向 0。相當於一腳剎車,直接關掉了圖像 Adapter 的影響,讓模型退回到 CLIP 預訓練好的原始圖像特徵。03雨露均霑:如何防止 MoE 出現“專家塌陷”?在多專家系統中,經常出現路由器只偏愛“1號專家”,導致“1號累死,2號3號閒死”的現象(專家塌陷)。

為了防止這種情況,論文在訓練時加入了一個很直觀的約束:要求路由器在處理一批數據時,給各個專家的平均派活概率不能偏離“均分線()”太遠。這確保了所有專家都能分到任務,維持了整個小團隊的認知多樣性。04真實戰力如何?11 個數據集硬碰硬為了防止這種情況,論文在訓練時加入了一個很直觀的約束:要求路由器在處理一批數據時,給各個專家的平均派活概率不能偏離“均分線()”太遠。這確保了所有專家都能分到任務,維持了整個小團隊的認知多樣性。為了證明方法的通用性,測試的數據集涵蓋了極其豐富的場景:從通用的 ImageNet,到細粒度的汽車、飛機、寵物,再到遙感衛星圖、紋理識別以及動作識別。

▎跨界打擊:從沒見過的場景也能跑論文在三大微調評估任務中,將 與當前行業最頂尖的 11 種 Benchmark 方法(包括 CoOp, CoCoOp, MaPLe, MMA, MMRL, MMRL++ 等)進行了正面交鋒:基類到新類泛化(Base-to-Novel):在 11 個數據集上, 不管是在已知基類(Base)、未知新類(Novel),還是綜合評價指標(HM)上,均取得了全面領先的表現。跨數據集評估(Cross-Dataset):在 ImageNet 上訓練後,直接去跑其他 10 個未見過的全新數據集。

《洞察三》預測的規律在這裡得到了完美印證:那些給圖像塔做了激進微調的方法(如 MMA)表現慘淡,而專注於文本端或帶有自適應約束的 則大幅領跑。域泛化(Domain Generalization):在 ImageNet-V2、Sketch(草圖)、-A(對抗樣本)、-R(渲染圖)等存在嚴重分佈偏移的數據集上測試, 表現出了極強的魯棒性,平均準確率高居第一。的性能曲線(頂端棕色虛線/帶x標記)全程穩定壓制其他所有主流 Baseline。▎拆解驗證:任何一個零件都不能少為了驗證每一個設計都不是“花架子”,論文對各個組件進行了剝離測試。消融實驗柱狀圖如果去掉剎車機制(w.o.

Lbias):模型在未知新類(Novel)上的表現立刻出現了顯著下滑。這證明了在遇到不確定樣本時,強制把圖像適配器“踩剎車壓向 0”對於保住泛化力至關重要。如果給文本塔也裝上剎車(w.bi-encoder Lbias):如果在文本端也搞不確定性抑制,性能反而大幅下降。這再次驗證了《洞察一》:文本分支應該放心改,不需要像圖像分支那樣拘束。如果去掉路由器或更換 MoE 結構:無論是去掉動態路由器(w.o.Router),還是把結構換成普通的 LoRA(w.LoRA),性能都有不同程度的衰減,證明了“單下采樣+多上採樣專家”非對稱結構的優越性。

▎跑得快又不挑設備:老牌 ResNet 和新貴 ViT 通吃雖然引入了 MoE 和動態剎車,但由於 的 Adapter 極其輕量,在單張 A800 GPU 上,它的訓練和推理開銷遠低於複雜的 Prompt 尋優方法(如 MMRL),在性能與速度之間取得了極佳平衡。除了在 Vision Transformer(ViT)上表現出色,論文還在傳統的 ResNet-50 架構上進行了測試,同樣實現了大幅領先,證明該方法具備廣泛的模態骨幹兼容性。▎工程落地的“安全網”與適用邊界除了學術數據集上的指標,從工程落地和實際業務的角度來看, 的設計思路還帶來了非常關鍵的啟發:工業部署的防過擬合安全網。

在電商VLM檢索、遙感分類或邊緣端部署等真實業務中,模型在上線後會不斷撞見千奇百怪的未知測試樣本(OOD 數據)。傳統模型遇到這種數據容易“硬猜”導致盲目自信的報錯,而 這種“置信度低就自動退回預訓練底座”的軟約束,本質上為工業級模型的穩健運行搭了一道天然的安全網。理性看待技術的適用邊界。這種“圖像踩剎車”的自適應機制,最核心的優勢場景是算力受限、標註樣本匱乏的少樣本(Few-Shot)快速遷移場景。但如果我們面對的是擁有海量目標域標註數據的任務(比如幾十上百萬張精標註圖像),強行壓制視覺塔的修改量可能會限制模型的上限——此時全量微調或更激進的視覺塔重構可能依然能夠取得更好的絕對性能。

05結語:大模型微調的“剋制藝術”這篇論文的精妙之處,不僅在於它拿下了 11 個數據集的霸榜成績,更在於它用極具優雅的數學解法,為整個VLM的微調範式潑了一盆冷水,也指出了一條新路。它用實打實的實驗告訴我們兩個殘酷卻深刻的真相:尊重VLM的“非對稱性”:預訓練視覺塔在海量數據中積澱出的通用表達極其珍貴。在少樣本場景下,對視覺塔的激進修改往往是“破壞大於建設”。用不確定性實現“軟調控”:真正的智能調控不需要繁瑣的人工規則,把控制權交給數據自身的“置信度”。遇到熟悉的知識放開擬合,遇到未知的世界及時退回底座。

在大家瘋狂卷參數、卷複雜架構的今天,這篇文章或許給我們帶來了一個最核心的啟發:VLM微調的最高境界,從來不是盲目堆疊參數去改造大模型,而是在保留預訓練底座原有靈性的同時,學會適時放手——在熟悉的領地裡精準發力,在未知的迷霧中優雅退避。這種“文本常開、圖像看情況踩剎車”的自適應思路,不僅優雅地破解了 CLIP 的分支偏置難題,更為未來海量VLM模型在邊緣端、少樣本工業場景下的高效落地,提供了一套極其靠譜的工程解法。IJCAI 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?

會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

鈦媒體生成式AI

王興興“錯配”梁文鋒?

王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛