軟提示少樣本適配VLM

2026年9月13日 00:00
站內 AI 整理稿

視覺語言模型(VLM)近年來在跨模態理解任務中表現出色,但要將這些大型模型應用於醫療影像、工業缺陷檢測等特定領域,往往需要耗費大量運算資源進行模型微調。傳統做法是解凍模型的部分或全部參數,再以大量領域資料重新訓練,但這對樣本稀缺或運算能力有限的場景並不友好。近期一項研究重新審視了「軟提示」(soft prompt)這項輕量化策略,在完全凍結模型權重的前提下,僅透過極少數的連續提示向量,就能讓視覺語言模型在專業領域中完成少樣本檢測任務,為模型落地提供更經濟的解決方案。所謂軟提示,指的是以可訓練的連續向量取代傳統人工設計的文字提示。

這類向量會嵌入模型的輸入層,透過反向傳播調整自身的數值,從而引導模型針對特定任務產生符合需求的輸出。研究團隊發現,即便只訓練一到三個這樣的連續提示令牌,視覺語言模型就能夠在從未見過的專業圖像資料中掌握物件辨識與分類能力。若以參數量估算,這套方法的平均訓練參數約為七千一百六十八個,與目前廣泛使用的低秩適配(LoRA)技術相比,參數量足足減少了大約兩萬倍。這樣懸殊的規模差異,意味著訓練過程所需的記憶體與計算時間大幅下降,也讓模型適配門檻顯著降低。這項研究的核心價值在於重新驗證軟提示在視覺語言任務中的有效性。

過去學界普遍認為,軟提示主要應用於純語言模型,而在處理圖像與文字交織的視覺語言場景中,由於輸入維度更高、跨模態對齊更複雜,單純依靠少量連續向量可能無法勝任。然而研究團隊透過一系列實驗證明,只要設計得當,軟提示依然能讓凍結的模型學會判讀專業圖像中的稀少樣本,例如區分醫學影像中的病灶區域,或辨識工業生產線上的微小瑕疵。這類任務通常只有數十張甚至更少的標註資料,但軟提示策略仍能保持穩定的檢測表現。與傳統全參數微調或部分參數微調相比,軟提示的最大優勢在於幾乎不改變原始模型的任何內部權重。這種「凍結模型」的做法,不僅避免了災難性遺忘問題,還讓同一套基礎模型可以快速切換到不同領域任務。

只要替換對應的提示向量,就能讓模型瞬間從一般場景轉變為專業領域專家。這對企業或研究機構來說,意味著不需要為每個新領域重新訓練或儲存完整模型副本,僅需保留幾個KB大小的提示檔案即可。研究團隊特別指出,這項方法尤其適合樣本稀少、運算資源受限的應用情境。例如在罕見疾病診斷輔助系統中,收集大量標註完整的醫學影像往往曠日費時且成本高昂;在工業檢測現場,不同產品線的缺陷樣本也可能極不均衡。透過軟提示少樣本適配,開發者可以在已有的大型預訓練視覺語言模型基礎上,以極低的代價快速建立原型系統,並在後續逐步更新提示向量來自動適應新出現的樣本類型。

此外,這項做法也對邊緣運算裝置特別友善,因為訓練階段的計算需求大幅縮減,甚至可以在資源受限的單板電腦上執行。值得一提的是,軟提示與當前主流的參數高效微調(PEFT)方法並不完全衝突。LoRA、Adapter等技術固然在許多場景中表現優異,但它們仍需插入額外的可訓練層或對權重進行低秩分解,參數規模通常在數百萬至數千萬之間。而軟提示直接作用於輸入空間,跳脫了對模型內部架構的修改,讓整個適配流程更加簡潔。研究團隊透過橫向比較發現,當訓練樣本數量極少時,軟提示的表現甚至能與LoRA持平或略勝一籌,但訓練成本卻只有後者的萬分之一左右。從技術實踐來看,軟提示的訓練過程與一般深度學習訓練並無本質差異。

研究團隊將一到三個連續向量初始化為隨機數值,並將其與原始圖像、文字輸入共同送入凍結的視覺語言模型中。訓練期間僅更新這些向量的參數,其餘數千萬甚至數億個權重全部保持不變。經過數十輪迭代後,這些向量會逐漸收斂到能夠捕捉領域特徵的表示空間。實驗結果顯示,即使只使用一個提示令牌,模型也能在佛羅里達大學發布的醫療影像資料集以及部分工業視覺基準上達到可接受的檢測準確率;增加至三個令牌時,表現進一步提升,且並未出現過擬合跡象。這項研究的發表,為視覺語言模型的領域適配提供了一個輕量級且直觀的選項。有別於過去追求「越複雜越有效」的趨勢,軟提示重新證明了簡單的參數化策略在適當條件下仍能發揮關鍵作用。

研究團隊也呼籲後續研究可將軟提示與其他高效微調方法結合,例如先用軟提示完成初步任務適配,再根據需要選擇性地解凍少數層進行細調,從而在效率與效能之間取得更佳的平衡。整體而言,軟提示少樣本適配方法有助於降低視覺語言模型進入專業領域的門檻。隨著基礎模型持續朝更大規模發展,能夠以極低成本讓模型掌握新技能的策略,將在實際部署中扮演越來越重要的角色。無論是醫療、製造、農業還是安全監控領域,只要能以少量樣本定義任務,這套方法就有機會成為快速驗證與落地的首選方案。未來若進一步發展出自動化提示搜尋或動態提示擴展機制,軟提示在視覺語言生態中的應用潛力將更加可觀。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

5 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

9 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

11 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

12 小時前