拆解 Mistral AI 新項目Shieldstral,看 3B 小模型如何重構 AI 安全審核範式

2026年8月17日 09:02
站內 AI 整理稿

一款 3B 級分類器,可通過統一接口審核文本、圖片以及圖文混合內容。作者丨樊天驕 編輯丨鄭佳美 2026 年 8 月 4 日,法國大模型廠商 Mistral AI 正式發佈 Shieldstral,一款 3B 級規則自適應多模態安全分類器,可通過統一接口審核文本、圖片以及圖文混合內容。與依賴固定風險標籤的傳統安全模型不同,Shieldstral 支持在推理階段通過自然語言輸入自定義審核規則,從而根據不同業務場景調整審核標準。

它圍繞三層設計重構了安全審核流程:將不同審核任務統一為 Yes/No 判斷題,通過對比式訓練讓模型學習具體的規則匹配關係,再將文本理解、視覺理解和規則適應能力整合到同一個輕量級模型中。在多個文本和多模態安全基準上,Shieldstral 甚至取得了接近甚至超過部分參數量更大模型的結果,同時保持較低的部署門檻。因此,本文將從任務建模、訓練數據構造、視覺能力擴展和模型融合等方面,拆解這套方案的技術邏輯。01圖文審核,只需一道判斷題傳統安全模型通常採用固定分類方式:開發者預先設定暴力、色情、仇恨等風險類別,再使用相應的標註數據訓練模型。模型上線後,主要負責判斷待審內容是否命中這些預設類別。

但企業真正需要判斷的往往不是這個內容屬於什麼類別,而是按照當前業務規則,這段內容是否應當受到限制:同樣是暴力內容,新聞平臺可能允許正常報道戰爭,兒童類產品則連輕微打鬥畫面都需要攔截。這就導致,企業每次調整審核規則或進入新的業務場景時,原有分類標準可能不再適用,需要重新設計標籤或者補充訓練數據,必要時甚至要再次微調模型。此外,文本和圖片通常由兩套獨立模型分別審核,由此導致了不同模型判斷尺度不一致,讓企業需要同時維護多套審核系統,承擔更高的部署與運維成本。

Shieldstral 的核心解法,是把不同來源的安全數據統一成相同的格式:自然語言審核規則+待審內容→是否命中規則(yes/no),以此訓練模型學習規則與內容之間的語義匹配關係。▎這個審核公式由三個可配置字段組成::規定審核場景和判斷尺度;:提出本次需要檢查的具體問題;:提供待審核的文本、圖片或圖文混合內容。模型根據這三部分信息,判斷待審內容是否符合當前規則,最終在 yes 和 no 之間作答。系統還可以提取兩個 token 的輸出概率,經過歸一化得到 0 — 1 之間的連續分數,再結合業務閾值決定放行、攔截或人工複核。

例如, 為:面向新聞平臺,僅攔截直接呈現傷亡、血腥細節的內容,正常戰事報道無需限制; 為:這段內容是否包含需要攔截的血腥暴力細節?:如果內容僅描述坦克、炮彈等武器裝備,模型會輸出 no;當內容出現明確的傷亡、血腥細節時,才會輸出 yes。這種設計帶來的好處是,規則靈活可調,企業可以直接在推理階段用自然語言修改審核問題和判定尺度,並不需要為每次規則變更重新訓練分類器;而多模態的統一,則讓同一套模型、同一套規則覆蓋文本和圖像內容,保證判定尺度一致。單 token 輸出的設計也可以讓推理鏈路更簡潔,提升審核系統的響應速度與吞吐效率。

02讓模型識規則,而非貼標籤只把審核任務統一成 Yes / No 判斷題,並不足以讓模型真正學會按規則判斷。因為如果訓練數據始終只是危險內容回答 yes,安全內容回答 no,模型可能會形成簡單的判斷捷徑:只要發現內容整體上存在風險,就直接回答 yes,不去分析它具體命中了哪一條具體規則。因此,Shieldstral 改變了訓練數據的構造方式,重點訓練模型區分內容與規則之間匹配關係的能力。其中一個關鍵環節是對比式訓練:通過內容不變,問題改變的形式,讓模型在不同規則下給出不同答案。▎例如,對於一段描述非法拘禁的內容:面對“是否涉及非法拘禁?”時,模型需回答 yes;面對“是否包含種族仇恨?

”或“是否提供製造武器的方法?”時,答案則是 no。通過這種訓練,模型就不能只根據“這段內容看起來危險”來作答,必須理解當前問題要求檢查的風險類型,並判斷內容是否真正符合這條規則。為了進一步強化模型對相近規則的區分能力,訓練數據還會加入許多語義相近、但實際屬於不同類別的樣本。比如,非法拘禁、身體傷害、威脅和騷擾都屬於“暴力”相關的風險領域,但它們對應的行為並不相同。模型需要根據問題判斷內容究竟命中了哪一類規則,以及沒有命中哪些相近規則。打個比方。如果輸入的內容為:把某人鎖在房間裡,不讓其離開。問題 A:這是否涉及非法拘禁?答案輸出為:yes問題 B:是否描述了造成身體傷害?

答案輸出為:no在此基礎上,團隊建立了一個包含 11 個上層類別和 73 個葉子類別的訓練分類體系,並據此生成約 440 萬條合成對比文本樣本,用於補充公開數據中細分類別不足、相近規則邊界不清的問題。據 Shieldstral 官方論文的消融實驗顯示,在細粒度規則驗證集上僅使用公開安全數據時,F1 為 61.1%;加入合成對比數據後,F1 提升到 84.4%,提高了 23.3 個百分點。也就是說,Shieldstral 通過訓練得到的不單單是識別內容風險的能力,更重要的是掌握判斷內容與當前規則是否匹配的語義理解能力。03視覺訓練:讓模型看懂圖片文本審核場景的問題解決了。

但在真實業務中,廣告圖片、用戶上傳的實拍照片、海報以及表情包等視覺內容,同樣需要納入安全管控。然而,視覺訓練有其天然難點:違規圖像樣本非常稀缺,同時人工標註成本高昂,圖片也無法像文本那樣通過大模型低成本批量生成違規內容。因此,Shieldstral 需要同時解決兩個問題:第一,如何讓圖片和圖文內容參與到訓練當中,並做到“規則—內容”精準匹配。第二,如何讓模型看到足夠多、足夠豐富的圖片,彌補違規圖片數據不足的問題;針對第一個問題,團隊沒有主要依靠改圖來擴充樣本進行訓練,而是重點增加規則問題的多樣性。

Shieldstral 團隊圍繞暴力、仇恨和違法內容等視覺風險類別,生成了約 2000 種不同措辭的審核問題。同一類規則可以用不同方式表達,其中約 30% 的問題採用反向問法:例如“這張圖片是否不包含暴力內容?”。這種做法的目的是減少模型對固定句式和關鍵詞的依賴,使它更關注規則本身的語義。在數據來源上,團隊同時使用了三類圖片:違規圖片、乾淨圖片,以及通用圖像分類和目標檢測數據。違規圖片用於提供正樣本;乾淨圖片和通用圖像數據則提供大量安全的負樣本。比如輸入一張普通街景圖片,可以與“這張圖片是否包含暴力內容?” 組成一個 no 的樣本。

為了讓模型進一步區分相近的視覺風險,數據管線還會構造困難負樣本。▎例如,一張圖片可能呈現激烈爭執,卻沒有明確展示身體傷害,模型面對下面的問題時,應當回答 no::這張圖片是否包含身體傷害?:no這樣,即使圖片數量有限,模型仍然能通過學習具體的樣本來接觸到大量不同場景、不同構圖和不同視覺內容的圖片。不過,自動整合視覺數據也可能引入新的錯誤,例如原始標籤不準確、生成的問題與圖片不匹配,或者圖片本身不足以支持明確的 yes / no 判斷。因此,Shieldstral 使用視覺語言重排序模型,對每組“圖片—規則問題”進行復核,過濾標籤錯誤、圖文不一致以及生成質量不可靠的樣本。

對於困難負樣本,團隊也會再次進行篩選,以確保它們確實屬於“語義相近但規則不匹配”的案例。經過這些處理,Shieldstral 最終構建了約 450 萬條多模態訓練樣本。它們與文本數據共同納入同一審核框架,使模型能夠統一處理三類輸入:純文本、純圖片,以及圖文混合內容。04HarmBench 99.4%!從主流安全評測基準的結果來看,Shieldstral 的規則自適應範式已經得到了效果層面的驗證,小參數量模型實現了對標大模型的審核精度。官方發佈的 Hugging Face 頁面顯示,文本安全場景中,模型在提示詞分類與回覆分類兩大核心賽道均名列前茅。

提示詞審核維度,HarmBench 測試 F1 值達到 99.4%,顯著優於 GPT-OSS-Safeguard-20B、LlamaGuard-4-12B 等參數量數倍於自身的方案;WildGuardTest 基準 F1 值達 88.1%,與體量接近 7 倍的 GPT-OSS-Safeguard-20B 基本持平。拒識檢測場景下,模型在 XSTest 基準 F1 值達 94.6%,對越獄類風險內容具備可靠的識別能力。多模態安全場景中,Shieldstral 的性能優勢更為突出。VLGuard 基準 F1 值達到 97.

7%,位列榜單第一,大幅領先 OmniGuard-7B、LlavaGuard-7B 等所有參數量更大的對比模型;UnsafeBench 基準 F1 值達 81.8%,領先第二名接近 10 個百分點。05小模型也能實現高精度總的來說,Shieldstral 承擔的是審核流程中最核心也最難標準化的一步:理解當前規則,並判斷待審核內容是否符合這條規則。這種設計讓模型保持了相對穩定的能力邊界。無論審核對象是文字、圖片,還是圖文組合,模型都採用統一的判斷邏輯;當審核規則發生變化時,也不必立即將每項變化寫入模型參數。當然,Shieldstral 並不負責完成整個內容治理流程。

由於它定位於輕量級規則判斷模型,風險分數如何解釋、閾值如何設置,以及最終採取放行、攔截還是人工複核,仍然需要由具體業務系統根據實際場景決定。但客觀來說,Shieldstral 通過將內容審核轉化為自然語言規則與待審核內容之間的匹配問題,展示了其在垂直場景中的潛力。它代表的是小參數專業模型用更輕量靈活的設計思路,實現媲美大模型的細粒度、多模態安全判別能力。參考鏈接:https://mistral.ai/news/shieldstral/https://huggingface.co/mistralai/Shieldstral-1.0-3Bhttps://arxiv.org/pdf/2607.

25857上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛