螞蟻發佈大模型內生式安全護欄SingProbe,讓AI邊生成邊識別風險

2026年9月14日 13:22
站內 AI 整理稿

大模型正在進入日常問答、辦公輔助、客戶服務等真實業務場景。用戶期待AI快速給出有用的回答,也需要這些回答安全、可靠。如何及時發現不安全內容和編造信息,同時減少安全審核對響應速度和用戶體驗的影響,成為大模型應用落地需要解決的問題。國家網絡安全宣傳週期間,螞蟻AI安全實驗室正式發佈大模型內生式安全護欄SingProbe,將安全檢測融入模型生成過程。它如同一個內置的“安全探頭”,讓AI一邊生成回答,一邊輸出風險提示,以較低的額外計算開銷,為大模型應用提供更及時的安全防護。例如,用戶向AI諮詢健康問題時,會關心它是否給出不恰當的用藥建議;使用AI查找資料時,也需要警惕它編造不存在的文獻或事實依據。

面對這些風險,SingProbe能夠在回答生成過程中持續提供風險信號,幫助應用系統及時採取中止回答、重新生成等措施。目前,大模型應用通常通過獨立的外置護欄模型審核輸入或輸出。這種方式通用、直接,但需要額外處理待審核內容,增加計算和部署成本。如果等完整回答生成後再檢查,風險內容可能已經呈現給用戶;如果提高檢查頻率,又會進一步增加運行負擔。SingProbe嘗試讓安全判斷與模型生成同步進行。它複用大模型推理過程中已經產生的內部信息,通過輕量化的安全檢測模塊,持續輸出風險分數。

這意味著,模型在生成回答的同時,就能給出當前內容是否存在安全或事實可靠性風險的信號,供系統及時採取告警、終止生成、重試等措施。據研發團隊在Ling-3.0-flash模型生產環境中的實測,SingProbe在解碼階段引入的額外開銷低於0.5%。團隊評測顯示,flash版本在回答安全分類和流式安全檢測任務上超過所選公開基線,在幻覺檢測任務上與參考基線基本持平,為兼顧檢測能力與運行效率提供了新的技術路徑。針對流式生成場景,此次還同步發佈了評測基準SingStreamBench。

該基準關注模型從正常回答轉向風險內容的具體時刻,不僅檢驗護欄能否發現風險,還考察是否過早觸發、發現是否及時,以更貼近實際應用的方式衡量安全防護效果。在醫療生成場景中,研發團隊進一步探索了從風險識別到按需糾偏的技術應用,提出SingProbe-Med:持續監測生成過程中的醫療風險,僅在達到觸發條件後,對局部高風險內容進行解碼干預。據團隊在AntAngelMed-100B上的醫療評測,完整干預能夠糾正基線模型中25.03%原本出錯的回答,展示了內生風險信號用於生成過程安全控制的潛力。目前,SingProbe已適配Ling-3.0系列、GLM-5.2/5.

3、Qwen、DeepSeekV4等29個主流開源大模型,並接入SGLang、vLLM推理框架,相關代碼、模型和評測基準同步開源。後續,團隊將逐步擴展對更多開源模型的支持,推動安全防護更緊密地融入大模型推理與部署流程。

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

7 分鐘前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

3 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

5 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

7 小時前