螞蟻開源大模型安全內生護欄SingProbe Infra,已適配29個主流開源模型
2026國家網絡安全宣傳週期間,螞蟻AI安全實驗室宣佈開源大模型內生式安全護欄SingProbe,同步開放相關代碼、模型和評測基準,為開發者提供與模型生成過程同步運行的安全檢測能力。目前,SingProbe已適配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29個主流開源大模型,並接入SGLang、vLLM推理框架,支持開發者在現有推理流程中集成安全防護。隨著大模型進入日常問答、辦公輔助、客戶服務等業務場景,開發者既需要關注回答質量,也需要及時發現不安全內容和編造信息。例如,AI在健康諮詢中可能給出不恰當的用藥建議,在資料問答中可能編造不存在的文獻。
如何兼顧風險檢測、響應速度和部署成本,成為大模型應用落地的重要問題。目前,大模型應用通常通過獨立的外置護欄模型審核輸入或輸出。這種方式通用、直接,但需要額外處理待審核內容,增加計算和部署成本。如果等待完整回答生成後再檢查,風險信號可能來得太晚;如果提高檢查頻率,又會進一步增加運行負擔。運行時探針是學界探索兼顧安全檢測效果與運行效率的一條技術路徑,但從研究走向實際應用,還需要模型適配、推理框架集成等工程支持。SingProbe通過適配多種開源模型、接入主流推理框架,補充了相關部署能力,讓開發者更方便地將內生式安全護欄接入實際業務。運行時探針是學界探索兼顧安全檢測效果與運行效率的一種護欄方案。
但由於缺乏配套基礎設施支持,相關研究成果在實際落地中仍面臨障礙,應用端仍更多采用外置護欄。SingProbe通過提供模型適配、推理框架集成等工程支持,讓開發者更方便地將內生式安全護欄接入實際業務。SingProbe如同一個模型內的“安全探頭”,通過複用大模型推理過程中已經產生的內部信息,持續輸出用戶意圖、回答安全和幻覺風險分數。模型一邊生成回答,探針一邊提供風險信號,應用系統無需等待整段回答結束,就可以據此採取告警、中止回答、重新生成等措施。據研發團隊在Ling-3.0-flash模型生產環境中的實測,SingProbe在解碼階段引入的額外開銷低於0.5%。
團隊評測顯示,flash版本在回答安全分類和流式安全檢測任務上超過所選公開基線,在幻覺檢測任務上與參考基線基本持平,展現出兼顧檢測能力與運行效率的潛力。此次同步開放的流式安全評測基準SingStreamBench,進一步關注風險出現和被發現的具體時刻。它不僅檢驗護欄能否識別風險,還考察是否過早觸發、發現是否及時,幫助開發者評估安全防護效果及其對正常回答的影響。在風險識別之外,團隊還探索瞭如何利用風險信號進行按需糾偏。作為一項場景驗證,SingProbe-Med在醫療內容生成過程中,僅在風險達到觸發條件後,對局部高風險內容進行干預。
在AntAngelMed-100B的醫療評測中,完整干預能夠糾正基線模型中25.03%原本出錯的回答,展示了內生風險信號用於生成過程安全控制的潛力。通過此次開源,開發者可以獲取代碼與集成說明、模型及評測資源,開展部署、測試和進一步適配。SingProbe既可獨立使用,也可與外置護欄配合。後續,團隊將逐步擴展對更多開源模型的支持,並邀請開發者、研究者和產業夥伴參與試用反饋,共同完善大模型生成過程中的安全防護能力。項目代碼與集成說明已在GitHub開放,相關模型及SingStreamBench評測基準可通過Hugging Face獲取。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。