SIRF把平臺規則寫入權重

2026年9月14日 00:00
站內 AI 整理稿

一項最新發表的學術研究提出名為 SIRF 的內容風控模型,試圖從根本上改變平台內容審核的運作邏輯。該模型的核心概念,是將過去仰賴外部規則庫的審核機制,直接「寫入」模型內部的權重參數,使審核判斷不再需要反覆查閱繁瑣的政策條文,而是由模型本身在運算過程中直接產出合規決策。這項設計瞄準的是當前內容審核系統普遍面臨的規則維護成本高昂、延遲難以壓低,以及大規模部署時效率不彰等痛點。傳統的平台內容審核多半採用「規則引擎」搭配機器學習分類器的混合架構。平台必須持續更新數十甚至上百條審核規則,對應不同的違規類型與情境,同時還得維護外部規則庫與模型之間的同步。

每當政策調整,工程團隊就必須重新配置規則,並重新訓練或微調分類模型,整個流程耗時費力,且容易在規則衝突或邊界案例中出現漏判或誤判。此外,外部規則庫的查詢也增加系統延遲,對於即時性要求極高的直播或社群動態而言,往往難以在秒級時間內完成審核。SIRF 的設計邏輯正好試圖繞過這些瓶頸。研究團隊採用「繼續預訓練」(continued pre-training)的方式,將平台的內容規範與審核政策內化到模型的參數之中。換句話說,模型在訓練階段就已經學習了平台希望執行的所有規則,因此在推論階段,它能夠直接根據內部參數的權重來判斷內容是否違規,無需再向外部規則庫發出查詢請求。

這樣的架構不僅大幅降低系統延遲,也讓審核流程變得更為簡潔,同時減少因規則庫更新不及而導致的時效性問題。根據該研究公開的實驗數據,SIRF 在效能上展現出顯著優勢。其中以 SIRF-8B-SFT 版本為例,在 P95 條件下對黑樣本的召回率達到 71.3%,比對照的基線模型高出 15.1 個百分點。所謂 P95 條件,通常代表系統在處理最耗時的 5% 請求時仍能維持一定的效能表現,這段數值反映出模型在嚴苛延遲限制下的實際召回能力。換句話說,即使在網路擁塞或系統負載較高的情況下,SIRF 仍然能夠在秒級時間內辨識出絕大多數的違規內容,對於需要即時反應的審核場景極具實戰價值。

值得一提的是,該研究特別強調了「少誤罰恢復」機制的設計。內容審核系統最怕誤判,過高的誤報率不僅影響正常用戶的體驗,還可能引發申訴與糾紛。SIRF 模型在架構中加入了快速修正的通道,一旦模型判斷出現錯誤,系統能夠在短時間內調整並恢復正確的審核結果,從而降低對一般用戶的負面影響。這項機制對於維持平台生態的公平性與信任感至關重要,也讓 SIRF 在追求高召回率的同時,不至於犧牲精準度與用戶權益。整體而言,SIRF 定位在即時性與召回率並重的內容審核場景,為平台提供一條兼顧效率與準確性的新路徑。

相較於傳統方法需要持續投入人力維護規則庫、反覆調整模型閾值,SIRF 的「內化規則」策略有望大幅降低營運成本,同時提升審核反應速度。尤其對於大型社群平台或短影音平台而言,每天需要處理數以億計的用戶生成內容,任何能夠在秒級時間內完成判斷且維持高檢出率的技術,都可能成為內容安全體系的關鍵支柱。不過,研究團隊也在論文中坦承,這類將規則直接寫入模型權重的做法仍有其挑戰。例如,當平台政策需要頻繁更新時,模型必須重新進行繼續預訓練或微調,才能納入新規範,無法像傳統規則庫那樣即時修改。

此外,模型的可解釋性也是一大課題——當審核決策完全由模型內部參數驅動時,平台難以清楚追溯判斷的依據,這在監管合規與用戶申訴環節可能引發新的問題。儘管如此,SIRF 的出現仍為內容審核技術提供了一個全新方向,也讓業界開始思考:未來是否有機會將更多高複雜度的規則直接編碼進模型之中,徹底告別傳統規則引擎時代。這項研究目前已透過論文形式公開,相關模型設定與實驗數據均可在學術平台上查閱。隨著內容審核需求持續增長,SIRF 所代表的「規則參數化」路線,後續是否能真正落地到主流平台,並克服政策更新與可解釋性等障礙,將是學術界與產業界共同關注的焦點。

對於長期被審核效率與準確性矛盾所困擾的平台營運者而言,這篇論文無疑提供了一個值得深入探索的技術解方。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

10 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

12 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

13 小時前