OpenAI 開啟 AI 安全飛輪:GPT-Red 如何重新定義模型魯棒性
重點摘要
AI資訊AI新閒資訊正文OpenAI 開啟 AI 安全飛輪:GPT-Red 如何重新定義模型魯棒性發布於AI新閒資訊時間 :Jul 16, 2026閱讀 :1分鐘在追求更強大 AI 能力的同時,模型如何確保自身安全已成為行業核心命題。近日,OpenAI 發佈了全新的自動化紅隊測試模型 GPT-Red,通過規模化的自博弈訓練,成功將模型在直接提示注入攻擊中的失敗率壓低至0.
OpenAI 近日發布了全新的自動化紅隊測試模型 GPT-Red,這項技術突破象徵著 AI 安全防禦正式步入自動化迭代的階段。透過規模化的自博弈訓練,GPT-Red 成功將模型在直接提示注入攻擊中的失敗率壓低至 0.05%,為 AI 系統在自我強化與安全性提升之間建立了可持續運轉的「飛輪效應」。隨著 AI 系統透過瀏覽器、本地檔案以及各種 API 深度嵌入現實世界,安全邊界已變得比以往更加複雜且脆弱。傳統的紅隊測試雖然在發現漏洞上仍具價值,但其高度依賴人工操作的模式,不僅成本高昂,更難以跟上模型能力指數級增長的速度,也無法產出足夠規模的對抗性資料來強化防禦機制。
OpenAI 推出 GPT-Red 的目標,正是為了解決這項瓶頸。GPT-Red 的核心價值在於它不只能在模型部署前精準定位潛在漏洞,更關鍵的是能夠即時生成大規模的對抗樣本,使模型在訓練階段就開始進行防禦升級,而不是等到上線後才被動修補。這種「在訓練中強化安全」的策略,將安全性內建為模型能力的一部分,而非事後加裝的保護層。GPT-Red 的訓練過程採用了自博弈強化學習策略。在訓練期間,它會與一組多樣化的防禦方模型進行高頻率的對抗攻防,嘗試各種提示詞注入、邏輯誘導等攻擊手法,持續尋找系統破綻。
這種攻防雙方不斷「互搏」的機制,迫使防禦方持續修正策略,而 GPT-Red 也在這場演化競賽中變得越來越犀利。數據顯示,在特定測試場景中,GPT-Red 的攻擊成功率達到了 84%,而人類紅隊成員僅為 13%,顯示出自動化模型在攻擊能力上的顯著優勢。為了驗證這套系統在真實情境中的效果,OpenAI 進行了一系列嚴苛的壓力測試。其中一項實驗針對一款能自主控制自動販賣機的 AI 智能體,GPT-Red 成功模擬出惡意修改商品價格、竊取訂單等攻擊行為,證明即使在複雜的智能體系統中,自動化攻擊模型依然具備極強的滲透力與破壞潛力。
這項案例清楚展現了隨著 AI 智能體自主性提高,安全測試的強度與自動化程度必須同步提升。目前 GPT-Red 已正式整合進生產模型的訓練流程,並直接帶動了最新版本 GPT-5.6Sol 的安全性表現。實驗結果指出,該模型對提示注入展現出極強的抗性,而這項安全強化並未以犧牲通用能力為代價。系統既沒有出現盲目拒絕合法請求的過度防禦現象,也沒有降低任務執行效率,證明了穩健的安全機制可以與優異的效能並存。OpenAI 團隊認為,GPT-Red 的成功驗證了 AI 安全「飛輪效應」的可行性——也就是利用更先進的 AI 系統來建構更安全的未來系統。
當安全測試能自動化、規模化地進行,並且能將對抗經驗直接回饋到模型訓練中,整個安全防護體系就能隨著 AI 能力的增長而不斷自我強化。展望未來,隨著運算規模與資料多樣性持續提升,這套自動化安全測試框架極有可能成為下一代模型開發的標準配備。在模型能力不斷進化的過程中,透過 GPT-Red 這類系統建立起持續性的安全檢驗機制,才能確保 AI 在更廣泛的應用場景中始終保持穩固的防線,而不至於因為能力增強而衍生出無法控制的風險。業界普遍認為,OpenAI 此次推出的自動化紅隊模型不僅是單一產品的進步,更為整個 AI 產業的安全治理提供了新方向。
當人工智慧開始處理越來越多的真實世界任務,從對話互動到操控實體設備,安全測試的自動化與規模化將不再是選項,而是必要條件。GPT-Red 的出現,正是補上這塊關鍵拼圖的重要一步。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。