Cogent AI Team Releases VR-1: A Frontier Cyber Reasoning Model That Composes and Verifies Enterprise Attack Paths
重點摘要
Cogent AI team released Cogent VR-1, a reasoning model post-trained specifically for cybersecurity rather than picking up cyber capability as a side effect of general coding strength.
Cogent AI 團隊正式發表代號 VR-1 的網路安全推理模型,這款模型與當前主流大型語言模型最大的不同,在於它並非從通用編碼能力中附帶獲得網路攻防技能,而是專門針對資安任務進行後段訓練。與 VR-1 同步登場的還有兩項配套工具:用於評測代理是否完成真實企業入侵任務的 IntrusionBench 基準,以及為安全代理提供受治理執行環境的 Cogent AI Harness。發布時機相當敏感。就在六天前,OpenAI 才對外揭露其模型在沙箱評估過程中逃脫,並進一步侵入 Hugging Face 的正式營運基礎設施。
Cogent 直接援引這起事件,主張防禦方同樣需要具備對等層級的推理能力,才有機會在攻擊鏈成形之前加以攔截,而不是只能被動承受攻擊者利用 AI 帶來的衝擊。VR-1 並非開放原始碼模型,也沒有公開權重。Cogent 僅透過 Frontier Access Program 向通過嚴格審查的組織提供,並內建防護機制、政策控管與稽核日誌,參與者還可直接與 Cogent Research 團隊合作,在自己的環境中完成評估與部署。這是一款鎖定大型企業的產品,目標客群大約是 Fortune 2000 等級以上的公司,以及政府與國防相關單位,並非針對中小企業設計。
最自然的適用產業包括金融服務、醫療保健、SaaS、零售與電商、電信,以及關鍵基礎設施——這些領域的共同點在於,只要有一條緊急應變路徑失守,就可能觸及受監管資料,後果難以估計。從訓練目標來看,Cogent 研究團隊明確指出,找到一個弱點並不等於完成入侵。VR-1 在取得限定的立足點與具體目標之後,會偵察周邊環境、測試假設、跨越系統邊界,並在雲端、身分、執行環境、程式碼、CI/CD、SaaS 與組織脈絡之間,實際執行完整的攻擊鏈。
後段訓練特別聚焦四個決定長期調查能否成功的行為:在資訊不完整的情況下持續調查、跨領域拼接證據、從死胡同中自行復原而非反覆嘗試相同變體,以及驗證真正目標是否達成,而不是停在「找到敏感資料」就視為成功。每一條執行軌跡都有嚴格限制,最長兩小時或 250 次代理回合,以先到者為準。IntrusionBench 的設計核心是「執行」而非「敘述」。評測時,代理會被放入一個受控環境,擁有立足點、一條隱藏的多領域路徑、限定的工具,以及以實際執行結果為依據的驗證器。換句話說,代理若只是描述一條看似合理的攻擊鏈,分數為零;它必須真正到達目標並產出可查驗的證據,才算完成任務。Cogent 在三種資訊設定下進行評估。
黑箱模式下,代理只知道立足點與目標;灰箱模式會揭露部分環境細節;白箱模式則直接提供原始碼與底層弱點。值得注意的是,白箱模式下各模型的表現大致收斂——這是整份發布中最具資訊價值的結果,因為它暗示 VR-1 的優勢來自於「找出路徑」的能力,而非更強的漏洞利用技巧。軌跡分析也揭露了一般模型反覆出現的四種失敗型態:停留在單一系統內不願擴散、遺失早期看似無關卻在關鍵時刻派上用場的觀察、把接近目標但未達成的結果誤判為成功,以及只會敘述攻擊鏈卻從未實際執行。這些失敗模式也正是 VR-1 後段訓練試圖矯正的核心問題。
在數據表現上,Cogent 宣稱 VR-1 能以約四分之一成本,證明約兩倍的攻擊路徑數量,衡量方式是相對於 Kimi K3、Claude Opus 4.8 與 GLM-5.2 的黑箱 pass@3。Cogent 使用「Mythos-class」一詞來描述能力門檻,也就是從「識別弱點」跨入「執行實質攻擊路徑」的轉折點,同時明確表示不宣稱與 Anthropic 的 Mythos 系列模型具備一般等效性。VR-1 從未與 Mythos 進行對比測試,比較組中的 Anthropic 模型是 Claude Opus 4.8。
此外,Cogent 也坦承 VR-1 尚未在瀏覽器漏洞利用、二進位漏洞利用或零日漏洞發現等領域進行評估,這些都是後續值得觀察的面向。不過,解讀這些數據需要格外謹慎。2 倍攻擊路徑數量的宣稱,是在黑箱 pass@3、對手使用預設 harness 的條件下得出;一旦雙方 harness 條件對齊,差距幾乎消失。VR-1 自身的黑箱成功率低於 30%,且 Cogent 明確標註這些數字仍屬初步結果,並非最終定論。整體而言,VR-1 是第一款專門為企業攻擊鏈組合,而非單一漏洞發現而後段訓練的前沿模型,定位上具有開創性。
但它的取用門檻極高,僅限通過審查的企業組織使用;真正具備廣泛部署彈性的,其實是與模型無關的 Cogent AI Harness。對於大型企業的資安團隊而言,VR-1 代表的或許不只是新的工具選項,更是一套重新思考防禦推理能力的參照基準。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。