最新安全評估報告:GPT、Claude五款模型集體作弊,GPT-5.4比例最高
重點摘要
智東西 編譯 | 茄子 編輯 | 程茜 智東西7月23日報道,7月21日,英國AI安全研究所(AISI)對OpenAI和Anthropic的五款前沿模型進行網絡安全能力評估時發現,所有測試模型都存在“作弊”行為。 其中,GPT-5.4嘗試作弊的比例最高,達到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7嘗試作弊的比例達到9.
智東西 編譯 | 茄子 編輯 | 程茜 智東西7月23日報道,7月21日,英國AI安全研究所(AISI)對OpenAI和Anthropic的五款前沿模型進行網絡安全能力評估時發現,所有測試模型都存在“作弊”行為。
Anthropic的Claude Opus 4.
1%,Claude Mythos Preview的嘗試作弊的佔比最低,但也達到了7.
▲測試模型在網絡安全評測中的作弊嘗試頻次 AISI將一類行為定義為“作弊”:模型超出任務範圍,或違反測試規則來達成目標。
例如,通過聯網搜索已有答案、攻擊非目標系統、或探測評估軟件漏洞來繞過任務規則等。
此外,當研究人員詢問模型是否採取違規操作時,模型並不總是如實承認。
而且,即使讓模型自我檢查,或者研究人員分析其思維鏈(chain-of-thought),也無法完全識別作弊行為。
AISI稱,模型出現作弊行為,並不等於它有類似人類的欺騙意圖。
但這類行為可能影響AI能力評估的可靠性。
Related
相關文章

理想主義者梁文鋒:剋制與野心並不相悖,願景和現實卻難彌合
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

Kimi,“等芯來”
Kimi K3模型因算力不足暫停新用戶接入,顯示出國產大模型在算力供給上的嚴峻挑戰。儘管Kimi K3在技術上表現優異,甚至超越部分美國前沿模型,但算力緊缺已影響其商業變現與用戶體驗。Kimi正積極尋找算力資源並計劃融資,同時國產算力硬體也在加速進化,以滿足大模型需求。

Kimi K3有多火,月之暗面的算力和資本就有多急
月之暗面因Kimi K3模型技術突破及商業化爆發,計劃8月啟動Pre-IPO融資,目標估值500億美元,最快6個月內登陸港股。K3上線後用戶請求量暴增,導致算力極限承壓,公司暫停C端新用戶訂閱。資本方急於將估值暴漲的帳面浮盈變現,老股轉讓與搶份額並存,上市時程從不急轉為倒數計時。

42頁交流會實錄背後:梁文鋒沒說的另一半故事
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

AI行業告別“最強模型”崇拜
AI行業告別“最強模型”崇拜明晰野望2026.07.23 16:31 · 來自河北全文4693字00:00 / 12:19大模型競爭要件正在改變。文 | 明晰野望美股AI交易近日再度遭遇“DeepSeek時刻”。7月17日凌晨,月之暗面發佈新一代旗艦模型——Kimi K3。這個2.

指控蒸餾的這一週,美國公司在 Kimi 上煉丹
美國公司遭到指控,涉嫌在中國人工智慧平台Kimi上進行模型蒸餾(煉丹),試圖複製其核心能力,引發技術倫理與服務條款爭議。相關平台主動移除混入的模型思考文字,此事凸顯跨國AI服務在技術使用規範與智慧財產權保護上的潛在摩擦。