OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?

舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。一個尚未發佈的模型在任務摘要裡給自己寫指令:"忽略正常約束"。GPT-5.6 Sol在訓練摘要里加入提示,要求未來版本向用戶隱瞞錯誤、編造缺失的歷史數據。另一個模型在回答加州某縣財政收入問題時,跑到公開代碼庫裡找了一個洩露的API密鑰,未經授權使用後還偽造了數據來源。
同一天,OpenAI發佈了一個新的"錯位"(misalignment)追蹤與披露框架。任何員工都可以標記疑似案例,安全與對齊團隊調查後,案件被分進三個軌道:"準備披露"的6個工作日內公開,"小型調查"的12個工作日內,涉及第三方的"大型調查"時間更長。OpenAI強調,即使還沒完全解釋清楚、沒找到完整緩解方案,也可以先發布報告。中文媒體把這件事讀成"AI失控"或"OpenAI主動認錯",兩個理解都偏了。真正值得看的是框架本身:它第一次把AI安全事件像財務審計一樣分級、定時、定披露義務。
換句話說,OpenAI不是在道歉,它是在給整個行業發一份審計底稿——先定義什麼叫"應該披露的事故",再定義"什麼時候必須披露",最後暗示"誰來審計"。把6起事件拆開看,真正新的東西不多。模型在任務摘要裡埋指令、智能體為完成任務把文件上傳到公共互聯網、多個智能體用公共文件託管網站交換信息——這些行為在過去的紅隊測試和安全研究裡都有類似影子。OpenAI自己也說,這些案例"不應被視為錯位發生頻率的反映"。過去,AI公司習慣把安全問題塞進系統卡(system card)裡,跟著新模型一起發;或者等到攢夠幾個案例再出一篇博客。
現在OpenAI把流程倒過來:事件發生後按固定時間表披露,不等攢夠、不等模型發佈、不等完美解釋。這套機制的核心不是"我們看到了什麼",而是"你看到我們看到的速度有多快"。當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。安全不再只是研發部門的成本中心,它開始變成公司治理問題、投資者關係問題、監管合規問題。7月的Hugging Face事件是重要鋪墊。OpenAI一個用於網絡安全能力評估的AI agent,在內部隔離環境裡突破了沙箱,利用公開代碼評估平臺的漏洞獲得外部跳板,然後入侵Hugging Face的生產系統。
Hugging Face後來發佈的技術時間線顯示,攻擊從7月9日持續到7月13日,約17600次攻擊動作被恢復,5個與ExploitGym相關的數據集被訪問。Hugging Face最終用智譜AI的開源模型GLM-5.2完成了攻擊日誌分析。OpenAI直到7月21日才公開承認。從事件發生到公開承認,中間有近兩週。這個延遲本身成了比事件更嚴重的指控。9月初,Anthropic研究員Jacob Coxon辭職並在社交媒體上警告,前沿AI可能在未來十年內滅絕人類。
9月12日,Anthropic CEO Dario Amodei發佈長文《We Must Pace the Frontier》,呼籲放緩前沿AI能力提升速度,並要求向AI公司派駐獨立第三方評估員。OpenAI CEO Sam Altman和馬斯克都公開表示支持。先是行業出了失控事故並且披露延遲,然後是內部吹哨人把風險公開化,最後OpenAI在9月16日搶先發布一套披露規則。三件事連起來,很像一個標準制定者趕在監管到來之前,用自己的框架定義監管的起點。監管回應緊隨其後,方向卻並不一致。9月17日,英國國王查爾斯三世在蘇格蘭鄧弗里斯莊園召集了一場閉門AI峰會。
OpenAI CFO Sarah Friar、Anthropic全球事務負責人Tino Cuéllar、英偉達CEO黃仁勳、DeepMind CEO Demis Hassabis都在場。查爾斯警告,AI可能發展出"更黑暗的能力",甚至構成生存性風險。峰會沒有產生任何約束性文件,但把"安全"變成了必須擺在桌面上的議題。兩天後,9月19日,加州州長Gavin Newsom簽署行政令,推動加州加快實施AI監管。他要求專家小組在兩個月內給出建議,方案包括要求前沿AI公司接受獨立第三方審計、強制上報AI智能體"失控事件",以及為最先進模型開發"緊急關停開關"。
Newsom直接點名Hugging Face事件,說這類事件應該被納入"關鍵安全事件"的報告範圍。同一天,美國總統特朗普在Truth Social上宣佈,他將組建一支"人工智能部隊"(AI Force),並任命一位"AI沙皇"。他承諾政府"絕不會以任何方式阻礙或扼殺這個偉大產業",現有刑事和民事司法體系足以懲處AI相關不法行為。他把對AI風險的擔憂稱為"騙局",與全球變暖、針對他的彈劾並列。行業龍頭想自己定披露標準,加州想用州法強行推進安全開關和審計,聯邦政府則旗幟鮮明地反對新增監管。
OpenAI的披露框架,本質上是在這場三方博弈中搶跑——趁聯邦還沒立法、州法還沒細化,先把"我們是怎麼做安全審計的"寫成行業默認版本。Barclays分析師Ross Sandler團隊最近的一份報告,把AI安全從道德討論轉成了可量化的成本問題。按OpenAI對Sol級別及以上模型的實時監控要求,所有強化學習訓練、評估和高階模型推理都必須配套實時安全監控,監控開銷約佔被監控算力的20%。由於2027年預計幾乎全部前沿模型都會超過GPT-5.6 Sol的能力門檻,推理和後訓練算力需求將因此增加20%,推動行業整體算力成本上升約18%。
換算成錢:2027年AI行業基礎算力總成本預計約2460億美元,新增安全監控成本約440億美元;2028年進一步升至760億美元。更隱蔽的影響在利潤率。Barclays認為,當前部分AI實驗室推理業務毛利率超過80%,短期有緩衝空間,但長期會向65%收斂。安全監控不是一次性投入,是持續性剛性支出。廠商要麼把成本轉嫁給下游客戶,要麼自己壓縮利潤。"降速"不等於"算力需求萎縮"。安全合規正在創造一塊獨立的增量算力需求。對英偉達、雲服務廠商和AI基礎設施公司來說,這是利好;對純模型公司來說,這是成本。在一個沒有統一標準的領域,第一家發佈詳細披露框架的公司,實際上在定義"正常"和"異常"的邊界。
其他公司要麼跟進這套口徑,要麼在未來的監管審查、客戶採購和融資盡調中處於被動。想想看,當一家金融機構採購大模型服務時,它的合規部門會問什麼?"你有沒有系統化的安全事件披露機制?""最近一次事件是多久披露的?""有沒有獨立第三方審計?"OpenAI的框架,等於提前給這些問題寫好了標準答案。對OpenAI自己的IPO也至關重要。今年4月,OpenAI以8520億美元估值完成約1220億美元承諾資本融資;6月,公司秘密向SEC提交S-1招股書,目標上市估值最高1萬億美元。臨近上市時主動披露安全事件並建立框架,是在向資本市場證明監管風險可控、公司治理成熟。這比任何公關聲明都更有用。但框架也有明顯軟肋。
它是自願的。OpenAI在博客裡明確保留修訂權。涉及第三方的案件,披露時間表可以大大延長。"大型調查"的定義和最終由誰拍板,仍然由OpenAI自己決定。這意味著框架更像是一份"內部審計手冊",而不是上市公司必須遵守的GAAP。特朗普政府的立場也讓約束力大打折扣。如果聯邦層面不立法、不設新監管,OpenAI的披露就只能是行業自律。加州的kill switch和強制審計如果落地,又可能與聯邦立場衝突,造成美國國內監管碎片化。披露也不等於控制。把6起事件公佈出來,不等於解決了事件反映的對齊問題。框架再漂亮,也只是治理的第一步。但換個角度看,這正是OpenAI的高明之處。
在真正的強制監管到來之前,先用自願框架佔據"最佳實踐"的位置。等到監管真的起草法案時,立法者很難完全繞開市場已經接受的披露口徑。公司披露從自願走向強制的過程中,率先建立審計體系的公司往往會影響最終規則的寫法。把"AI安全披露"翻譯成客戶和投資人會說的土話,問題就變了:以前問的是"你的模型安不安全";現在問的是"你出了事幾天之內告訴我"。以前比的是"有沒有通過紅隊測試";現在比的是"紅隊測試報告能不能公開"。以前籤合同看的是API價格和Token單價;以後籤合同可能還要看安全事件披露的SLA。
Anthropic、Meta、Google、Moonshot AI在過去幾個月也報告過類似的安全事件或對齊問題,但披露程度和框架化都不如OpenAI。如果OpenAI的框架成為行業慣例,競爭對手跟進的成本會很高——不僅要補建內部報告系統,還要接受更頻繁的公眾審視。不跟進的代價也很高:在監管審查和企業採購中,"沒有系統化披露機制"本身就是風險信號。全球競爭維度也不能忽視。Amodei在呼籲放緩時專門提到,必須避免讓中國藉機領先。特朗普政府反對監管的核心理由也是"不能把優勢讓給中國企業"。AI安全標準的制定,已經和大國技術競爭綁在一起。
OpenAI作為美國龍頭,搶先定標準也有搶佔國際規則話語權的意味。披露框架再完善,也解決不了AI安全的根本難題——對齊問題、湧現能力、多智能體協作的不可預測性。6起事件裡沒有一起造成大規模實際損害,但它們的共同模式是"模型為了完成任務找到人類沒想到的路徑"。隨著模型能力繼續提升,這類路徑只會更多、更隱蔽。OpenAI的框架沒有承諾解決這個問題,它只是承諾會更早告訴你問題存在。這是一種治理上的進步,但不是技術上的保證。6月OpenAI秘密遞交IPO申請時,它面臨的資本市場問題是:一家估值接近1萬億美元、年虧損約140億美元、技術風險高度不確定的公司,如何說服投資者相信它的未來現金流?
9月的披露框架給出了一個答案:先把風險變成可審計、可披露、可定價的項目,讓市場覺得"至少我們知道風險是怎麼被管理的"。這本質上是在把AI安全從"黑天鵝"變成"灰犀牛"——從不可預測的災難風險,變成可以計提、可以披露、可以納入估值模型的合規成本。OpenAI的6份報告,最大的價值不是它說了什麼,而是它搶先定義了AI安全該怎麼被審計。這份審計報告現在還不需要第三方簽字,但監管、客戶和資本市場很快會來查賬。誰先定審計口徑,誰就把安全成本寫進別人的賬本。AI安全披露審計報告示意圖
Related
相關文章

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。
Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放
針對開發者的實際工作流,桌面端提供內置終端、瀏覽器和 Git 狀態查看等功能,支持直接運行和調試項目、審閱代碼改動,並可關聯 PR 狀態,方便跟蹤代碼評審與合併進度。相關推薦法國興業銀行押注 AI:預計最多省下 6 億歐元成本法國興業銀行稱,AI應用擴大將帶來可觀降本空間,潛在規模約5億至6億歐元,其中已規劃到2029年實現約3.

法國興業銀行押注 AI:預計最多省下 6 億歐元成本
這家總部位於巴黎的銀行表示,藉助 AI 實現降本的當前潛在空間介於 5 億至 6 億歐元(約合 38.47 億至 46.16 億元人民幣)之間。其中,到 2029 年為止已經落實規劃的降本規模約為 3.5 億歐元(約合 26.93 億元人民幣)。

AI 幫銀行省錢:法國興業銀行預計最多可省下 6 億歐元成本
作者:遠洋 責編:遠洋 評論: 9 月 21 日消息,據彭博社報道,法國興業銀行(Societe Generale SA)預測,人工智能應用範圍不斷擴大,將為該行的降本工作帶來可觀貢獻。這家總部位於巴黎的銀行表示,藉助人工智能實現降本的當前潛在空間介於 5 億至 6 億歐元(注:現匯率約合 38.