都學壞了!奧特曼親手封鎖最強模型Astra,重蹈Mythos覆轍

2026年8月8日 12:43
都學壞了!奧特曼親手封鎖最強模型Astra,重蹈Mythos覆轍
站內 AI 整理稿

唉,趕緊整完快點發布吧。。。Jay 發自 凹非寺 | 公眾號 QbitAI 不er,鬧呢?剛剛,奧特曼發文,宣佈推遲最強模型Astra的發佈。Astra是一個強大的模型,我們正努力讓它向所有用戶開放。我們認為,把強大的模型只提供給少數特定人群使用,並不是一個好的策略。不過,考慮到Astra具備網絡安全方面的能力,我們還需要多花一點時間,以確保能夠安全地開放它。是的,被「囚禁」了,哈哈哈哈(無力)……又要走一遍Mythos的流程。Astra的披露之旅 所以Astra,究竟是個啥?這是OpenAI的最新模型類別,踩在Sol、Terra 和Luna之上。你可以理解為,這是OpenAI的Fable系。

上週,是這隻大怪獸的初次亮相。奧特曼在華盛頓向政府介紹了Astra,重點展示了多個 Agent長時間協同工作的能力,旨在展示該模型在處理複雜項目方面的潛力,比如—— 數學。果然,幾乎是消息出來第二天,OpenAI便官宣了Astra相關的數學突破—— 一次性拿下了10項長期懸而未決的數學與理論計算機科學公開難題,橫跨高維幾何、編碼理論、群論、算子代數、量子複雜度和極值組合學等領域。數學圈直接炸了,一度引起不少數學家驚呼,甚至有人將這一突破定義為「菲爾茨獎」級。還有一個大家懷疑比較多的,就是之前Hugging Face事件。

也是很神了,OpenAI自己公開認領了一項「安全事故」,說自家模型在接受網絡安全測試,不小心(並非)逃出了內部隔離環境,一路闖進了Hugging Face的家門,直接原地開黑。給Hugging Face也是整無語了,只能拿起GLM 5.2自衛。具體是哪個模型,OpenAI當時沒說,但後來不少人將這個鍋丟在了Astra上。這次倒是表態了,說是Astra確實很危險,但跟Hugging Face這茬沒關係嗷。但無論如何吧,也是吊足了大家胃口,雖然沒Mythos那次整那麼神,但也算OpenAI這幾個月來最受矚目的一款模型了吧。誰能想到,又來Mythos那一套啊!!!

OpenAI表示,考慮到Astra網絡安全方面的風險,將暫緩這個模型的發佈。「恐怖如斯」的Astra 所以Astra,到底觸發了什麼?OpenAI專門寫了篇博客,故事是這樣的。過去幾天,OpenAI對Astra進行了最新一輪內部評估。結果顯示,該模型在智能體編碼和網絡安全方面取得了「顯著進展」。結合專家評估意見,公司於昨晚得出結論,無法排除Astra在Preparedness Framework下達到「關鍵(Critical)」級網絡能力的可能性。什麼,你問這串英文是個啥玩意兒。

hmm,簡單來說就是OpenAI於2023年末修的一個「安全警報器」,初衷是為能力進展提供識別指南,並據此規劃應對措施。此前發佈的模型,包括GPT-5.6 Sol,均在前沿網絡能力評估中被評定為「高(High)」級別,從未觸及Critical線。那Critical線在哪?根據OpenAI的定義,一個模型達到Critical的標準是: 能在無人干預的情況下,自主識別並開發針對眾多經過加固的現實世界關鍵系統的全等級功能性零日漏洞利用,或僅憑一個高層目標描述,就能自主設計並執行針對加固目標的端到端新型網絡攻擊策略。Astra基本就是這個級別。

不過,OpenAI也打了補丁,目前Astra的基準測試和評估仍在繼續,初步結果雖然已經差不多實錘,但並不等於已經確認。同時官方澄清,Astra並未參與此前Hugging Face被攻擊事件。基於上述評估,OpenAI已在內部採取以下措施: 1、對高能力模型及相關活動實施更嚴格的安全控制,包括隔離測試環境、限制網絡和工具訪問、增強模型權重保護和加密、部署額外監測與檢測能力、推行沙盒化執行。2、暫停所有尚未達到上述強化安全標準的Astra內部活動。3、在Astra所有智能體應用(含訓練和評估環節)中部署通用風險行為監控,審查模型思維鏈,在高風險活動發生時觸發安全響應並中斷操作。

4、相關政府機構和選定的AI安全組織合作,對Astra進行外部能力測試。5、向第三方測試夥伴提供推薦的安全控制指南,用於安全運行更高風險的評估和工作負載。其實吧,歸根結底就一句話—— 寄了。哈哈!真那麼嚇人?唉,此情此景,我咋總感覺這麼眼熟呢。奧特曼,你這宣發流程,簡直和Mythos 5一模一樣啊。。。今年4月,Anthropic以網絡安全風險為由推遲了其旗艦模型Mythos的公開上線,僅通過「Project Glasswing」計劃向約40家合作伙伴提供訪問權限。

當時奧特曼曾在播客節目中公開批評此舉為「恐懼營銷」,稱這顯然是一種令人難以置信的營銷手段,告訴別人我們造了一顆炸彈,馬上就要扔到頭上了,但公司有一套價值1億美元的地堡可以賣給你。如今同樣的炸彈落到了OpenAI自己頭上。所以為啥又打臉了?業界有觀點認為,「安全威脅敘事」正成為前沿AI公司針對DeepSeek、Kimi等開源模型的競爭策略,當市場普遍接受當前模型確有風險的說法後,公司便能以安全管制為由將開源對手排除出競爭賽道。好消息是,從評論區來看,用戶對這一套說辭並不太買賬,每次涉及安全威脅話題,討論區的質疑聲都佔了多數。

黃仁勳此前在開源倡議書中也指出,對開源模型的攻擊大部分是無稽之談,如果真為安全著想,最好的方式是公開發布、集眾人之力解決問題。誰能想到,OpenAI還是如此執著於打安全牌。。。那還說啥了,等著唄。關於發佈時間,奧特曼在文中表示正在努力讓Astra向所有用戶開放,但未給出新的時間表。求求了,安全管制可以,但至少保證下使用體驗,別閹割著玩。Fable 5大家也看到了,安全邊界做的不好,基本上就只能寫寫代碼,問個生物學問題都能被路由成Opus 4.8。。。唉,趕緊整完快點發布吧。參考鏈接: [1]https://x.

com/sama/status/2085862292311396515 [2]https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

世衛組織發佈重磅報告,呼籲全面升級醫療 AI 研究倫理監管

報告指出,雖然人工智能正在以前所未有的速度重塑健康研究、加速科學發現並改善醫療成果,但在缺乏強有力的倫理防線與監管 oversight 的情況下,AI 醫療研究也可能引入新的風險,從而危及人權、社會公平以及公眾信任。在現有的倫理審查機制方面,世衛組織警告稱,傳統的審查體系往往難以應對人工智能帶來的新型風險,包括算法透明度、偏見、公平性、問責制、隱私保護,以及快速部署 AI 工具可能引發的潛在危害。

1 小時前3500
雷峰網模型更新

蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你;高德地圖成「職場版大眾點評」?回應來了;Muse大火,扎克伯格身價暴漲1700億

要聞提示1.蘋果高管稱不建議給iPhone貼膜!網友:免費換屏幕我就信你2.知情人士:DeepSeek將向聯合國安理會介紹AI風險,月之暗面等中國企業也受邀參會3.高德地圖成“職場版大眾點評”?回應來了4.字節通報二季度違規案例:114名員工被辭退,其中8人被移交司法機關處理5.

2 小時前
量子位模型更新

講真,我沒看出這圖是AI做的,更沒想到是國產AI做的

答案是,都是AI。即便我們把圖片放大,似乎也是找不到以前那種“一眼AI”的細節: 而且啊,這兩張圖片並非出自你以為的Image 2.5之手,實則是來自一個國產AI—— 正是我們之前稱之為“今年WAIC最驚豔的圖”背後的模型,來自商湯科技的SenseNova U1 Pro(下文簡稱U1 Pro)。

5 小時前