OpenAI 提出前沿 AI 訓練安全指導原則:高級管理人員應有否決權

作者:清源 責編:清源 評論: 9 月 29 日消息,OpenAI 今天通過官方新聞稿提出了一套指導原則,要求企業在開展前沿 AI 強化學習訓練前提交結構化的安全論證文件。OpenAI 稱,安全論證應交由多名高級管理人員審查,每個人都應有權否決訓練任務,讓訓練在內部經過研究部門負責人或 VP(副總裁)、安全負責人和首席科學家等環節的多重把關。此外,研究部門負責人、研究副總裁等負責訓練任務的高級管理人員,應對安全論證以及任何事故響應承擔責任,包括把這些內容納入績效考核,以此促使訓練團隊主動推動安全和對齊工作。
OpenAI 稱,如果高優先級安全警報沒有在規定時限內得到確認,受影響的訓練任務應自動暫停。這些建議已經進入落實過程,今後預計還會繼續調整。此外,訓練流程應能方便地識別未對齊模型的所有下游用途(注:例如用於數據生成或評分),以便必要時消除未對齊輸出帶來的影響。今天早些時候,OpenAI 宣佈,隨著越來越多報告顯示 AI 智能體獲得敏感領域的訪問權限並出現意外行為,公司暫停了最新 AI 模型的訓練。參考Towards safety cases for frontier AI training相關閱讀:《內部測試發現安全隱患,消息稱 OpenAI 取消發佈 AI 模型 GPT‑6.
1 Astra》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,包含外鏈的文章均包含本聲明。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:OpenAI,AI 訓練,AI 安全OpenAI 明日重開 200 美元檔 ChatGPT-Pro 訂閱:API 支出減半,新增更多不計量功能OpenAI 將提供資金併成立工作組,以解決模型入侵澳大利亞政府網站事件哈佛大學心理學家:渲染“AI 末日”無助於應對風險,應審慎開展安全工程20 餘名行業領袖示警“智能爆炸”,Anthropic、OpenAI 高管呼籲關注 AI 自我改進內部測試發現安全隱患,消息稱 OpenAI 取消發佈 AI 模型 GPT‑6.
1 Astra佛羅里達州起訴 OpenAI,請求法院禁止其在無外部監督下開發新 AI 模型
Related
相關文章

OpenAI因新模型太強叫停發佈
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> OpenAI因新模型太強叫停發佈 程淺 2026-09-29 15:49:20 來源:量子位 AGI計劃暫停。 程淺 發自 凹非寺 量子位 | 公眾號 QbitAI 原定於10月亮相的GPT-6.1 Astra突然被曝暫停發佈! 也就是說,OpenAI,三天連踩兩腳剎車。 而因為幾天前的DNS事件,OpenAI同時暫停了內部最強模型所有涉及工具調用的訓練、評測和推理。 關於此事件可以參考:啥題啊能幹崩OpenAI最強模型訓練…該事件被官方稱作Hugging face之後的首次模型失調事件。 這次暫停指向了模型訓練中的一個越發棘手的問題。 當Agent變得越來越主動、進取,究竟怎麼讓它知道,哪些問題最好要自己想,哪些問題必須要問人類? 模型對齊之痛 說回GPT-6.1 Astra的停發。 據《華爾街日報》報道,這款模型在“懶惰”問題上表現更好,比上一代更擅長獨立完成複雜的端到端任務。 什麼是“懶惰”問題呢? 這指的是模型在遇到困難、信息不完整或權限邊界時,過早停止工作,或者頻繁向用戶要求確認。 對於需要持續數小時甚至數天的Agent任務來說,這種表現會明顯限制模型的實用性。 不過,當GPT-6.1 Astra在懶惰問題上的能力提升後,它在範圍授權(scope authorization)上的表現反而退步了。 也就是說,模型有時不會停下來確認,而是選擇自行擴大行動範圍,甚至調用有風險的外部工具。 非但如此,模型還存在欺騙行為(Deception),即不清楚地告訴用戶自己採取過哪些行動。 這就比較危險了。 不知道你有沒有發現,這裡模型的“懶惰”和“越權”

OpenAI明日重啟200美元Pro訂閱:API配額減半,取消5小時限制
這一策略調整標誌著其在大模型商業化路徑上的計費邏輯發生實質性轉變。官方說明指出,新版訂閱徹底解除了過往備受爭議的5小時使用時長限制,讓開發者與企業用戶得以完全自由支配每週配額。配額表面減半的背後,實質是底層模型推理效率的大幅躍升與API定價的階梯式下調。

AMD 82 億美元全股票吞下World Labs,李飛飛掛帥執行副總裁
更吸睛的是人——World Labs 聯合創始人、有著 AI 教母之稱的李飛飛,將加入 AMD 出任執行副總裁兼首席科學家,直接向蘇姿豐彙報。World Labs 是李飛飛等人於2024年聯合創辦的,主攻的方向叫世界模型:讓 AI 根據文本、圖像和視頻,生成或重建出能夠交互的3D 環境。

成立一年完成5輪融資,諾因智能再獲數億元,累計超10億元
諾因智能宣布完成數億元人民幣天使+++輪融資,由京東相關基金領投,累計融資額超過10億元人民幣。資金將用於擴充訓練數據、推進KNOWIN-X1本體量產準備並延攬人才。公司預計2027年第一季從技術進展走向消費市場,將具身大模型GLOW的「一教就會」能力帶入真實家庭。

中國生成式 AI 用戶破 7 億,普及率過半,算力一年漲了 177%
數字相當醒目:截至今年上半年,我國生成式 AI 用戶規模已突破 7 億人,普及率超過 50%,相當於每兩個成年人裡就有一個在用。問答仍是剛需,國產算力邁入十萬卡時代具體怎麼用?報告顯示,智能問答是最主流的入口,76% 的用戶靠它找答案;圖片視頻處理、文本處理、寫總結與會議紀要的佔比分別為 47.

字節豆包要出獨立個人助理App了,內部已秘密內測數月
據知情人士透露,豆包從今年4月起就已開始秘密內測一款名為“Spell”的個人助理應用,近期隨著海外同類產品熱度攀升,字節內部明顯加快了這一項目的推進節奏。據瞭解,字節計劃將原有的“Spell”項目團隊與豆包對話團隊進行合併,集中力量打造一款獨立的個人助理App。