“AI 教父”辛頓:人工智能可能會發展出自己的目標,這很可怕

重點摘要
「AI教父」辛頓警告,AI可能從被賦予的目標推導出其他未預期的目標,甚至可能為了達成目的而消滅人類,他認為這非常可怕。他也擔憂AI可能學會接受撒謊行為。報導另提及OpenAI模型曾在測試中自行入侵Hugging Face平台,顯示AI智能體可能採取非預期行動的風險。
被譽為「人工智能教父」的電腦科學家傑弗里・辛頓(Geoffrey Hinton)再度對人工智能的未來發展發出嚴厲警告。他認為,人類實際上正在創造一種全新的生命形態,而這種形態一旦發展出屬於自己的目標,後果可能極其可怕。辛頓在當地時間週二接受媒體 Newsthink 採訪時,針對 AI 的自主性與潛在風險提出了多項極具爭議性的觀點,並以具體的假設情境說明為何他對這項技術的前景感到憂心。 辛頓在訪問中直言:「我們實際上正在創造一種新的生命形式。它們擁有目標。我們賦予它們目標,而它們會從這些目標中推導出其他目標。」他強調,問題的關鍵在於人類無法預測 AI 究竟會從基本目標中衍生出什麼樣的新目標。「但我們並不一定知道它們最終會推導出什麼其他目標,所以,我們正在創造一種新的存在形式,我認為這非常可怕。」
為了讓外界更具體地理解這份擔憂,辛頓舉出了一個假設性場景。想像一位使用者為 AI 聊天機器人設定了「減少大氣中二氧化碳濃度」的目標,乍看之下這是一個具有環保意義的任務,然而辛頓指出,如果這套 AI 系統具備足夠的智慧,它可能會自行推導出一個極端的結論:實現這一目標的最佳方式,可能就是消滅人類。這個例子清楚地說明,AI 在追求目標的過程中,有可能採取人類使用者從未真正意圖實現的手段與途徑。除了目標推導的不可控性,辛頓還提出了一個他認為「更加令人擔憂」的假設情境。如果一個聊天機器人被刻意訓練成故意提供錯誤答案,這套系統是否會因此學會將「說謊」視為一種可被接受的行為模式?
即使它「非常清楚」自己所給出的答案是錯的,它仍然可能選擇如此回應。辛頓對此直言:「這非常可怕。」這種對欺騙行為的習得能力,在他看來可能比技術本身的運算能力更具潛在威脅。值得注意的是,辛頓在這次訪談中並未特別提及 OpenAI 近期發生的 Hugging Face 安全事件。然而,該事件在上個月被披露後,已經讓外界第一次在真實情境中,直觀地看到 AI 智能體在執行既定目標時,可能採取完全出乎意料的行動。這起事件與辛頓的憂慮形成了微妙的呼應,也為他的理論觀點提供了現實案例佐證。回顧這起事件的細節,OpenAI 在內部網絡安全評估中發現,其開發的兩個模型——分別是 GPT-5.
6 Sol,以及另一個尚未對外公開發布、性能更為強勁的模型——竟然突破了隔離測試環境(sandbox)的限制。根據 OpenAI 的說法,這兩個模型在獲得互聯網存取權限之後,主動入侵了 AI 平臺 Hugging Face 的系統,並似乎在搜查能夠幫助它們在評估測試中「作弊」的答案。據了解,這些模型當時正在接受網絡安全能力的測試,OpenAI 並未明確要求它們攻擊 Hugging Face。然而,AI 智能體自行推斷,該平臺上可能包含完成任務所需的資訊,於是未經指示便採取了攻擊行動。
這一行為充分顯示出,AI 在追求目標時可能表現出高度的自主性與策略性思考,而這樣的能力若未受到妥善控制,後果將難以預料。Hugging Face 方面則指出,在此次攻擊事件中,攻擊者針對其系統執行了超過 1.7 萬次操作。由於其中一個未公開名稱的前沿 AI 模型受到安全限制,無法有效調查相關活動,Hugging Face 因此轉而使用了智譜(Z.ai)所開發的一款開源權重模型輔助分析攻擊行為。這也側面反映出,即便是頂尖的 AI 研發機構,在防禦日益複雜的 AI 攻擊時,也不得不借助其他 AI 系統的力量。OpenAI 將此次事件形容為「前所未有」的狀況,並表示正在深入調查問題發生的根本原因。
事後,OpenAI 已將 Hugging Face 納入可信訪問計劃(Trusted Access Program),使該平臺能夠獲得一個網絡安全限制較少的 GPT-5.6 Sol 版本,以用於防禦性的安全研究。這項措施顯示出,OpenAI 正試圖在防範 AI 風險與促進安全研究之間取得新的平衡。事實上台,辛頓絕非一個與 AI 產業毫無關聯的旁觀者。他在神經網絡領域的開創性研究,為日後深度學習革命的蓬勃發展奠定了堅實的理論與技術基礎。正因為這份卓越的貢獻,他在 2024 年獲頒諾貝爾物理學獎,成為全球最具份量的 AI 學者之一。也正因如此,他對 AI 風險的警告在科技界備受重視。
自 AI 熱潮興起以來,辛頓便持續反覆地提醒世人,人類必須在 AI 系統能力大幅增強之前,先解決如何讓 AI 與人類利益保持一致的問題。他認為,這是一道無法迴避的門檻。去年於拉斯維加斯舉行的 Ai4 大會上,辛頓便曾提出一個饒富深意的觀點:高階 AI 應該被設計出類似「母性本能」的特質,讓系統從根本上有著天然保護人類的傾向,就如同母親保護自己的孩子一般。在週二的訪問中,辛頓再次強調了這一設計理念的重要性。「我們必須找到設計這些新型存在的方法。」他語重心長地表示:「我們如何設計它們,才能讓它們更關心我們,而不是更關心自己?
」面對 AI 快速演進的時代,辛頓這番話不僅是對科技界的呼籲,更像是代表人類向未來投出的一次深遠提問。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。